v8

latestOpenAPI 3.0.3raw.githubusercontent.com2026-08-0142317.7 KB

Raw logits from a single prefill-only forward pass

Runs one non-autoregressive forward pass over pre-tokenized input and returns the raw LM-head logits. This is NOT the OpenAI generative logprobs semantics — no sampling or decode loop runs. Intended for on-target accuracy metrics (perplexity, MMLU, MMMU). Input is pre-tokenized (input_ids); the server does not tokenize text here.

post/v1/logits

Request body

modelstring required
input_idsinteger[] required

Pre-tokenized token ids; the caller owns any special tokens.

last_onlyboolean

false (default): every position. true: last token's row only.

top_ninteger

Keep only the top-N logits per row (default 20). 0 returns the full vocabulary per row.

nctxinteger
nglinteger
computestring

Example request

{
  "model": "qualcomm/Qwen3-4B-Instruct-2507",
  "input_ids": [
    1,
    2,
    3,
    4
  ],
  "last_only": false,
  "top_n": 20
}

Response

Successful response

modelstring
n_rowsinteger
vocab_sizeinteger
top_ninteger

Effective top-N used (0 means full vocabulary per row).