v44

latestOpenAPI 3.1.0Proprietaryraw.githubusercontent.com2026-05-192301780.0 KB
LLMs

Chat completions

Create a completion for the provided prompt and parameters. Compatible with OpenAI's chat completions API. Supports 40+ models including GPT-4, Claude, Gemini, and CaseMark legal AI models. Includes streaming support, token counting, and usage tracking.

post/llm/v1/chat/completions

Request body

modelstring

Model to use for completion. Defaults to casemark/core-large if not specified

max_tokensinteger

Maximum number of tokens to generate

temperaturenumber

Sampling temperature between 0 and 2

streamboolean

Whether to stream back partial progress

casemark_show_reasoningboolean

CaseMark-only: when true, allows reasoning fields in responses. Defaults to false (reasoning is suppressed).

top_pnumber

Nucleus sampling parameter

frequency_penaltynumber

Frequency penalty parameter

presence_penaltynumber

Presence penalty parameter

Example request

{
  "model": "casemark/core-large",
  "max_tokens": 1000,
  "temperature": 0.7
}

Response

Successful completion response

idstring

Unique identifier for the completion

objectstring
createdinteger

Unix timestamp of completion creation

modelstring

Model used for completion

Example response

{
  "object": "chat.completion"
}