v1
latestOpenAPI 3.1.0Apache-2.02026-07-1783444.0 KBchat
Create chat completion
This handler performs several key operations:
- Forwards the chat completion request to the inference service
- Signs the response using the node's keystore
- Tracks token usage for the stack
Arguments
- Extension((stack_small_id, estimated_total_tokens)) - Stack ID and estimated tokens count from middleware
- state - Application state containing the inference client and keystore
- payload - The chat completion request body
Returns
Returns a JSON response containing:
- The inference service's response
- A cryptographic signature of the response
Errors
Returns a AtomaServiceError::InternalError if:
- The inference service request fails
- Response parsing fails
- Response signing fails
- Token usage update fails
post/v1/chat/completions
Request body
Example request
{
"max_completion_tokens": 4096,
"max_tokens": 4096,
"model": "meta-llama/Llama-3.3-70B-Instruct",
"n": 1,
"seed": 123,
"temperature": 0.7,
"top_logprobs": 1,
"top_p": 1,
"user": "user-1234"
}Response
Chat completion successful