v2
latestOpenAPI 3.1.02026-08-05267431678.1 KBfelix
Create Evaluation
Create model evaluation job(s) for multiple models and datasets.
Args: request.base_model: Primary model to evaluate (required). request.comparison_models: Optional list of models to compare against. request.dataset_name: Single dataset name (for backward compatibility). request.dataset_names: List of dataset names (creates one evaluation per dataset). request.dataset_version: Optional version (latest if omitted). request.max_tokens: Optional decoder generation cap per example.
This creates evaluation records for each model x dataset combination and triggers async evaluation jobs. Each job runs inference on its dataset and computes metrics.
Returns: EvaluationCreateResponse with list of created evaluations.
post/felix/evaluations
Request body
Response
Successful Response