v32

latestOpenAPI 3.1.0raw.githubusercontent.com2026-05-151,1412,2144.5 MB
Everywhere Inference

Check inference deployment quota

Check if global quota is exceeded, if yes the number of additional quotas needed to create the specified inference deployment will be calculated.

post/cloud/v3/inference/{project_id}/deployments/check_limits

Path parameters

project_idinteger required

Project ID

Example:1

Project ID

Request body

flavor_namestring required

Inference flavor name.

Example request

{
  "containers": [
    {
      "region_id": 1,
      "scale": {
        "max": 3,
        "min": 1
      }
    }
  ],
  "flavor_name": "inference-16vcpu-232gib-1xh100-80gb"
}

Response

OK

inference_cpu_millicore_count_limitinteger

Inference CPU millicore count limit

inference_cpu_millicore_count_requestedinteger

Inference CPU millicore count requested

inference_cpu_millicore_count_usageinteger

Inference CPU millicore count usage

inference_gpu_a100_count_limitinteger

Inference GPU A100 Count limit

inference_gpu_a100_count_requestedinteger

Inference GPU A100 Count requested

inference_gpu_a100_count_usageinteger

Inference GPU A100 Count usage

inference_gpu_h100_count_limitinteger

Inference GPU H100 Count limit

inference_gpu_h100_count_requestedinteger

Inference GPU H100 Count requested

inference_gpu_h100_count_usageinteger

Inference GPU H100 Count usage

inference_gpu_l40s_count_limitinteger

Inference GPU L40s Count limit

inference_gpu_l40s_count_requestedinteger

Inference GPU L40s Count requested

inference_gpu_l40s_count_usageinteger

Inference GPU L40s Count usage

inference_instance_count_limitinteger

Inference instance count limit

inference_instance_count_requestedinteger

Inference instance count requested

inference_instance_count_usageinteger

Inference instance count usage

Example response

{
  "inference_cpu_millicore_count_limit": 8000,
  "inference_cpu_millicore_count_requested": 3000,
  "inference_cpu_millicore_count_usage": 2000,
  "inference_gpu_a100_count_limit": 4,
  "inference_gpu_a100_count_requested": 2,
  "inference_gpu_a100_count_usage": 1,
  "inference_gpu_h100_count_limit": 4,
  "inference_gpu_h100_count_requested": 2,
  "inference_gpu_h100_count_usage": 1,
  "inference_gpu_l40s_count_limit": 4,
  "inference_gpu_l40s_count_requested": 2,
  "inference_gpu_l40s_count_usage": 1,
  "inference_instance_count_limit": 10,
  "inference_instance_count_requested": 1,
  "inference_instance_count_usage": 1
}