v4

latestOpenAPI 3.1.0MIT2026-08-04193459793.6 KB
RL

Forward pass

Submits a forward operation that will asynchronously run a no-grad forward pass and return per-token log-probabilities for each sample.

post/rl/training-sessions/{session_id}/operations/forward

Path parameters

session_idstring required

Training session ID

Request body

Example request

{
  "samples": [
    {
      "model_input": {
        "chunks": [
          {
            "encoded_text": {
              "tokens": [
                123,
                456,
                789
              ]
            }
          }
        ]
      },
      "loss_inputs": {
        "target_tokens": {
          "data": [
            123,
            456,
            789
          ]
        },
        "weights": {
          "data": [
            0,
            0,
            1
          ]
        },
        "grpo_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          },
          "reference_logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "importance_sampling_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "ppo_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "cispo_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "dro_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        }
      },
      "policy_segments": [
        {
          "version": 5
        }
      ]
    }
  ]
}

Response

idstring required

Operation ID

status'TRAINING_OPERATION_STATUS_UNSPECIFIED' | 'TRAINING_OPERATION_STATUS_PENDING' | 'TRAINING_OPERATION_STATUS_RUNNING' | 'TRAINING_OPERATION_STATUS_COMPLETED' | 'TRAINING_OPERATION_STATUS_FAILED' required

Example response

{
  "id": "550e8400-e29b-41d4-a716-446655440000",
  "output": {
    "logprobs": [
      {
        "data": [
          -1.2,
          -0.8,
          -1.5,
          -0.9,
          -1.1
        ]
      }
    ]
  },
  "error": {
    "message": "Operation timed out"
  }
}