v3

OpenAPI 3.1.0MIT2026-07-31192456807.8 KB
RL

Forward-backward pass

Submits a forward-backward pass operation that will asynchronously compute gradients via backpropagation.

post/rl/training-sessions/{session_id}/operations/forward-backward

Path parameters

session_idstring required

Training session ID

Request body

Example request

{
  "samples": [
    {
      "model_input": {
        "chunks": [
          {
            "encoded_text": {
              "tokens": [
                123,
                456,
                789
              ]
            }
          }
        ]
      },
      "loss_inputs": {
        "target_tokens": {
          "data": [
            123,
            456,
            789
          ]
        },
        "weights": {
          "data": [
            0,
            0,
            1
          ]
        },
        "grpo_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          },
          "reference_logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "importance_sampling_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "ppo_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "cispo_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        },
        "dro_inputs": {
          "advantages": {
            "data": [
              0.5,
              0.5
            ]
          },
          "logprobs": {
            "data": [
              -1.2,
              -0.8
            ]
          }
        }
      },
      "policy_segments": [
        {
          "version": 5
        }
      ]
    }
  ],
  "loss": {
    "grpo_params": {
      "clip_low_threshold": 0.8,
      "clip_high_threshold": 1.2,
      "beta": 0.1
    },
    "ppo_params": {
      "clip_low_threshold": 0.8,
      "clip_high_threshold": 1.2
    },
    "cispo_params": {
      "clip_high_threshold": 4
    },
    "dro_params": {
      "beta": 0.05
    }
  }
}

Response

idstring required

Operation ID

status'TRAINING_OPERATION_STATUS_UNSPECIFIED' | 'TRAINING_OPERATION_STATUS_PENDING' | 'TRAINING_OPERATION_STATUS_RUNNING' | 'TRAINING_OPERATION_STATUS_COMPLETED' | 'TRAINING_OPERATION_STATUS_FAILED' required

Example response

{
  "id": "550e8400-e29b-41d4-a716-446655440000",
  "output": {
    "loss": 2.345,
    "metrics": {
      "loss/clip/high_fraction": 0.1,
      "loss/kl_ref/mean": 0.05
    }
  },
  "error": {
    "message": "Operation timed out"
  }
}