RL
Forward-backward pass
Submits a forward-backward pass operation that will asynchronously compute gradients via backpropagation.
post/rl/training-sessions/{session_id}/operations/forward-backward
Path parameters
session_idstring required
Training session ID
Request body
Example request
{
"samples": [
{
"model_input": {
"chunks": [
{
"encoded_text": {
"tokens": [
123,
456,
789
]
}
}
]
},
"loss_inputs": {
"target_tokens": {
"data": [
123,
456,
789
]
},
"weights": {
"data": [
0,
0,
1
]
},
"grpo_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
},
"reference_logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"importance_sampling_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"ppo_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"cispo_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"dro_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
}
},
"policy_segments": [
{
"version": 5
}
]
}
],
"loss": {
"grpo_params": {
"clip_low_threshold": 0.8,
"clip_high_threshold": 1.2,
"beta": 0.1
},
"ppo_params": {
"clip_low_threshold": 0.8,
"clip_high_threshold": 1.2
},
"cispo_params": {
"clip_high_threshold": 4
},
"dro_params": {
"beta": 0.05
}
}
}Response
Example response
{
"id": "550e8400-e29b-41d4-a716-446655440000",
"output": {
"loss": 2.345,
"metrics": {
"loss/clip/high_fraction": 0.1,
"loss/kl_ref/mean": 0.05
}
},
"error": {
"message": "Operation timed out"
}
}