RL
Forward pass
Submits a forward operation that will asynchronously run a no-grad forward pass and return per-token log-probabilities for each sample.
post/rl/training-sessions/{session_id}/operations/forward
Path parameters
session_idstring required
Training session ID
Request body
Example request
{
"samples": [
{
"model_input": {
"chunks": [
{
"encoded_text": {
"tokens": [
123,
456,
789
]
}
}
]
},
"loss_inputs": {
"target_tokens": {
"data": [
123,
456,
789
]
},
"weights": {
"data": [
0,
0,
1
]
},
"grpo_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
},
"reference_logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"importance_sampling_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"ppo_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"cispo_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
},
"dro_inputs": {
"advantages": {
"data": [
0.5,
0.5
]
},
"logprobs": {
"data": [
-1.2,
-0.8
]
}
}
},
"policy_segments": [
{
"version": 5
}
]
}
]
}Response
Example response
{
"id": "550e8400-e29b-41d4-a716-446655440000",
"output": {
"logprobs": [
{
"data": [
-1.2,
-0.8,
-1.5,
-0.9,
-1.1
]
}
]
},
"error": {
"message": "Operation timed out"
}
}