RL
Optimizer step
Submits an optimizer step operation that will asynchronously apply accumulated gradients to update model parameters.
post/rl/training-sessions/{session_id}/operations/optim-step
Path parameters
session_idstring required
Training session ID
Request body
Example request
{
"adam_params": {
"learning_rate": 0.0001,
"beta1": 0.9,
"beta2": 0.95,
"eps": 1e-8,
"weight_decay": 0.1,
"grad_clip_norm": 10
},
"muon_params": {
"learning_rate": 0.02,
"momentum": 0.95,
"newton_schulz_steps": 5,
"grad_clip_norm": 10,
"adam": {
"learning_rate": 0.0001,
"beta1": 0.9,
"beta2": 0.95,
"eps": 1e-8,
"weight_decay": 0.1,
"grad_clip_norm": 10
}
}
}Response
Optimizer step operation details
Example response
{
"id": "550e8400-e29b-41d4-a716-446655440000",
"error": {
"message": "Operation timed out"
}
}