↓ 16 callersFunctionlm_checkpoint(lm_config, weight='full_sft', model=None, optimizer=None, epoch=0, step=0, wandb=None, save_dir='../checkpoin
trainer/trainer_utils.py:63
↓ 5 callersMethodgenerate(self, inputs=None, attention_mask=None, max_new_tokens=8192, temperature=0.85, top_p=0.85, top_k=50, eos_toke
model/model_minimind.py:257
↓ 3 callersMethodrollout(self, prompt_ids: Tensor, attention_mask: Tensor, num_generations: int, max_new_tokens: int, temperature: flo
trainer/rollout_engine.py:55
↓ 2 callersFunctiongrpo_train_epoch(epoch, loader, iters, rollout_engine, ref_model, reward_model, start_step=0, wandb=None, use_sglang=False)
trainer/train_grpo.py:71
↓ 2 callersFunctionppo_train_epoch(epoch, loader, iters, rollout_engine, ref_model, actor_scheduler, critic_scheduler, reward_model, start_step=
trainer/train_ppo.py:79
↓ 2 callersFunctionrl_train_epoch(epoch, loader, iters, rollout_engine, ref_model, reward_model=None, start_step=0, wandb=None, use_sglang=Fals
trainer/train_agent.py:242
↓ 2 callersFunctiontrain_epoch(epoch, loader, iters, teacher_model, lm_config_student, start_step=0, wandb=None, alpha=0.0, temperature=1.0)
trainer/train_distillation.py:39
↓ 1 callersFunctioncalculate_rewards(prompts, completions, gt_batch, tools_batch, num_gen, reward_model=None, device="cuda", turn_outputs_batch=No
trainer/train_agent.py:188
↓ 1 callersMethodforward(self, input_ids, attention_mask=None, past_key_values=None, use_cache=False, logits_to_keep=0, labels=None, *
model/model_minimind.py:245
↓ 1 callersFunctiongenerate_stream_response(messages, temperature, top_p, max_tokens, tools=None, open_thinking=False)
scripts/serve_openai_api.py:105
↓ 1 callersFunctionrollout_batch(rollout_engine, tokenizer, messages_batch, tools_batch, num_gen, max_turns=3, max_new_tokens=256, thinking_ra
trainer/train_agent.py:159
↓ 1 callersFunctionrollout_single(rollout_engine, tokenizer, messages, tools, max_turns=3, max_new_tokens=256, thinking_ratio=0.5, device="cuda
trainer/train_agent.py:98