# tinker_cookbook.distillation.train_on_policy.Config ## *class* [**tinker_cookbook.distillation.train_on_policy.Config**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L134)() **Fields:** - [**learning_rate**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L135) (*float*) - [**dataset_configs**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L136) (*list\[[DistillationDatasetConfig](https://tinker-docs.thinkingmachines.ai/cookbook/api-reference/distillation/distillationdatasetconfig/index.md)\]*) - [**model_name**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L137) (*str*) - [**recipe_name**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L138) (*str*) - [**renderer_name**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L139) (*str | None*, default: `None`) - [**max_tokens**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L140) (*int*) - [**temperature**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L141) (*float*, default: `1.0`) - [**compute_post_kl**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L142) (*bool*, default: `False`) - [**evaluator_builders**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L143) (*list[SamplingClientEvaluatorBuilder]*, default: `[]`) - [**lora_rank**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L144) (*int*, default: `32`) - [**kl_penalty_coef**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L146) (*float*, default: `1.0`) - [**kl_discount_factor**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L147) (*float*, default: `0.0`) - [**loss_fn**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L151) (*LossFnType*, default: `'importance_sampling'`) – See https://tinker-docs.thinkingmachines.ai/losses - [**loss_fn_config**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L152) (*dict[str, Any] | None*, default: `None`) - [**num_substeps**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L156) (*int*, default: `1`) – Useful for very large batch sizes. - [**wandb_project**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L158) (*str | None*, default: `None`) - [**wandb_name**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L159) (*str | None*, default: `None`) - [**log_path**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L161) (*str*) - [**base_url**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L162) (*str | None*, default: `None`) - [**enable_trace**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L163) (*bool*, default: `False`) - [**span_chart_every**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L164) (*int*, default: `0`) - [**eval_every**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L166) (*int*, default: `20`) - [**save_every**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L167) (*int*, default: `20`) - [**load_checkpoint_path**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L168) (*str | None*, default: `None`) - [**max_steps**](https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/distillation/train_on_policy.py#L171) (*int | None*, default: `None`) – Maximum number of training steps. If None, train on the full dataset.