algorithm: sft
data:
  default_lang: bam
  eval_ratio: 0.1
  languages:
  - bam
  - bmq
  - boz
  - dtm
  - ful
  - mey
  - kao
  - myk
  - mku
  - spp
  - ses
  - snk
  - taq
  scheme: completion
  source: /tmp/kv-sebeni/sebeni/beni/data/raw/dataset_300_samples.jsonl
distillation:
  backend: algorithmic
  enabled: true
  hitl: false
  model: gemini-2.5-flash
  tau: 0.5
experiment:
  dataset: packaged
  freeze_resources: true
  kveritas: true
  max_eval_rows: 1
  scope: MULTI13
model:
  load_in_4bit: true
  lora_alpha: 32
  lora_dropout: 0.1
  lora_r: 16
  model_name: HuggingFaceTB/SmolLM2-135M
  use_peft: true
project_name: sebeni-multi13
reward:
  format_weight: 0.1
  lang_weight: 0.1
  morph_weight: 0.4
  rule_weight: 0.4
safety:
  enabled: true
  require_model_card: true
  require_safety_snapshot: true
trainer:
  beta: 0.1
  bf16: false
  dataloader_num_workers: 0
  fp16: false
  framework: torch
  gradient_accumulation_steps: 8
  gradient_checkpointing: false
  learning_rate: 5.0e-06
  logging_steps: 1
  lr_scheduler_type: cosine
  max_grad_norm: 0.1
  max_steps: 10
  num_generations: 4
  num_iterations: 1
  num_train_epochs: 1.0
  optim: adamw_torch
  per_device_train_batch_size: 2
  save_steps: 50
  seed: 42
  temperature: 0.9
  top_k: 50
  top_p: 1.0
  use_cpu: false
  warmup_ratio: 0.0
  warmup_steps: 0
  weight_decay: 0.0
wordfreq:
  raw_inputs: null
working_dir: /tmp/kv-sebeni/work/sft
