# Model defaults for unsloth/Qwen3-30B-A3B-Instruct-2507 # Based on Qwen3_MoE.py # Also applies to: Qwen/Qwen3-30B-A3B-Instruct-2507, unsloth/Qwen3-30B-A3B-Instruct-2507-bnb-4bit # MoE model - includes gate_up_proj for MoE layers training: max_seq_length: 2048 # num_epochs: 4 num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 1 warmup_steps: 5 max_steps: 50 save_steps: 50 weight_decay: 0.001 random_seed: 3407 packing: false train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" lora: lora_r: 32 lora_alpha: 64 lora_dropout: 0.0 target_modules: - "q_proj" - "k_proj" - "v_proj" - "o_proj" - "gate_proj" - "up_proj" - "down_proj" - "gate_up_proj" use_rslora: false use_loftq: false use_dora: false logging: enable_wandb: false wandb_project: "llm-finetuning" enable_tensorboard: false tensorboard_dir: "runs" log_frequency: 10 inference: temperature: 0.6 top_k: 20 top_p: 0.95