Add per-model YAML configs and MODEL_NAME_MAPPING entries for all 8 Gemma 4 models (4 instruct + 4 base): - gemma-4-31B-it / gemma-4-31B - gemma-4-26B-A4B-it / gemma-4-26B-A4B - gemma-4-E2B-it / gemma-4-E2B - gemma-4-E4B-it / gemma-4-E4B GGUF variants (only for -it models) resolve via the gemma-4 family entry in inference_defaults.json. Sampling defaults: temperature=1.0, top_p=0.95, top_k=64, min_p=0.0, no repetition or presence penalty. Matches gemma-3n and gemma-3.
47 lines
968 B
YAML
47 lines
968 B
YAML
# Model defaults for unsloth/gemma-4-31B (base/pretrained)
|
|
# Also applies to: google/gemma-4-31B
|
|
|
|
training:
|
|
trust_remote_code: false
|
|
max_seq_length: 2048
|
|
num_epochs: 0
|
|
learning_rate: 2e-4
|
|
batch_size: 2
|
|
gradient_accumulation_steps: 4
|
|
warmup_steps: 5
|
|
max_steps: 30
|
|
save_steps: 30
|
|
weight_decay: 0.001
|
|
random_seed: 3407
|
|
packing: false
|
|
train_on_completions: true
|
|
gradient_checkpointing: "unsloth"
|
|
optim: "adamw_8bit"
|
|
lr_scheduler_type: "linear"
|
|
|
|
lora:
|
|
lora_r: 8
|
|
lora_alpha: 8
|
|
lora_dropout: 0.0
|
|
target_modules:
|
|
- "all-linear"
|
|
use_rslora: false
|
|
use_loftq: false
|
|
finetune_vision_layers: true
|
|
finetune_language_layers: true
|
|
finetune_attention_modules: true
|
|
finetune_mlp_modules: true
|
|
|
|
logging:
|
|
enable_wandb: false
|
|
wandb_project: "llm-finetuning"
|
|
enable_tensorboard: false
|
|
tensorboard_dir: "runs"
|
|
log_frequency: 10
|
|
|
|
inference:
|
|
trust_remote_code: false
|
|
temperature: 1.0
|
|
top_p: 0.95
|
|
top_k: 64
|
|
min_p: 0.0
|