From e2b7b4b54cfe13c6fe9acc7aec020fba9daba200 Mon Sep 17 00:00:00 2001 From: Roland Tannous Date: Thu, 19 Feb 2026 06:02:16 +0000 Subject: [PATCH] change train_on_completions to true --- studio/backend/assets/configs/model_defaults/default.yaml | 2 +- .../model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml | 2 +- .../model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml | 2 +- .../model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml | 2 +- .../model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml | 2 +- .../assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml | 2 +- .../configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml | 2 +- .../configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml | 2 +- .../configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml | 2 +- .../configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml | 2 +- .../configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml | 2 +- .../configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml | 2 +- .../configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml | 2 +- .../llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml | 2 +- .../model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml | 2 +- .../model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml | 2 +- .../model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml | 2 +- .../llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml | 2 +- .../llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml | 2 +- .../llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml | 2 +- .../model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml | 2 +- .../assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml | 2 +- .../mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml | 2 +- .../mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml | 2 +- .../mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml | 2 +- .../mistral/unsloth_Mistral-Small-Instruct-2409.yaml | 2 +- .../model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml | 2 +- .../mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml | 2 +- .../mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml | 2 +- .../model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml | 2 +- .../assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml | 2 +- .../assets/configs/model_defaults/other/sesame_csm-1b.yaml | 2 +- .../configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml | 2 +- .../other/unsloth_answerdotai_ModernBERT-large.yaml | 2 +- .../configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml | 2 +- .../model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml | 2 +- .../configs/model_defaults/other/unsloth_whisper-large-v3.yaml | 2 +- .../model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml | 2 +- .../model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml | 2 +- .../configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml | 2 +- .../assets/configs/model_defaults/phi/unsloth_Phi-4.yaml | 2 +- .../assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml | 2 +- .../model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml | 2 +- .../model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml | 2 +- .../assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml | 2 +- .../qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml | 2 +- .../model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml | 2 +- .../qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml | 2 +- .../qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml | 2 +- .../assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml | 2 +- .../qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml | 2 +- .../assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml | 2 +- .../assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml | 2 +- .../model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml | 2 +- .../qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml | 2 +- 55 files changed, 55 insertions(+), 55 deletions(-) diff --git a/studio/backend/assets/configs/model_defaults/default.yaml b/studio/backend/assets/configs/model_defaults/default.yaml index 7b918b9387..ceb332bc14 100644 --- a/studio/backend/assets/configs/model_defaults/default.yaml +++ b/studio/backend/assets/configs/model_defaults/default.yaml @@ -14,7 +14,7 @@ training: weight_decay: 0.01 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml b/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml index ef417c8410..1032449e8c 100644 --- a/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml +++ b/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml index d45526bcf7..eafc7065d5 100644 --- a/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.01 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: false optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml index 185b91ecf4..c4c73ac028 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml index f3ed24fd2e..55f503d11b 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml @@ -14,7 +14,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml index 70c86dad1b..9374a2cc82 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.01 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml index ccdc19111e..f1aa18e9d2 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml index db1db080a8..e1ed581ca4 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml index a4130eb8b7..bf7457831e 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml index f679b86b81..5f0a7b26ce 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: true optim: "adamw_torch_fused" lr_scheduler_type: "cosine" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml index 23ef35603d..74c58d139d 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml index ebad334d5e..1ca686aea7 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: true optim: "adamw_torch_fused" lr_scheduler_type: "cosine" diff --git a/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml b/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml index da41fb3009..f8a8f5a3c9 100644 --- a/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml +++ b/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml index 6d9f2c8ccb..1a7a91e56f 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml index e00d5b4cb4..61a2033ee8 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.01 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: true optim: "adamw_torch" lr_scheduler_type: "cosine" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml index ad427a345a..7117aa5ec0 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml index 8d676bbbc9..7d998ed1c8 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml index 6b3158da02..633869022a 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml index dcf5a5f702..cbf432dacb 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml index d2e398d03d..f148814e96 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml index ad3bd0b879..bb235595f6 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml b/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml index 41217c6c9f..b315a9aaf7 100644 --- a/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml +++ b/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml index 882395745c..2d4832e839 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml index 4c7ead9985..ca6609cda8 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml index 99fc67dcff..934959fc83 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml index e0146c374e..1d712a6c8f 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml index 828ba79c76..bcd0d20c8c 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "paged_adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml index 74527b21af..a02f8db2f3 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml index 26810445bf..c0762d9864 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml @@ -14,7 +14,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml b/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml index 9db476f4dc..7a594b7eaf 100644 --- a/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml +++ b/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml b/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml index bf6b1f7247..3c8215ba25 100644 --- a/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml +++ b/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml b/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml index 803eeebb75..d3249ef257 100644 --- a/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml +++ b/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml index a971f080b6..e1fbc08e4d 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml index c79841390d..bb30a2052c 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml @@ -14,7 +14,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml index de5fb640ba..94596b65b8 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml index dd4525bba3..d35ac75b81 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.1 random_seed: 3407 packing: true - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml index f0c49f363d..3a97baebd9 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml index c39368fbd2..3c428c3406 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml index 076165c12a..8e13ef8a45 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml index 91d53180fa..4d67de8bab 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml index 3b829649a8..9159ce4dc7 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml index 56d4f35998..e0aff114ca 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml index 86cb03ff25..6cee3d0949 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml index 3a3259c8fd..1034f6d37f 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 42 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml index 2a8f023e76..876514e456 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml index a92d0d6047..d41e70d25f 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml index eff25af51c..4af3af5dfc 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "paged_adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml index 3ab14078a9..ca1b355c40 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml @@ -15,7 +15,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml index 4cfa83f853..bd54b1d015 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml index d8f9d3a73b..b1179b2ce6 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml index 7f66711413..77d7c8527e 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml index 0f3403e09e..7b92c767de 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml index f019922017..15e8dab80e 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml index a8552cc85c..2724719294 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear" diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml index 5530047541..5b47c3bdd2 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml @@ -16,7 +16,7 @@ training: weight_decay: 0.001 random_seed: 3407 packing: false - train_on_completions: false + train_on_completions: true gradient_checkpointing: "unsloth" optim: "adamw_8bit" lr_scheduler_type: "linear"