From 299bc65e3666c161206878a032e2b3bdda8ccad5 Mon Sep 17 00:00:00 2001 From: Roland Tannous Date: Tue, 17 Feb 2026 18:46:23 +0000 Subject: [PATCH] chore: override model defaults to use max_steps=30, save_steps=30, num_epochs=0 for testing --- studio/backend/assets/configs/model_defaults/default.yaml | 7 ++++--- .../model_defaults/ernie/unsloth_ERNIE-4.5-21B-A3B-PT.yaml | 7 ++++--- .../ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml | 7 ++++--- .../falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml | 7 ++++--- .../gemma/unsloth_codegemma-7b-bnb-4bit.yaml | 7 ++++--- .../gemma/unsloth_functiongemma-270m-it.yaml | 7 ++++--- .../model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml | 7 ++++--- .../configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml | 7 ++++--- .../model_defaults/gemma/unsloth_gemma-3-270m-it.yaml | 7 ++++--- .../model_defaults/gemma/unsloth_gemma-3-27b-it.yaml | 7 ++++--- .../model_defaults/gemma/unsloth_gemma-3-4b-it.yaml | 7 ++++--- .../model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml | 7 ++++--- .../model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml | 7 ++++--- .../configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml | 7 ++++--- .../model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml | 7 ++++--- .../model_defaults/gpt-oss/unsloth_gpt-oss-20b.yaml | 7 ++++--- .../granite/unsloth_granite-4.0-350m-unsloth-bnb-4bit.yaml | 7 ++++--- .../granite/unsloth_granite-4.0-h-micro.yaml | 7 ++++--- .../llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml | 7 ++++--- .../llama/unsloth_Llama-3.2-1B-Instruct.yaml | 7 ++++--- .../llama/unsloth_Llama-3.2-3B-Instruct.yaml | 7 ++++--- .../llama/unsloth_Llama-3.3-70B-Instruct.yaml | 7 ++++--- .../llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml | 7 ++++--- .../llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml | 7 ++++--- .../llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml | 7 ++++--- .../model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml | 7 ++++--- .../configs/model_defaults/llasa/unsloth_Llasa-3B.yaml | 7 ++++--- .../unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml | 7 ++++--- .../mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml | 7 ++++--- .../mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml | 7 ++++--- .../mistral/unsloth_Mistral-Small-Instruct-2409.yaml | 7 ++++--- .../model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml | 7 ++++--- .../mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml | 7 ++++--- .../mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml | 7 ++++--- .../model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml | 7 ++++--- .../configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml | 7 ++++--- .../assets/configs/model_defaults/other/sesame_csm-1b.yaml | 7 ++++--- .../configs/model_defaults/other/unsloth_LFM2-1.2B.yaml | 7 ++++--- .../other/unsloth_Nemotron-3-Nano-30B-A3B.yaml | 7 ++++--- .../configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml | 7 ++++--- .../other/unsloth_answerdotai_ModernBERT-large.yaml | 7 ++++--- .../model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml | 7 ++++--- .../model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml | 7 ++++--- .../model_defaults/other/unsloth_whisper-large-v3.yaml | 7 ++++--- .../phi/unsloth_Phi-3-medium-4k-instruct.yaml | 7 ++++--- .../model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml | 7 ++++--- .../model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml | 7 ++++--- .../assets/configs/model_defaults/phi/unsloth_Phi-4.yaml | 7 ++++--- .../configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml | 7 ++++--- .../model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml | 7 ++++--- .../model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml | 7 ++++--- .../configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml | 7 ++++--- .../qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml | 7 ++++--- .../qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml | 7 ++++--- .../qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml | 7 ++++--- .../qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml | 7 ++++--- .../configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml | 7 ++++--- .../qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml | 7 ++++--- .../configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml | 7 ++++--- .../configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml | 7 ++++--- .../qwen/unsloth_Qwen3-4B-Instruct-2507.yaml | 7 ++++--- .../qwen/unsloth_Qwen3-4B-Thinking-2507.yaml | 7 ++++--- .../unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml | 7 ++++--- 63 files changed, 252 insertions(+), 189 deletions(-) diff --git a/studio/backend/assets/configs/model_defaults/default.yaml b/studio/backend/assets/configs/model_defaults/default.yaml index 3a2563a6f9..7b918b9387 100644 --- a/studio/backend/assets/configs/model_defaults/default.yaml +++ b/studio/backend/assets/configs/model_defaults/default.yaml @@ -3,13 +3,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 5e-5 batch_size: 2 gradient_accumulation_steps: 4 warmup_ratio: 0.1 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.01 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-21B-A3B-PT.yaml b/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-21B-A3B-PT.yaml index 627d71b3fa..79ee761784 100644 --- a/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-21B-A3B-PT.yaml +++ b/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-21B-A3B-PT.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 4 gradient_accumulation_steps: 2 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml b/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml index d2aeb9492e..ef417c8410 100644 --- a/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml +++ b/studio/backend/assets/configs/model_defaults/ernie/unsloth_ERNIE-4.5-VL-28B-A3B-PT.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 2 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml index 2d3cfc1325..d45526bcf7 100644 --- a/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/falcon/tiiuae_Falcon-H1-0.5B-Instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 8 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.01 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml index c6bef5077e..185b91ecf4 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_codegemma-7b-bnb-4bit.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 4096 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_functiongemma-270m-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_functiongemma-270m-it.yaml index d67877d167..2ef5798946 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_functiongemma-270m-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_functiongemma-270m-it.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 4096 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 4 gradient_accumulation_steps: 2 warmup_steps: 10 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml index 899cdc01c7..f3ed24fd2e 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-27b-bnb-4bit.yaml @@ -3,13 +3,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml index d56d64e9de..70c86dad1b 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-2-2b.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.01 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml index d4108fefb0..ccdc19111e 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-270m-it.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 5e-5 batch_size: 4 gradient_accumulation_steps: 1 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml index 0f213edb70..db1db080a8 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-27b-it.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml index d7da7a2873..a4130eb8b7 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-it.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml index b0833e6e30..f679b86b81 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3-4b-pt.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 2 + # num_epochs: 2 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_ratio: 0.03 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml index 7fe1fed620..23ef35603d 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B-it.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 1024 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml index 3b1fab2a60..ebad334d5e 100644 --- a/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml +++ b/studio/backend/assets/configs/model_defaults/gemma/unsloth_gemma-3n-E4B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 2 + # num_epochs: 2 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_ratio: 0.03 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml b/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml index 93a8d8b274..da41fb3009 100644 --- a/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml +++ b/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-120b.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 4096 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 4 gradient_accumulation_steps: 1 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-20b.yaml b/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-20b.yaml index 18f8f7bf47..00bacb118a 100644 --- a/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-20b.yaml +++ b/studio/backend/assets/configs/model_defaults/gpt-oss/unsloth_gpt-oss-20b.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 1024 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-350m-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-350m-unsloth-bnb-4bit.yaml index 9b91ec531a..dd3a652529 100644 --- a/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-350m-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-350m-unsloth-bnb-4bit.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-h-micro.yaml b/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-h-micro.yaml index e6603b0cea..064b9b0ceb 100644 --- a/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-h-micro.yaml +++ b/studio/backend/assets/configs/model_defaults/granite/unsloth_granite-4.0-h-micro.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml index 640ab85b14..6d9f2c8ccb 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-11B-Vision-Instruct.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml index 1622d42bef..e00d5b4cb4 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-1B-Instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 5 + # num_epochs: 5 + num_epochs: 0 learning_rate: 2e-5 batch_size: 1 gradient_accumulation_steps: 8 warmup_steps: 0 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.01 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml index 18e9428e5e..ad427a345a 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.2-3B-Instruct.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml index 8bd5c2f4dc..8d676bbbc9 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Llama-3.3-70B-Instruct.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml index 411d7c2df8..6b3158da02 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-70B-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml index 5ba7d7b827..dcf5a5f702 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_Meta-Llama-3.1-8B-Instruct-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 8192 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml index aa5aeb178b..d2e398d03d 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-Instruct-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml index be515b0bc3..ad3bd0b879 100644 --- a/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/llama/unsloth_llama-3-8b-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml b/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml index 627adfe491..41217c6c9f 100644 --- a/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml +++ b/studio/backend/assets/configs/model_defaults/llasa/unsloth_Llasa-3B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 5e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml index 9af6fbd3a0..882395745c 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Magistral-Small-2509-unsloth-bnb-4bit.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 2 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml index d701390da9..4c7ead9985 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Ministral-3-3B-Instruct-2512.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 4 gradient_accumulation_steps: 2 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml index d1374cc49e..99fc67dcff 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Nemo-Base-2407-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml index 597cf612fe..e0146c374e 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Mistral-Small-Instruct-2409.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml index 9cb15ea2ff..828ba79c76 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_Pixtral-12B-2409.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml index 384de103d0..74527b21af 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-instruct-v0.3-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml index fe288786aa..26810445bf 100644 --- a/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/mistral/unsloth_mistral-7b-v0.3-bnb-4bit.yaml @@ -3,13 +3,14 @@ # Also applies to: "unsloth/mistral-7b-v0.3", "mistralai/Mistral-7B-v0.3", training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml b/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml index fe0940ddc4..9db476f4dc 100644 --- a/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml +++ b/studio/backend/assets/configs/model_defaults/other/OuteAI_Llama-OuteTTS-1.0-1B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml b/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml index 02fb108b95..bf6b1f7247 100644 --- a/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml +++ b/studio/backend/assets/configs/model_defaults/other/Spark-TTS-0.5B_LLM.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml b/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml index a01e10971b..803eeebb75 100644 --- a/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml +++ b/studio/backend/assets/configs/model_defaults/other/sesame_csm-1b.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_LFM2-1.2B.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_LFM2-1.2B.yaml index 2eb6246c23..598d80da55 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_LFM2-1.2B.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_LFM2-1.2B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_Nemotron-3-Nano-30B-A3B.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_Nemotron-3-Nano-30B-A3B.yaml index 0b1b60feac..c212b0508a 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_Nemotron-3-Nano-30B-A3B.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_Nemotron-3-Nano-30B-A3B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 4 gradient_accumulation_steps: 2 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml index 916333c174..a971f080b6 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_PaddleOCR-VL.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 5e-5 batch_size: 4 gradient_accumulation_steps: 2 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml index 3b886fb3b9..c79841390d 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_answerdotai_ModernBERT-large.yaml @@ -3,13 +3,14 @@ training: max_seq_length: 2048 - num_epochs: 1 + # num_epochs: 1 + num_epochs: 0 learning_rate: 5e-5 batch_size: 32 gradient_accumulation_steps: 1 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml index 3079b407df..de5fb640ba 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_orpheus-3b-0.1-ft.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml index f5f7ae79c3..dd4525bba3 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_tinyllama-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 4096 - num_epochs: 1 + # num_epochs: 1 + num_epochs: 0 learning_rate: 2e-5 batch_size: 2 gradient_accumulation_steps: 4 warmup_ratio: 0.1 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.1 random_seed: 3407 packing: true diff --git a/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml b/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml index 3b1c82ab0a..f0c49f363d 100644 --- a/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml +++ b/studio/backend/assets/configs/model_defaults/other/unsloth_whisper-large-v3.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 448 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 1e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml index 5968e9aea8..c39368fbd2 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3-medium-4k-instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml index 8a2e2ca26e..076165c12a 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-3.5-mini-instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml index 6b41ca81f2..91d53180fa 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4-14B-Instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml index b13fa9a0b7..3b829649a8 100644 --- a/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml +++ b/studio/backend/assets/configs/model_defaults/phi/unsloth_Phi-4.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml index 69dbd27626..56d4f35998 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-7B.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml index b83ca586f5..86cb03ff25 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2-VL-7B-Instruct.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml index 1f08adf6d2..3a3259c8fd 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-1.5B-Instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 4096 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 1e-5 batch_size: 1 gradient_accumulation_steps: 64 warmup_ratio: 0.1 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 42 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml index 31ab069907..2a8f023e76 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-7B.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml index e340ea4573..a92d0d6047 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-1.5B-Instruct.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml index f0a27ac90c..eff25af51c 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-14B-Instruct.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 1 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml index ae62611432..3ab14078a9 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-Coder-7B-Instruct-bnb-4bit.yaml @@ -4,13 +4,14 @@ training: max_seq_length: 32768 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml index 930f352dd6..4cfa83f853 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen2.5-VL-7B-Instruct-bnb-4bit.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml index bf19fad0bd..d8f9d3a73b 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-0.6B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 1024 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 5e-5 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml index fe519f49a7..7f66711413 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B-Base-unsloth-bnb-4bit.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml index 662b96c5fe..0f3403e09e 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-14B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml index 83ac11efda..f019922017 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-32B.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml index 7178b86e7a..a8552cc85c 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Instruct-2507.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Thinking-2507.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Thinking-2507.yaml index 0385f1d00d..0808510982 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Thinking-2507.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-4B-Thinking-2507.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false diff --git a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml index 8db73bbdc2..5530047541 100644 --- a/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml +++ b/studio/backend/assets/configs/model_defaults/qwen/unsloth_Qwen3-VL-8B-Instruct-unsloth-bnb-4bit.yaml @@ -5,13 +5,14 @@ training: max_seq_length: 2048 - num_epochs: 4 + # num_epochs: 4 + num_epochs: 0 learning_rate: 2e-4 batch_size: 2 gradient_accumulation_steps: 4 warmup_steps: 5 - max_steps: 0 - save_steps: 0 + max_steps: 30 + save_steps: 30 weight_decay: 0.001 random_seed: 3407 packing: false