Merge pull request #138 from unslothai/fix/reset-max-steps-epoch-defaults

Override Model Defaults for num_epochs and max_steps
This commit is contained in:
Roland Tannous 2026-02-17 22:51:40 +04:00 committed by GitHub
commit c13e1594de
63 changed files with 252 additions and 189 deletions

View file

@ -3,13 +3,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 5e-5
batch_size: 2
gradient_accumulation_steps: 4
warmup_ratio: 0.1
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.01
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 4
gradient_accumulation_steps: 2
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 2
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 8
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.01
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 4096
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 4096
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 4
gradient_accumulation_steps: 2
warmup_steps: 10
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -3,13 +3,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.01
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 5e-5
batch_size: 4
gradient_accumulation_steps: 1
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 2
# num_epochs: 2
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_ratio: 0.03
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 1024
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 2
# num_epochs: 2
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_ratio: 0.03
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 4096
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 4
gradient_accumulation_steps: 1
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 1024
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 5
# num_epochs: 5
num_epochs: 0
learning_rate: 2e-5
batch_size: 1
gradient_accumulation_steps: 8
warmup_steps: 0
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.01
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 8192
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 5e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 2
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 4
gradient_accumulation_steps: 2
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -3,13 +3,14 @@
# Also applies to: "unsloth/mistral-7b-v0.3", "mistralai/Mistral-7B-v0.3",
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 4
gradient_accumulation_steps: 2
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 5e-5
batch_size: 4
gradient_accumulation_steps: 2
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -3,13 +3,14 @@
training:
max_seq_length: 2048
num_epochs: 1
# num_epochs: 1
num_epochs: 0
learning_rate: 5e-5
batch_size: 32
gradient_accumulation_steps: 1
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 4096
num_epochs: 1
# num_epochs: 1
num_epochs: 0
learning_rate: 2e-5
batch_size: 2
gradient_accumulation_steps: 4
warmup_ratio: 0.1
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.1
random_seed: 3407
packing: true

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 448
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 1e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 4096
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 1e-5
batch_size: 1
gradient_accumulation_steps: 64
warmup_ratio: 0.1
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 42
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 1
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -4,13 +4,14 @@
training:
max_seq_length: 32768
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 1024
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 5e-5
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false

View file

@ -5,13 +5,14 @@
training:
max_seq_length: 2048
num_epochs: 4
# num_epochs: 4
num_epochs: 0
learning_rate: 2e-4
batch_size: 2
gradient_accumulation_steps: 4
warmup_steps: 5
max_steps: 0
save_steps: 0
max_steps: 30
save_steps: 30
weight_decay: 0.001
random_seed: 3407
packing: false