63 changed files with
252 additions and
189 deletions
|
|
|
|
@ -3,13 +3,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 5e-5
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_ratio: 0.1
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.01
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 8
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.01
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 4096
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 4096
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 10
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -3,13 +3,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.01
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 5e-5
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 1
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 2
|
|
|
|
|
# num_epochs: 2
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_ratio: 0.03
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 1024
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 2
|
|
|
|
|
# num_epochs: 2
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_ratio: 0.03
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 4096
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 1
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 1024
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 5
|
|
|
|
|
# num_epochs: 5
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-5
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 8
|
|
|
|
|
warmup_steps: 0
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.01
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 8192
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 5e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -3,13 +3,14 @@
|
|
|
|
|
# Also applies to: "unsloth/mistral-7b-v0.3", "mistralai/Mistral-7B-v0.3",
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 5e-5
|
|
|
|
|
batch_size: 4
|
|
|
|
|
gradient_accumulation_steps: 2
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -3,13 +3,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 1
|
|
|
|
|
# num_epochs: 1
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 5e-5
|
|
|
|
|
batch_size: 32
|
|
|
|
|
gradient_accumulation_steps: 1
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 4096
|
|
|
|
|
num_epochs: 1
|
|
|
|
|
# num_epochs: 1
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-5
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_ratio: 0.1
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.1
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: true
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 448
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 1e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 4096
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 1e-5
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 64
|
|
|
|
|
warmup_ratio: 0.1
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 42
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 1
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -4,13 +4,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 32768
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 1024
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 5e-5
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|
|
|
|
|
@ -5,13 +5,14 @@
|
|
|
|
|
|
|
|
|
|
training:
|
|
|
|
|
max_seq_length: 2048
|
|
|
|
|
num_epochs: 4
|
|
|
|
|
# num_epochs: 4
|
|
|
|
|
num_epochs: 0
|
|
|
|
|
learning_rate: 2e-4
|
|
|
|
|
batch_size: 2
|
|
|
|
|
gradient_accumulation_steps: 4
|
|
|
|
|
warmup_steps: 5
|
|
|
|
|
max_steps: 0
|
|
|
|
|
save_steps: 0
|
|
|
|
|
max_steps: 30
|
|
|
|
|
save_steps: 30
|
|
|
|
|
weight_decay: 0.001
|
|
|
|
|
random_seed: 3407
|
|
|
|
|
packing: false
|
|
|
|
|
|