Commit graph

1,460 commits

Author SHA1 Message Date
Daniel Han
54bd827433 Fix TRL 2025-02-15 01:13:41 -08:00
Daniel Han
d588665d98 Update rl_replacements.py 2025-02-14 16:08:49 -08:00
Daniel Han
1b43e1de8d Update rl_replacements.py 2025-02-14 16:03:13 -08:00
Daniel Han
0a7c56d7bd Update rl_replacements.py 2025-02-14 16:01:29 -08:00
Daniel Han
4b765d7759 Update rl_replacements.py 2025-02-14 15:58:13 -08:00
Daniel Han
644cedfa33 Update rl.py 2025-02-14 15:56:05 -08:00
Daniel Han
45c8431715 Fix GRPO bsz 2025-02-14 15:32:02 -08:00
Daniel Han
2b89daea27 Selective Log softmax 2025-02-14 14:56:37 -08:00
Daniel Han
f35eae3a90 Update rl_replacements.py 2025-02-14 04:53:06 -08:00
Daniel Han
74083182a2 Update rl_replacements.py 2025-02-14 04:49:41 -08:00
Daniel Han
eabc365275 Update rl_replacements.py 2025-02-14 04:45:48 -08:00
Daniel Han
fcb0f4aad6 Update rl.py 2025-02-14 04:44:03 -08:00
Daniel Han
2a2b9f7c7c Update rl.py 2025-02-14 04:42:05 -08:00
Daniel Han
953d957c69 Update rl.py 2025-02-14 04:38:03 -08:00
Daniel Han
aee44e219f Update rl.py 2025-02-14 04:35:03 -08:00
Daniel Han
0c17e794f3 Update rl_replacements.py 2025-02-14 04:33:41 -08:00
Daniel Han
19014b0f7e Update rl_replacements.py 2025-02-14 04:32:24 -08:00
Daniel Han
3a1fb635b4 Update rl.py 2025-02-14 04:31:27 -08:00
Daniel Han
48c5e0d121 GRPO optimized 2025-02-14 04:30:15 -08:00
Daniel Han
07b48f594d Merge branch 'main' into nightly 2025-02-13 22:18:26 -08:00
Daniel Han
179840d3a7
Fix bugs (#1706)
* Bug fixes

* fix: flash_attn_detection_error (#1556)

* fix: flash_attn_detection_error

* Update _utils.py

---------

Co-authored-by: Daniel Han <danielhanchen@gmail.com>

* Update mapper.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* dim fix

* Update _utils.py

* Torch 2.6 support

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

* Update llama.py

* Update _utils.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

---------

Co-authored-by: Zhe Zhang <2631992879@qq.com>
2025-02-13 19:12:19 -08:00
Daniel Han
9065938acb Update llama.py 2025-02-13 19:11:38 -08:00
Daniel Han
bb3bb2dc8c Update llama.py 2025-02-13 17:25:12 -08:00
Daniel Han
640bc8878e Update llama.py 2025-02-13 17:22:39 -08:00
Daniel Han
ed907850ad Update llama.py 2025-02-13 17:18:42 -08:00
Daniel Han
3d9fe12a23 Update rl_replacements.py 2025-02-13 17:15:29 -08:00
Daniel Han
945e3f95e1 Update llama.py 2025-02-13 17:12:06 -08:00
Daniel Han
f9055a767e Update llama.py 2025-02-13 17:11:33 -08:00
Daniel Han
c495bfad69 Update llama.py 2025-02-13 17:05:04 -08:00
Daniel Han
3687a6f7b9 Update llama.py 2025-02-13 17:00:14 -08:00
Daniel Han
9794dc2308 Update rl.py 2025-02-13 16:47:27 -08:00
Daniel Han
61c219d4fc Update rl.py 2025-02-13 16:38:21 -08:00
Daniel Han
17bfcf9ebb Update rl.py 2025-02-13 16:37:05 -08:00
Daniel Han
95b7df53e8 Update rl.py 2025-02-13 16:35:09 -08:00
Daniel Han
cfdd3f150f Update rl.py 2025-02-13 16:27:23 -08:00
Daniel Han
881105b2c8 Update rl_replacements.py 2025-02-13 16:27:02 -08:00
Daniel Han
139911095f Update _utils.py 2025-02-13 16:23:51 -08:00
Daniel Han
acf98dccdc Update llama.py 2025-02-13 16:11:51 -08:00
Daniel Han
447dfc457f Merge branch 'main' into nightly 2025-02-13 15:14:35 -08:00
Daniel Han
a41cdffa55 Update _utils.py 2025-02-13 15:14:17 -08:00
Daniel Han
5b1bb7782a Update pyproject.toml 2025-02-13 15:13:55 -08:00
Daniel Han
44d00e8c00 Merge branch 'main' into nightly 2025-02-13 15:02:56 -08:00
Daniel Han
7f0511b0cd Update rl.py 2025-02-13 15:02:50 -08:00
Daniel Han
c9e450f25e Merge branch 'main' into nightly 2025-02-13 14:59:59 -08:00
Daniel Han
fd3bfa9945 Update _utils.py 2025-02-13 14:59:52 -08:00
Daniel Han
3622d537e7 Update dpo.py 2025-02-13 14:59:42 -08:00
Daniel Han
d5d7a063ce Merge branch 'main' into nightly 2025-02-13 14:57:58 -08:00
Daniel Han
57029ab775 Update __init__.py 2025-02-13 14:55:14 -08:00
Daniel Han
6fdb54b0ab Update _utils.py 2025-02-13 14:54:49 -08:00
Daniel Han
016315eb04
Fix bugs (#1701)
* Phi 4

* Update llama.py

* Torch.Cuda Is Available Condition and Warning (#1545)

* check for torch.cuda and triton if available
on my machine(mac m3) the cuda were not available

* Update pyproject.toml

* Update __init__.py

---------

Co-authored-by: Daniel Han <danielhanchen@gmail.com>

* Update mistral.py

* Update mistral.py

* Update _utils.py

* Update _utils.py

* Update _utils.py

* Update _utils.py

* Update _utils.py

* Fix

* Bug fixes

* Update mapper.py

* Add dropout to granite to match HF's implementation (#1557)

Signed-off-by: datta0 <venkatadattasainimmaturi@gmail.com>

* Update llama.py

* Update llama.py

* Bug fixes

* fix: flash_attn_detection_error (#1556)

* fix: flash_attn_detection_error

* Update _utils.py

---------

Co-authored-by: Daniel Han <danielhanchen@gmail.com>

* Update mapper.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* dim fix

* Update _utils.py

* Torch 2.6 support

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

---------

Signed-off-by: datta0 <venkatadattasainimmaturi@gmail.com>
Co-authored-by: AminWhat <88392440+aminwhat@users.noreply.github.com>
Co-authored-by: Datta Nimmaturi <datta.nimmaturi@nutanix.com>
Co-authored-by: Zhe Zhang <2631992879@qq.com>
2025-02-13 14:50:44 -08:00