Commit graph

1,454 commits

Author SHA1 Message Date
Daniel Han
294037324f Fix GRPO bsz 2025-02-14 15:32:02 -08:00
Daniel Han
4b385df264 Selective Log softmax 2025-02-14 14:56:37 -08:00
Daniel Han
a204e6ecb9 Update rl_replacements.py 2025-02-14 04:53:06 -08:00
Daniel Han
9adbd6909b Update rl_replacements.py 2025-02-14 04:49:41 -08:00
Daniel Han
6de69db2be Update rl_replacements.py 2025-02-14 04:45:48 -08:00
Daniel Han
10c359f231 Update rl.py 2025-02-14 04:44:03 -08:00
Daniel Han
5a9f9b7f24 Update rl.py 2025-02-14 04:42:05 -08:00
Daniel Han
a142182cc9 Update rl.py 2025-02-14 04:38:03 -08:00
Daniel Han
409762bd19 Update rl.py 2025-02-14 04:35:03 -08:00
Daniel Han
546be40339 Update rl_replacements.py 2025-02-14 04:33:41 -08:00
Daniel Han
c1d028ced8 Update rl_replacements.py 2025-02-14 04:32:24 -08:00
Daniel Han
79f345d484 Update rl.py 2025-02-14 04:31:27 -08:00
Daniel Han
194c1869b9 GRPO optimized 2025-02-14 04:30:15 -08:00
Daniel Han
dc2ef0b255 Merge branch 'main' into nightly 2025-02-13 22:18:26 -08:00
Daniel Han
3136fd9611 Fix bugs (#1706)
* Bug fixes

* fix: flash_attn_detection_error (#1556)

* fix: flash_attn_detection_error

* Update _utils.py

---------

Co-authored-by: Daniel Han <danielhanchen@gmail.com>

* Update mapper.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* dim fix

* Update _utils.py

* Torch 2.6 support

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

* Update llama.py

* Update _utils.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

---------

Co-authored-by: Zhe Zhang <2631992879@qq.com>
2025-02-13 19:12:19 -08:00
Daniel Han
4d1de7af9e Update llama.py 2025-02-13 19:11:38 -08:00
Daniel Han
4377b396c3 Update llama.py 2025-02-13 17:25:12 -08:00
Daniel Han
4dbfdcebbd Update llama.py 2025-02-13 17:22:39 -08:00
Daniel Han
a1db8042cb Update llama.py 2025-02-13 17:18:42 -08:00
Daniel Han
90375db93b Update rl_replacements.py 2025-02-13 17:15:29 -08:00
Daniel Han
ee1c2b4abd Update llama.py 2025-02-13 17:12:06 -08:00
Daniel Han
c51e4e2d21 Update llama.py 2025-02-13 17:11:33 -08:00
Daniel Han
e20a459343 Update llama.py 2025-02-13 17:05:04 -08:00
Daniel Han
c17bf7e04c Update llama.py 2025-02-13 17:00:14 -08:00
Daniel Han
dccd3999f3 Update rl.py 2025-02-13 16:47:27 -08:00
Daniel Han
8a5b163fe3 Update rl.py 2025-02-13 16:38:21 -08:00
Daniel Han
0651fe19ab Update rl.py 2025-02-13 16:37:05 -08:00
Daniel Han
5346a5f96a Update rl.py 2025-02-13 16:35:09 -08:00
Daniel Han
b9c4ab96cb Update rl.py 2025-02-13 16:27:23 -08:00
Daniel Han
4190857458 Update rl_replacements.py 2025-02-13 16:27:02 -08:00
Daniel Han
144b9b9e53 Update _utils.py 2025-02-13 16:23:51 -08:00
Daniel Han
8ae57e25a7 Update llama.py 2025-02-13 16:11:51 -08:00
Daniel Han
834c3a4492 Merge branch 'main' into nightly 2025-02-13 15:14:35 -08:00
Daniel Han
4f9301d321 Update _utils.py 2025-02-13 15:14:17 -08:00
Daniel Han
26f8d8580b Update pyproject.toml 2025-02-13 15:13:55 -08:00
Daniel Han
bf2ee8eed2 Merge branch 'main' into nightly 2025-02-13 15:02:56 -08:00
Daniel Han
39eaefce14 Update rl.py 2025-02-13 15:02:50 -08:00
Daniel Han
3ad4076e4b Merge branch 'main' into nightly 2025-02-13 14:59:59 -08:00
Daniel Han
635e921506 Update _utils.py 2025-02-13 14:59:52 -08:00
Daniel Han
5c19724e7f Update dpo.py 2025-02-13 14:59:42 -08:00
Daniel Han
f11079ba65 Merge branch 'main' into nightly 2025-02-13 14:57:58 -08:00
Daniel Han
43cda3240c Update __init__.py 2025-02-13 14:55:14 -08:00
Daniel Han
010de17c90 Update _utils.py 2025-02-13 14:54:49 -08:00
Daniel Han
95fb1d699d Fix bugs (#1701)
* Phi 4

* Update llama.py

* Torch.Cuda Is Available Condition and Warning (#1545)

* check for torch.cuda and triton if available
on my machine(mac m3) the cuda were not available

* Update pyproject.toml

* Update __init__.py

---------

Co-authored-by: Daniel Han <danielhanchen@gmail.com>

* Update mistral.py

* Update mistral.py

* Update _utils.py

* Update _utils.py

* Update _utils.py

* Update _utils.py

* Update _utils.py

* Fix

* Bug fixes

* Update mapper.py

* Add dropout to granite to match HF's implementation (#1557)

Signed-off-by: datta0 <venkatadattasainimmaturi@gmail.com>

* Update llama.py

* Update llama.py

* Bug fixes

* fix: flash_attn_detection_error (#1556)

* fix: flash_attn_detection_error

* Update _utils.py

---------

Co-authored-by: Daniel Han <danielhanchen@gmail.com>

* Update mapper.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* Update gemma.py

* dim fix

* Update _utils.py

* Torch 2.6 support

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

---------

Signed-off-by: datta0 <venkatadattasainimmaturi@gmail.com>
Co-authored-by: AminWhat <88392440+aminwhat@users.noreply.github.com>
Co-authored-by: Datta Nimmaturi <datta.nimmaturi@nutanix.com>
Co-authored-by: Zhe Zhang <2631992879@qq.com>
2025-02-13 14:50:44 -08:00
Daniel Han
44e2879efb Update _utils.py 2025-02-13 14:47:54 -08:00
Daniel Han
50568f1c15 Update llama.py 2025-02-13 14:42:38 -08:00
Daniel Han
c59c2738d9 Merge branch 'main' into nightly 2025-02-13 14:40:49 -08:00
Daniel Han
b1d2c9fb30 Update rl_replacements.py 2025-02-13 04:44:21 -08:00
Daniel Han
de7e76c250 Update rl_replacements.py 2025-02-13 04:40:53 -08:00
Daniel Han
1013ab5891 Update rl_replacements.py 2025-02-13 04:40:42 -08:00