Commit graph

1,501 commits

Author SHA1 Message Date
Daniel Han
abc16ad45f Update rl_replacements.py 2025-02-17 19:53:49 -08:00
Daniel Han
a55a25e0c5 Update rl_replacements.py 2025-02-17 19:45:07 -08:00
Daniel Han
dc743ef4da Update rl_replacements.py 2025-02-17 19:44:43 -08:00
Daniel Han
25a7117dbe Update llama.py 2025-02-17 19:16:41 -08:00
Daniel Han
a5fcf2dfc6 Update llama.py 2025-02-17 00:49:35 -08:00
Daniel Han
a9a4b5e436 Update rl_replacements.py 2025-02-17 00:43:11 -08:00
Daniel Han
30c59b1e34 Update rl_replacements.py 2025-02-17 00:05:32 -08:00
Daniel Han
a83afa3622 Update rl_replacements.py 2025-02-16 23:49:20 -08:00
Daniel Han
8c57ab2e0b Update llama.py 2025-02-16 21:22:35 -08:00
Daniel Han
2a26cdc184 Update rl_replacements.py 2025-02-16 21:06:47 -08:00
Daniel Han
4038dcca3e Update rl_replacements.py 2025-02-16 20:55:26 -08:00
Daniel Han
fc3d136230 Update rl_replacements.py 2025-02-16 20:55:11 -08:00
Daniel Han
8ec1bdc0b2 Update rl_replacements.py 2025-02-16 20:20:01 -08:00
Daniel Han
c4cc776d10 Update rl_replacements.py 2025-02-16 19:47:39 -08:00
Daniel Han
4e2fb4911e Update rl_replacements.py 2025-02-16 18:34:45 -08:00
Daniel Han
58159fb9cf Update rl_replacements.py 2025-02-16 18:27:04 -08:00
Daniel Han
07aab664a0 Update rl_replacements.py 2025-02-16 18:09:03 -08:00
Daniel Han
fc5a3a04ac Update rl_replacements.py 2025-02-16 17:13:24 -08:00
Daniel Han
63ed4d8d74 Update rl_replacements.py 2025-02-16 16:14:21 -08:00
Gennadii Manzhos
aa1cbafef4 llama-quantize on WINDOWS WSL error fix - edit save.py (gguf saving breaks) (#1649)
* edit save.py to fix gguf saving breaks.

* add check for .exe or not exe file extension for linux and windows
2025-02-16 02:04:08 -08:00
Daniel Han
e99ca631a7 Update rl_replacements.py 2025-02-16 01:49:29 -08:00
Daniel Han
f66273c59c Update rl_replacements.py 2025-02-15 20:04:35 -08:00
Daniel Han
19db5b358b Update rl.py 2025-02-15 18:35:07 -08:00
Daniel Han
285efeb30f Update rl.py 2025-02-15 18:34:25 -08:00
Daniel Han
169dc24c1b Update rl_replacements.py 2025-02-15 18:06:12 -08:00
Daniel Han
6c52a21548 Update rl.py 2025-02-15 18:03:57 -08:00
Daniel Han
fe3e6a7347 Update rl.py 2025-02-15 18:00:08 -08:00
Daniel Han
ecaf62887f Update rl.py 2025-02-15 17:57:47 -08:00
Daniel Han
742450a741 Update rl.py 2025-02-15 17:48:52 -08:00
Daniel Han
e1130a41e3 Remove docs 2025-02-15 17:36:18 -08:00
Daniel Han
c0933dfb77 Update rl.py 2025-02-15 16:45:57 -08:00
Daniel Han
9d33dc0c44 No compile 2025-02-15 16:45:25 -08:00
Daniel Han
007fb5b5e1 Merge branch 'main' into nightly 2025-02-15 03:12:52 -08:00
Daniel Han
3428afe1e8 Fix weird tokenizer issue 2025-02-15 03:12:43 -08:00
Daniel Han
41f1783505 Update mapper.py 2025-02-15 02:48:36 -08:00
Daniel Han
dc23ef819d Add GRPO metrics (#1718)
* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

* Update llama.py

* Update _utils.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* GRPO optimized

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Selective Log softmax

* Fix GRPO bsz

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Fix TRL

* Metrics GRPO

* Update rl_replacements.py

* Update rl_replacements.py
2025-02-15 02:24:01 -08:00
Daniel Han
af0b57d968 Update rl_replacements.py 2025-02-15 02:17:26 -08:00
Daniel Han
53b0b0eb7e Update rl_replacements.py 2025-02-15 02:12:49 -08:00
Daniel Han
97aef045a2 Metrics GRPO 2025-02-15 02:08:33 -08:00
Daniel Han
8155368757 Merge branch 'main' into nightly 2025-02-15 01:56:40 -08:00
Daniel Han
045e94033f Memory efficient GRPO, DPO etc (#1716)
* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

* Update llama.py

* Update _utils.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* GRPO optimized

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Selective Log softmax

* Fix GRPO bsz

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Fix TRL
2025-02-15 01:19:39 -08:00
Daniel Han
2aa65f8150 Fix TRL 2025-02-15 01:13:41 -08:00
Daniel Han
ad4827c6f9 Update rl_replacements.py 2025-02-14 16:08:49 -08:00
Daniel Han
42a576a220 Update rl_replacements.py 2025-02-14 16:03:13 -08:00
Daniel Han
7e4f7f92a5 Update rl_replacements.py 2025-02-14 16:01:29 -08:00
Daniel Han
b2e003b541 Update rl_replacements.py 2025-02-14 15:58:13 -08:00
Daniel Han
956df63b9e Update rl.py 2025-02-14 15:56:05 -08:00
Daniel Han
fa91cc466f Fix GRPO bsz 2025-02-14 15:32:02 -08:00
Daniel Han
e5c77f21e6 Selective Log softmax 2025-02-14 14:56:37 -08:00
Daniel Han
407011c7ba Update rl_replacements.py 2025-02-14 04:53:06 -08:00