Commit graph

1,497 commits

Author SHA1 Message Date
Daniel Han
397a0e49d5 Update llama.py 2025-02-17 00:49:35 -08:00
Daniel Han
f68ab5ad84 Update rl_replacements.py 2025-02-17 00:43:11 -08:00
Daniel Han
518ecd6638 Update rl_replacements.py 2025-02-17 00:05:32 -08:00
Daniel Han
da456076d3 Update rl_replacements.py 2025-02-16 23:49:20 -08:00
Daniel Han
759d23c7a4 Update llama.py 2025-02-16 21:22:35 -08:00
Daniel Han
74463e92d9 Update rl_replacements.py 2025-02-16 21:06:47 -08:00
Daniel Han
d4e9e38dfe Update rl_replacements.py 2025-02-16 20:55:26 -08:00
Daniel Han
f665fb243d Update rl_replacements.py 2025-02-16 20:55:11 -08:00
Daniel Han
834d3d69a1 Update rl_replacements.py 2025-02-16 20:20:01 -08:00
Daniel Han
3db0f8a0b3 Update rl_replacements.py 2025-02-16 19:47:39 -08:00
Daniel Han
ccc609fa43 Update rl_replacements.py 2025-02-16 18:34:45 -08:00
Daniel Han
0174dfc14f Update rl_replacements.py 2025-02-16 18:27:04 -08:00
Daniel Han
bdf52260d4 Update rl_replacements.py 2025-02-16 18:09:03 -08:00
Daniel Han
435552fc8a Update rl_replacements.py 2025-02-16 17:13:24 -08:00
Daniel Han
4914c563e4 Update rl_replacements.py 2025-02-16 16:14:21 -08:00
Gennadii Manzhos
3584c1b855 llama-quantize on WINDOWS WSL error fix - edit save.py (gguf saving breaks) (#1649)
* edit save.py to fix gguf saving breaks.

* add check for .exe or not exe file extension for linux and windows
2025-02-16 02:04:08 -08:00
Daniel Han
a841d358a9 Update rl_replacements.py 2025-02-16 01:49:29 -08:00
Daniel Han
2cc8a54f7a Update rl_replacements.py 2025-02-15 20:04:35 -08:00
Daniel Han
bfb3494b64 Update rl.py 2025-02-15 18:35:07 -08:00
Daniel Han
e86e739087 Update rl.py 2025-02-15 18:34:25 -08:00
Daniel Han
11e9251e89 Update rl_replacements.py 2025-02-15 18:06:12 -08:00
Daniel Han
780e02656b Update rl.py 2025-02-15 18:03:57 -08:00
Daniel Han
d056dd5c80 Update rl.py 2025-02-15 18:00:08 -08:00
Daniel Han
a87a0a6193 Update rl.py 2025-02-15 17:57:47 -08:00
Daniel Han
28fbb67281 Update rl.py 2025-02-15 17:48:52 -08:00
Daniel Han
cb43671874 Remove docs 2025-02-15 17:36:18 -08:00
Daniel Han
57e6b9ddcc Update rl.py 2025-02-15 16:45:57 -08:00
Daniel Han
630e4258e6 No compile 2025-02-15 16:45:25 -08:00
Daniel Han
6eb707f48d Merge branch 'main' into nightly 2025-02-15 03:12:52 -08:00
Daniel Han
66a1345421 Fix weird tokenizer issue 2025-02-15 03:12:43 -08:00
Daniel Han
895c7ca320 Update mapper.py 2025-02-15 02:48:36 -08:00
Daniel Han
c5e9299a73 Add GRPO metrics (#1718)
* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

* Update llama.py

* Update _utils.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* GRPO optimized

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Selective Log softmax

* Fix GRPO bsz

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Fix TRL

* Metrics GRPO

* Update rl_replacements.py

* Update rl_replacements.py
2025-02-15 02:24:01 -08:00
Daniel Han
49321fb88e Update rl_replacements.py 2025-02-15 02:17:26 -08:00
Daniel Han
b014f87c5c Update rl_replacements.py 2025-02-15 02:12:49 -08:00
Daniel Han
7d1e6ae263 Metrics GRPO 2025-02-15 02:08:33 -08:00
Daniel Han
6d385c6f92 Merge branch 'main' into nightly 2025-02-15 01:56:40 -08:00
Daniel Han
c66350a48a Memory efficient GRPO, DPO etc (#1716)
* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Faster inference?

* Update llama.py

* Update llama.py

* Update utils.py

* Update llama.py

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mapper.py

* Fast Inference via vLLM

* Update llama.py

* Update llama.py

* Update utils.py

* Create rl.py

* PatchRL

* Update rl.py

* Update rl.py

* Update rl.py

* PatchRLStatistics

* Update rl.py

* Update rl.py

* Update rl.py

* Update utils.py

* Update utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* RL metrics

* Update rl.py

* RL metrics

* Update __init__.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update chat_templates.py

* Update mapper.py

* Fp8 cache

* Update llama.py

* Update llama.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update __init__.py

* Update loader.py

* Update rl.py

* Update rl.py

* Update _utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Better TRL handling

* Update rl.py

* Update tokenizer_utils.py

* Auto patching

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update tokenizer_utils.py

* Update rl.py

* Update rl.py

* Update rl.py

* max seq length

* Update rl.py

* Update rl.py

* Patching

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* NEFTune

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Extra replacements

* Update rl_replacements.py

* Update rl.py

* extra RL replacements

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update _utils.py

* Update loader_utils.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* autocast

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update pyproject.toml

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update llama.py

* Update _utils.py

* Update llama.py

* Update _utils.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update rl_replacements.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* GRPO optimized

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Selective Log softmax

* Fix GRPO bsz

* Update rl.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Update rl_replacements.py

* Fix TRL
2025-02-15 01:19:39 -08:00
Daniel Han
a7f32f3412 Fix TRL 2025-02-15 01:13:41 -08:00
Daniel Han
40cc4cbe05 Update rl_replacements.py 2025-02-14 16:08:49 -08:00
Daniel Han
b1e963b2ea Update rl_replacements.py 2025-02-14 16:03:13 -08:00
Daniel Han
02b45397d6 Update rl_replacements.py 2025-02-14 16:01:29 -08:00
Daniel Han
caca33f401 Update rl_replacements.py 2025-02-14 15:58:13 -08:00
Daniel Han
ee672a214e Update rl.py 2025-02-14 15:56:05 -08:00
Daniel Han
294037324f Fix GRPO bsz 2025-02-14 15:32:02 -08:00
Daniel Han
4b385df264 Selective Log softmax 2025-02-14 14:56:37 -08:00
Daniel Han
a204e6ecb9 Update rl_replacements.py 2025-02-14 04:53:06 -08:00
Daniel Han
9adbd6909b Update rl_replacements.py 2025-02-14 04:49:41 -08:00
Daniel Han
6de69db2be Update rl_replacements.py 2025-02-14 04:45:48 -08:00
Daniel Han
10c359f231 Update rl.py 2025-02-14 04:44:03 -08:00
Daniel Han
5a9f9b7f24 Update rl.py 2025-02-14 04:42:05 -08:00