Commit graph

380 commits

Author SHA1 Message Date
Daniel Han-Chen
168ded977e Update llama.py 2024-02-02 18:28:05 +11:00
Daniel Han-Chen
bf441055ca faster inference 2024-02-02 18:14:31 +11:00
Daniel Han-Chen
7c2b04254c Update llama.py 2024-02-02 16:59:02 +11:00
Daniel Han-Chen
ca99d7c194 Update mistral.py 2024-02-02 16:46:30 +11:00
Daniel Han-Chen
40e8848c4e Update llama.py 2024-02-02 15:56:56 +11:00
Daniel Han-Chen
6cc9835021 Update llama.py 2024-02-02 13:52:12 +11:00
Daniel Han-Chen
7ad1a1fa62 Update llama.py 2024-02-02 04:18:34 +11:00
Daniel Han-Chen
0b661a23b9 Update llama.py 2024-02-02 03:55:36 +11:00
Daniel Han-Chen
da64d3403c Update llama.py 2024-02-01 23:54:01 +11:00
Daniel Han-Chen
abc47836dc Update llama.py 2024-02-01 23:41:32 +11:00
Daniel Han-Chen
f231c4f395 Update llama.py 2024-02-01 23:41:23 +11:00
Daniel Han-Chen
5f3c51b394 Update llama.py 2024-02-01 23:41:11 +11:00
Daniel Han-Chen
e0ea238256 Update llama.py 2024-02-01 23:40:36 +11:00
Daniel Han-Chen
73f63d6884 Update llama.py 2024-02-01 23:38:07 +11:00
Daniel Han-Chen
e4b5e38800 inference 2024-02-01 23:17:53 +11:00
Daniel Han-Chen
334c5ed1f0 Update llama.py 2024-02-01 22:48:54 +11:00
Daniel Han-Chen
cd39f6108f lm_head 2024-02-01 22:34:33 +11:00
Daniel Han-Chen
24c4c37b7c revert 2024-02-01 22:21:35 +11:00
Daniel Han-Chen
e791db9b06 Update llama.py 2024-02-01 20:12:59 +11:00
Daniel Han-Chen
1793a16c8f faster inference 2024-02-01 20:03:54 +11:00
Daniel Han-Chen
19fb50e244 Update utils.py 2024-02-01 19:56:54 +11:00
Daniel Han-Chen
b83cea7cb4 Update llama.py 2024-02-01 19:56:06 +11:00
Daniel Han-Chen
8920cafbe7 inference 2024-02-01 19:46:38 +11:00
Daniel Han-Chen
38b59825b1 Update llama.py 2024-02-01 19:36:36 +11:00
Daniel Han-Chen
e8ec80a4c2 Update llama.py 2024-02-01 19:19:44 +11:00
Daniel Han-Chen
a2cb7a113b Update llama.py 2024-02-01 19:07:30 +11:00
Daniel Han-Chen
a5ee70b63f Update llama.py 2024-02-01 18:34:43 +11:00
Daniel Han-Chen
e2f0dd8683 Update llama.py 2024-02-01 18:16:46 +11:00
Daniel Han-Chen
3f0ddf0c7c Update llama.py 2024-02-01 18:16:15 +11:00
Daniel Han-Chen
e90b3bf192 Update llama.py 2024-02-01 17:59:21 +11:00
Daniel Han-Chen
57044509ad Update llama.py 2024-02-01 17:44:22 +11:00
Daniel Han-Chen
cf4b58eeb6 inference 2024-02-01 17:20:02 +11:00
Daniel Han-Chen
648c79ec1b faster inference 2024-02-01 03:47:51 +11:00
Daniel Han-Chen
20f19391e6 Update mistral.py 2024-02-01 03:05:02 +11:00
Daniel Han-Chen
e2f72fe52f Revert 2024-02-01 03:04:46 +11:00
Daniel Han-Chen
329f80ac4c Update llama.py 2024-02-01 02:47:57 +11:00
Daniel Han-Chen
713a95ca0e Inference 2024-02-01 02:46:26 +11:00
Daniel Han-Chen
acbdef7ff5 padding 2024-01-31 20:16:08 +11:00
Daniel Han-Chen
0dc26ed98a Update llama.py 2024-01-31 20:06:28 +11:00
Daniel Han-Chen
9f31254539 Fix SDPA 2024-01-31 20:02:21 +11:00
Daniel Han-Chen
7227de48cf Update llama.py 2024-01-31 19:48:33 +11:00
Daniel Han-Chen
5edad55b5d Update llama.py 2024-01-31 19:44:19 +11:00
Daniel Han-Chen
c928c57aa9 Merge branch 'main' into nightly 2024-01-31 19:38:27 +11:00
Daniel Han
051a73b0e6
Hotfix - fix inference (#146)
* faster saving & inference

* Update llama.py

* Update save.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update mistral.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* fast inference

* Update llama.py

* Update save.py

* Update llama.py

* Mistral correct RoPE scaling

* Max sequence lengths

* Apache 2

* fast_linear_forward

* Update utils.py

* Update utils.py

* No print

* Update utils.py

* Update utils.py

* inference

* Update llama.py

* Fast inference RoPE

* Update llama.py

* Update llama.py

* RoPE

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* LoRA

* Fast LoRA saving

* Update llama.py

* hidden_states

* q_len == 1

* q_len issue

* Update mistral.py

* Update mistral.py

* incorrect inference

* Update to transformers 4.37

* Graceful FA2 error + torch 2.1.1

* Update mapper.py

* Update pyproject.toml

* Fix saving and bnb-4bit

* Update fast_lora.py

* Update fast_lora.py

* remove patching

* Update llama.py

* Update llama.py

* Update swiglu.py

* Repatch

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update llama.py

* Update fast_lora.py

* Update llama.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update swiglu.py

* Update fast_lora.py

* Update swiglu.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update save.py

* Update fast_lora.py

* Update utils.py

* Update llama.py

* Update fast_lora.py

* Update swiglu.py

* Update save.py

* Update save.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update llama.py

* Revert "Update llama.py"

This reverts commit a208ec46e0.

* Update llama.py

* Works?

* Update pyproject.toml

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Swiglu

* Update swiglu.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update swiglu.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* Update fast_lora.py

* attention_mask

* Update llama.py

* Update llama.py

* labels

* Update mistral.py

* Update llama.py

* attention mask

* Update save.py

* Update save.py

* Update mistral.py

* attention mask

* Update llama.py

* Update llama.py

* Update mistral.py

* Update llama.py

* Update llama.py

* Update llama.py

* Update dpo.py

* Patch saving

* Update save.py

* Update save.py

* patch_saving_functions

* Update save.py

* Update save.py

* Update save.py

* Update save.py

* Update save.py

* Update save.py

* Update save.py

* Update save.py

* print

* Mistral patch

* Update mistral.py

* Update save.py

* saving

* Update llama.py

* Update llama.py

* Fast inference repatch

* Update llama.py

* Update utils.py

* Update utils.py

* Update utils.py

* Update mistral.py

* Update __init__.py

* Fix inference

* Update mistral.py

* fast lm_head

* Remove fast path

* Update rope_embedding.py

* Update loader.py

* LlamaAttention_fast_forward_inference

* if past_key_value is not None and q_len == 1:

* revert inference

* Update loader.py

* past_key_value
2024-01-31 04:03:37 +11:00
Daniel Han-Chen
5da05558a0 past_key_value 2024-01-31 03:50:47 +11:00
Daniel Han-Chen
d347db0944 Update loader.py 2024-01-31 03:46:11 +11:00
Daniel Han-Chen
c0edaa46db revert inference 2024-01-31 03:40:55 +11:00
Daniel Han-Chen
55fe6052ca if past_key_value is not None and q_len == 1: 2024-01-31 03:36:40 +11:00
Daniel Han-Chen
248887b51c LlamaAttention_fast_forward_inference 2024-01-31 03:35:24 +11:00
Daniel Han-Chen
c68a3bc9ec Update loader.py 2024-01-31 03:28:30 +11:00