Update llama.py

This commit is contained in:
Daniel Han-Chen 2024-02-03 01:50:48 +11:00
commit 4436a1099d

View file

@ -141,8 +141,7 @@ def LlamaAttention_fast_forward_inference(
self.paged_attention_V = self.paged_attention[:,1]
self.attention.resize_((bsz, n_heads, 1, self.attention.shape[-1]+KV_CACHE_INCREMENT))
pass
print(1)
Qn = fast_linear_forward(self.q_proj, Xn, out = self.temp_QA[0])
Kn = fast_linear_forward(self.k_proj, Xn, out = self.temp_KV[0])
Vn = fast_linear_forward(self.v_proj, Xn, out = self.temp_KV[1])