Update llama.py

This commit is contained in:
Daniel Han 2024-09-25 14:32:29 -07:00
commit 25c6e1d8a7

View file

@ -1386,11 +1386,7 @@ def _wrap_fast_inference(generate, device_type, dtype, model):
pass
# For newer HF
if SUPPORTS_LLAMA32:
# kwargs["cache_implementation"] = "hybrid"
pass
else:
kwargs["cache_implementation"] = "dynamic"
kwargs["cache_implementation"] = "dynamic"
# For num_logits_to_keep
kwargs["num_logits_to_keep"] = 1