Update llama.py

This commit is contained in:
Daniel Han 2024-09-25 17:55:42 -07:00
commit e19dee7474

View file

@ -1388,7 +1388,7 @@ def _wrap_fast_inference(generate, device_type, dtype, model):
pass
# For newer HF
kwargs["cache_implementation"] = "dynamic"
# kwargs["cache_implementation"] = "dynamic"
# For num_logits_to_keep
kwargs["num_logits_to_keep"] = 1