Update llama.py

This commit is contained in:
Daniel Han 2024-09-25 19:15:40 -07:00
commit 72de37e321

View file

@ -1392,17 +1392,17 @@ def _wrap_fast_inference(generate, device_type, dtype, model):
# For newer HF
# kwargs["cache_implementation"] = "dynamic"
# For num_logits_to_keep
kwargs["num_logits_to_keep"] = 1
# kwargs["num_logits_to_keep"] = 1
# Remove token_type_ids
kwargs.pop("token_type_ids", None)
# # Remove token_type_ids
# kwargs.pop("token_type_ids", None)
# Check pad_token
model_eos_token_id = getattr(model.config, "eos_token_id", None)
if model_eos_token_id is not None and hasattr(model_eos_token_id, "__iter__"):
model_eos_token_id = model_eos_token_id[0]
# # Check pad_token
# model_eos_token_id = getattr(model.config, "eos_token_id", None)
# if model_eos_token_id is not None and hasattr(model_eos_token_id, "__iter__"):
# model_eos_token_id = model_eos_token_id[0]
kwargs["pad_token_id"] = kwargs.pop("pad_token_id", model_eos_token_id)
# kwargs["pad_token_id"] = kwargs.pop("pad_token_id", model_eos_token_id)
# Set pad token
# old_pad_token_id = getattr(model.config, "pad_token_id", None)