From 41d7a3e8c1a2200145c738c454eeec7bcb0affe6 Mon Sep 17 00:00:00 2001 From: Daniel Han Date: Fri, 21 Mar 2025 17:14:52 -0700 Subject: [PATCH] Update llama.py --- unsloth/models/llama.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/unsloth/models/llama.py b/unsloth/models/llama.py index 072d48780f..3c217466b9 100644 --- a/unsloth/models/llama.py +++ b/unsloth/models/llama.py @@ -99,13 +99,13 @@ SDPA_HAS_GQA = "enable_gqa" in scaled_dot_product_attention.__doc__ # Fix new HF's inference code def _fast_prepare_inputs_for_generation(self, input_ids, **kwargs,): - print("PREPARE", input_ids) + print("PREPARE", input_ids, kwargs) if "past_key_values" in kwargs: input_ids = input_ids[:,[-1]] kwargs["attention_mask"] = kwargs["attention_mask"][:,[-1]] if "cache_position" in kwargs: kwargs["position_ids"] = kwargs["cache_position"] - print("PREPARE", input_ids) + print("PREPARE", input_ids, kwargs) return { "input_ids" : input_ids, **kwargs, } pass