From 0a750da927ac977c3fd2bab9d039f77f7b6fb4db Mon Sep 17 00:00:00 2001 From: Daniel Han Date: Fri, 21 Mar 2025 17:13:14 -0700 Subject: [PATCH] Update llama.py --- unsloth/models/llama.py | 2 ++ 1 file changed, 2 insertions(+) diff --git a/unsloth/models/llama.py b/unsloth/models/llama.py index 7557a96120..072d48780f 100644 --- a/unsloth/models/llama.py +++ b/unsloth/models/llama.py @@ -99,11 +99,13 @@ SDPA_HAS_GQA = "enable_gqa" in scaled_dot_product_attention.__doc__ # Fix new HF's inference code def _fast_prepare_inputs_for_generation(self, input_ids, **kwargs,): + print("PREPARE", input_ids) if "past_key_values" in kwargs: input_ids = input_ids[:,[-1]] kwargs["attention_mask"] = kwargs["attention_mask"][:,[-1]] if "cache_position" in kwargs: kwargs["position_ids"] = kwargs["cache_position"] + print("PREPARE", input_ids) return { "input_ids" : input_ids, **kwargs, } pass