From bd85f8f0740862a13b7b273195470bfb7dc8237d Mon Sep 17 00:00:00 2001 From: Daniel Han Date: Wed, 25 Sep 2024 18:10:46 -0700 Subject: [PATCH] Update llama.py --- unsloth/models/llama.py | 2 ++ 1 file changed, 2 insertions(+) diff --git a/unsloth/models/llama.py b/unsloth/models/llama.py index 48d1f7ec6e..a31a485676 100644 --- a/unsloth/models/llama.py +++ b/unsloth/models/llama.py @@ -1372,6 +1372,8 @@ def _wrap_fast_inference(generate, device_type, dtype, model): # Wraps inference with bfloat16 / float16 @torch.inference_mode def _fast_generate(*args, **kwargs): + print(args) + print(kwargs) # Set a flag for generation! internal_model = model