From b2a5aff5f9b06bc4340494a74fbe4c62879c8768 Mon Sep 17 00:00:00 2001 From: Daniel Han Date: Tue, 4 Mar 2025 19:02:12 -0800 Subject: [PATCH] Update llama.py --- unsloth/models/llama.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/unsloth/models/llama.py b/unsloth/models/llama.py index 69f3e5b099..f88f71500c 100644 --- a/unsloth/models/llama.py +++ b/unsloth/models/llama.py @@ -1975,7 +1975,7 @@ class FastLlamaModel: # Patch generate if model.generate.__name__ != "_fast_generate": model._old_generate = model.generate - model.generate = types.MethodType(_wrap_fast_inference(model._old_generate), model.generate) + model.generate = types.MethodType(_wrap_fast_inference(model._old_generate), model) return model, tokenizer pass @@ -2412,7 +2412,7 @@ class FastLlamaModel: # Patch generate if model.generate.__name__ != "_fast_generate": model._old_generate = model.generate - model.generate = types.MethodType(_wrap_fast_inference(model._old_generate), model.generate) + model.generate = types.MethodType(_wrap_fast_inference(model._old_generate), model) return model pass