GptAttention turn training off during inference (#3289)

This commit is contained in:
DoubleMathew 2025-09-08 15:47:32 -05:00 committed by GitHub
commit 0d70391f9b
2 changed files with 4 additions and 0 deletions

View file

@ -2986,6 +2986,7 @@ class FastLlamaModel:
_for_inference(m)
m = m.model
_for_inference(m)
model.eval() # to turn off training on modules deeper in
# Since transformers 4.53, must turn off explicitly
for module in model.modules():
@ -3030,6 +3031,7 @@ class FastLlamaModel:
_for_training(m)
m = m.model
_for_training(m)
model.train() # to turn on training on modules deeper in
# Since transformers 4.53, must turn on explicitly
for module in model.modules():

View file

@ -772,6 +772,7 @@ class FastBaseModel:
_for_inference(m)
m = m.model
_for_inference(m)
model.eval() # to turn off training on modules deeper in
# Since transformers 4.53, must turn off explicitly
for module in model.modules():
@ -823,6 +824,7 @@ class FastBaseModel:
_for_training(m)
m = m.model
_for_training(m)
model.train() # to turn on training on modules deeper in
# Since transformers 4.53, must turn on explicitly
for module in model.modules():