From e7f76d53bbb0833f7cad4d0beb9e24be190db160 Mon Sep 17 00:00:00 2001 From: Daniel Han Date: Wed, 28 May 2025 05:06:24 -0700 Subject: [PATCH] Update rl.py --- unsloth/models/rl.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/unsloth/models/rl.py b/unsloth/models/rl.py index c9f07e9a83..c4960034d4 100644 --- a/unsloth/models/rl.py +++ b/unsloth/models/rl.py @@ -494,7 +494,7 @@ def _patch_trl_rl_trainers(trainer_file = "grpo_trainer"): " elif scale_rewards == True:\n"\ " print('The Dr GRPO paper recommends setting `scale_rewards` to False! Will override. Set it to `None` to force False.')\n"\ " scale_rewards = False\n"\ - "elif loss_type.lower() = 'dapo'\n"\ + "elif loss_type.lower() == 'dapo'\n"\ " print('The DAPO paper recommends `mask_truncated_completions = True`')\n"\ " print('The DAPO paper recommends `epsilon_high = 0.28`')\n"\ " mask_truncated_completions = True\n"\