From 021267f8ec0d0a9b47c42a9c8d444f3583ab1c46 Mon Sep 17 00:00:00 2001 From: Daniel Han Date: Wed, 28 May 2025 05:09:03 -0700 Subject: [PATCH] Update rl.py --- unsloth/models/rl.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/unsloth/models/rl.py b/unsloth/models/rl.py index c4960034d4..f19ca5ee96 100644 --- a/unsloth/models/rl.py +++ b/unsloth/models/rl.py @@ -494,7 +494,7 @@ def _patch_trl_rl_trainers(trainer_file = "grpo_trainer"): " elif scale_rewards == True:\n"\ " print('The Dr GRPO paper recommends setting `scale_rewards` to False! Will override. Set it to `None` to force False.')\n"\ " scale_rewards = False\n"\ - "elif loss_type.lower() == 'dapo'\n"\ + "elif loss_type.lower() == 'dapo':\n"\ " print('The DAPO paper recommends `mask_truncated_completions = True`')\n"\ " print('The DAPO paper recommends `epsilon_high = 0.28`')\n"\ " mask_truncated_completions = True\n"\