diff --git a/studio/backend/core/training/worker.py b/studio/backend/core/training/worker.py index 920ca63cfb..e386a4f853 100644 --- a/studio/backend/core/training/worker.py +++ b/studio/backend/core/training/worker.py @@ -227,6 +227,16 @@ def run_training_process( dataset = dataset_result eval_dataset = None + # [DEBUG] Print first sample before model is loaded + try: + sample = dataset[0] if len(dataset) > 0 else None + logger.info(f"[DEBUG] Dataset loaded BEFORE model. First sample keys: {list(sample.keys()) if sample else 'empty'}") + if sample: + preview = {k: str(v)[:200] for k, v in sample.items()} + logger.info(f"[DEBUG] First sample preview: {preview}") + except Exception as e: + logger.info(f"[DEBUG] Could not preview first sample: {e}") + # Disable eval if eval_steps <= 0 eval_steps = config.get("eval_steps", 0.00) if eval_steps is not None and float(eval_steps) <= 0: diff --git a/studio/backend/utils/datasets/vlm_processing.py b/studio/backend/utils/datasets/vlm_processing.py index 0d29a45400..4c7e86c38f 100644 --- a/studio/backend/utils/datasets/vlm_processing.py +++ b/studio/backend/utils/datasets/vlm_processing.py @@ -200,6 +200,11 @@ def generate_smart_vlm_instruction( dataset_name=dataset_name, ) if llm_result and llm_result.get("instruction"): + import logging + logging.getLogger(__name__).info( + f"[DEBUG] LLM-assisted VLM instruction generated: " + f"'{llm_result['instruction']}' (confidence={llm_result.get('confidence', 'N/A')})" + ) return { "instruction": llm_result["instruction"], "instruction_column": None,