unsloth/studio/backend/utils/datasets
Daniel Han eb15b31e3e studio: improve training progress messages for large datasets
Add granular status updates through the full preprocessing pipeline:
- "Downloading dataset: Open-Orca/OpenOrca..." before HF download
- "Downloaded Open-Orca/OpenOrca (4,233,923 rows)" after download
- "Formatting dataset (4,233,923 rows)..." before format step
- "Applying chat template to chatml_conversations (4,233,923 rows)..."
- "Dataset ready (4,233,923 samples, chatml_conversations format)"

Shows detected format name and row counts at each stage so users
can see progress through large dataset preprocessing instead of
a static "Loading and formatting dataset..." for minutes.
2026-03-16 15:03:58 +00:00
..
__init__.py Update license headers 2026-03-12 17:23:10 +00:00
chat_templates.py Final cleanup 2026-03-12 18:28:04 +00:00
data_collators.py Final cleanup 2026-03-12 18:28:04 +00:00
dataset_utils.py studio: improve training progress messages for large datasets 2026-03-16 15:03:58 +00:00
format_conversion.py Final cleanup 2026-03-12 18:28:04 +00:00
format_detection.py Final cleanup 2026-03-12 18:28:04 +00:00
llm_assist.py Improve AI Assist: Update default model, model output parsing, logging, and dataset mapping UX (#4323) 2026-03-16 16:04:35 +04:00
model_mappings.py Final cleanup 2026-03-12 18:28:04 +00:00
vlm_processing.py Final cleanup 2026-03-12 18:28:04 +00:00