From 3de197ac313e360c70e680625a3a82180f3bcac5 Mon Sep 17 00:00:00 2001 From: imagineer99 Date: Tue, 10 Mar 2026 13:28:49 +0000 Subject: [PATCH] rename: tts model type to audio for broader category support --- studio/frontend/src/config/training.ts | 8 ++++---- .../onboarding/components/steps/model-type-step.tsx | 6 +++--- studio/frontend/src/features/training/api/models-api.ts | 2 +- .../src/features/training/stores/training-config-store.ts | 2 +- studio/frontend/src/hooks/use-hf-dataset-search.ts | 6 +++--- studio/frontend/src/types/training.ts | 2 +- 6 files changed, 13 insertions(+), 13 deletions(-) diff --git a/studio/frontend/src/config/training.ts b/studio/frontend/src/config/training.ts index 5ae61c5129..e56e5c5391 100644 --- a/studio/frontend/src/config/training.ts +++ b/studio/frontend/src/config/training.ts @@ -53,9 +53,9 @@ export const MODEL_TYPES: ReadonlyArray<{ description: "Image understanding models", }, { - value: "tts", - label: "TTS", - description: "Text-to-speech models", + value: "audio", + label: "Audio", + description: "Audio and speech models", }, { value: "embeddings", @@ -128,6 +128,6 @@ export const DEFAULT_HYPERPARAMS = { export const MODEL_TYPE_TO_HF_TASK: Record = { text: "text-generation", vision: "image-text-to-text", - tts: "text-to-speech", + audio: "text-to-speech", embeddings: "feature-extraction", }; diff --git a/studio/frontend/src/features/onboarding/components/steps/model-type-step.tsx b/studio/frontend/src/features/onboarding/components/steps/model-type-step.tsx index 8fbbe8ec64..1247bab98b 100644 --- a/studio/frontend/src/features/onboarding/components/steps/model-type-step.tsx +++ b/studio/frontend/src/features/onboarding/components/steps/model-type-step.tsx @@ -26,19 +26,19 @@ import { useShallow } from "zustand/react/shallow"; const TYPE_ICONS: Record = { vision: ImageIcon, - tts: VoiceIcon, + audio: VoiceIcon, embeddings: Database02Icon, text: TextIcon, }; const TYPE_TOOLTIPS: Record = { vision: "Fine-tune models that understand images and text together", - tts: "Fine-tune text-to-speech models for voice generation", + audio: "Fine-tune text-to-speech and audio models", embeddings: "Fine-tune models for semantic search and similarity", text: "Fine-tune large language models for text generation", }; -const COMING_SOON: ModelType[] = ["tts", "embeddings"]; +const COMING_SOON: ModelType[] = ["audio", "embeddings"]; export function ModelTypeStep(): ReactElement { const { modelType, setModelType } = useTrainingConfigStore( diff --git a/studio/frontend/src/features/training/api/models-api.ts b/studio/frontend/src/features/training/api/models-api.ts index 2ed4645b16..f40f29fda2 100644 --- a/studio/frontend/src/features/training/api/models-api.ts +++ b/studio/frontend/src/features/training/api/models-api.ts @@ -64,7 +64,7 @@ export interface ModelConfigResponse { is_lora: boolean; is_audio?: boolean; base_model?: string | null; - model_type?: "text" | "vision" | "tts" | "embeddings" | null; + model_type?: "text" | "vision" | "audio" | "embeddings" | null; } export interface LocalModelInfo { diff --git a/studio/frontend/src/features/training/stores/training-config-store.ts b/studio/frontend/src/features/training/stores/training-config-store.ts index 1ae404cb61..502889ee1e 100644 --- a/studio/frontend/src/features/training/stores/training-config-store.ts +++ b/studio/frontend/src/features/training/stores/training-config-store.ts @@ -130,7 +130,7 @@ export const useTrainingConfigStore = create()( // Use backend-provided model_type when available, otherwise // infer from is_vision (temporary until backend ships model_type). const inferredModelType: ModelType = modelDetails.model_type - ?? (modelDetails.is_vision ? "vision" : modelDetails.is_audio ? "tts" : "text"); + ?? (modelDetails.is_vision ? "vision" : modelDetails.is_audio ? "audio" : "text"); set({ ...patch, diff --git a/studio/frontend/src/hooks/use-hf-dataset-search.ts b/studio/frontend/src/hooks/use-hf-dataset-search.ts index 3e4ee3b824..9361c7aa32 100644 --- a/studio/frontend/src/hooks/use-hf-dataset-search.ts +++ b/studio/frontend/src/hooks/use-hf-dataset-search.ts @@ -118,7 +118,7 @@ const BOOSTED_TASK_CATEGORIES: Record> = { "image-to-text", "image-captioning", ]), - tts: new Set([ + audio: new Set([ "text-to-speech", "text-to-audio", "automatic-speech-recognition", @@ -195,7 +195,7 @@ const CURATED_EMPTY_QUERY_DATASET_IDS: Partial> = { "lmms-lab/VQAv2", "hezarai/parsynth-ocr-200k", ], - tts: [ + audio: [ "MrDragonFox/Elise", "keithito/lj_speech", "parler-tts/mls_eng_10k", @@ -242,7 +242,7 @@ const INCOMPATIBLE_TASKS_BY_MODEL: Record> = { "audio-to-audio", "automatic-speech-recognition", ]), - tts: new Set([ + audio: new Set([ "text-to-image", "image-to-image", "image-to-video", diff --git a/studio/frontend/src/types/training.ts b/studio/frontend/src/types/training.ts index 690929b9a3..205ff656ba 100644 --- a/studio/frontend/src/types/training.ts +++ b/studio/frontend/src/types/training.ts @@ -1,7 +1,7 @@ // SPDX-License-Identifier: AGPL-3.0-only - See /studio/LICENSE.AGPL-3.0 // Copyright © 2025 Unsloth AI -export type ModelType = "vision" | "tts" | "embeddings" | "text"; +export type ModelType = "vision" | "audio" | "embeddings" | "text"; export type TrainingMethod = "qlora" | "lora" | "full"; export function isAdapterMethod(method: TrainingMethod): boolean {