diff --git a/studio/backend/requirements/extras.txt b/studio/backend/requirements/extras.txt index 170b1c9ec8..d783975a4f 100644 --- a/studio/backend/requirements/extras.txt +++ b/studio/backend/requirements/extras.txt @@ -26,8 +26,9 @@ omegaconf einx pyloudnorm openai-whisper -# uroman # 4.0 MB - romanization, no imports found -# MeCab # 19.9 MB - Japanese tokenizer, no imports found +uroman # 4.0 MB - used for Outetts. +MeCab # 19.9 MB - used for Outetts. +inflect # number-to-words, required by OuteTTS loguru flatten_dict ffmpy diff --git a/studio/backend/utils/models/model_config.py b/studio/backend/utils/models/model_config.py index aaf15994be..13f1b5febf 100644 --- a/studio/backend/utils/models/model_config.py +++ b/studio/backend/utils/models/model_config.py @@ -630,7 +630,10 @@ _AUDIO_TOKEN_PATTERNS = { "whisper": lambda tokens: "<|startoftranscript|>" in tokens, "audio_vlm": lambda tokens: "" in tokens, "bicodec": lambda tokens: any(t.startswith("<|bicodec_") for t in tokens), - "dac": lambda tokens: "<|audio_start|>" in tokens and "<|audio_end|>" in tokens, + "dac": lambda tokens: "<|audio_start|>" in tokens + and "<|audio_end|>" in tokens + and "<|text_start|>" in tokens + and "<|text_end|>" in tokens, "snac": lambda tokens: sum(1 for t in tokens if t.startswith(" 10000, }