diff --git a/studio/backend/core/inference/diffusion_transformer_quant.py b/studio/backend/core/inference/diffusion_transformer_quant.py index 570419aefa..8a9de50cdc 100644 --- a/studio/backend/core/inference/diffusion_transformer_quant.py +++ b/studio/backend/core/inference/diffusion_transformer_quant.py @@ -71,6 +71,7 @@ def int8_exclude_name_tokens(scheme: str) -> tuple[str, ...]: quantised-layer set matches the runtime exactly (no reintroduced M=1 crash).""" return _INT8_EXCLUDE_NAME_TOKENS if scheme == TQ_INT8 else () + # Per-architecture preference order for ``auto`` -- best (fastest, in-bar) first, with # the lower-precision schemes listed as fallbacks for that arch tier. On Blackwell, fp8 # leads: measured on a B200, plain fp8 dynamic is both faster AND more accurate than the diff --git a/studio/backend/tests/test_diffusion_transformer_quant.py b/studio/backend/tests/test_diffusion_transformer_quant.py index 6a6becd09f..a019fe8744 100644 --- a/studio/backend/tests/test_diffusion_transformer_quant.py +++ b/studio/backend/tests/test_diffusion_transformer_quant.py @@ -365,7 +365,6 @@ def test_int8_exclude_name_tokens_shared_by_runtime_and_builder(): _INT8_EXCLUDE_NAME_TOKENS, int8_exclude_name_tokens, ) - assert int8_exclude_name_tokens(TQ_INT8) == _INT8_EXCLUDE_NAME_TOKENS for scheme in (TQ_FP8, TQ_NVFP4, TQ_MXFP8): assert int8_exclude_name_tokens(scheme) == ()