diff --git a/studio/backend/core/inference/diffusion_transformer_quant.py b/studio/backend/core/inference/diffusion_transformer_quant.py index 6929130034..f60940c4ed 100644 --- a/studio/backend/core/inference/diffusion_transformer_quant.py +++ b/studio/backend/core/inference/diffusion_transformer_quant.py @@ -77,13 +77,15 @@ _DATACENTER_GPU_TOKENS = frozenset( { "B200", "B100", + "B300", # Blackwell Ultra data center "GB200", "GB300", "GB10", # Blackwell data center "H200", "H100", "H800", - "H20", # Hopper data center + "H20", + "GH200", # Grace-Hopper superchip (data center) "A100", "A800", "A30", diff --git a/studio/backend/tests/test_diffusion_transformer_quant.py b/studio/backend/tests/test_diffusion_transformer_quant.py index 83530d4d93..d527723b2e 100644 --- a/studio/backend/tests/test_diffusion_transformer_quant.py +++ b/studio/backend/tests/test_diffusion_transformer_quant.py @@ -279,6 +279,8 @@ def test_is_consumer_gpu_true(monkeypatch, name): "name", [ "NVIDIA B200", + "NVIDIA B300", # Blackwell Ultra (matches llama_cpp datacenter regex) + "NVIDIA GH200 480GB", # Grace-Hopper superchip (was misread as consumer) "NVIDIA H100 80GB HBM3", "NVIDIA A100-SXM4-80GB", "NVIDIA A40", # data-center Ampere (distinct token from RTX A4000)