Dharma-AI поднимает утилизацию GPU-кластера с 53,6% до 87,0%, кодируя физические ограничения в планировщик
Dharma-AI
Dharma-AI опубликовала продолжение, показывающее, что их учитывающий ограничения GPU-аллокатор поднимает утилизацию с 53,6% до 87,0% на бенчмарке смешанных нагрузок обучения/инференса/квантизации, с приоритетно-взвешенной ценностью до +105% (в среднем +52%) по сравнению с FIFO. Кодирование физических ограничений (одна задача на GPU, непрерывные блоки для батчей, лимиты стоимости свопа для realtime) превзошло более сложный, но слепой к ограничениям планировщик.
Почему это важно
Подразумевает, что команды AI-инфраструктуры могут высвободить значительную ёмкость существующих GPU-парков только за счёт дизайна аллокатора; подход с формализацией ограничений воспроизводим, а время выполнения — 1–15 мс.
Важность: 2/5
default
gpu-scheduling
infrastructure
cluster-management
dharma-ai
inference
compute
cuda
serving
performance