DeepSeek-V4.1-Flash: пределы сжатия KV-кэша

DeepSeek

исследования официальный 2 ист. ~1 мин

Новая мультимодальная MoE-модель DeepSeek на 552B параметров поддерживает контексты в 1M токенов, сжимая резидентный в HBM KV-кэш примерно до 890 байт на токен (около 1/4 от DeepSeek-V4-Flash) за счёт архитектуры Causal Encoder-Decoder, межслойного переиспользования KV в Compressed Sparse Attention 2 и FP4 KV-кэширования; SWA Bounded Replay срезает постоянный footprint примерно до 1/8. Производительность на текстовых и мультимодальных агентных задачах растёт, несмотря на сжатие.

Почему это важно

Агрессивное сжатие KV-кэша от фронтир-лаборатории с открытыми весами напрямую бьёт в memory wall длинноконтекстного агентного инференса; техники, вероятно, распространятся по экосистеме.

Важность: 3/5

Заметная статья об эффективности от фронтир-лаборатории с открытыми весами

Источники