LatentPress: сжатие контекста в непрерывные memory-токены, которые замороженная LLM читает напрямую

исследования официальный 2 ист. ~1 мин

Статья двух авторов вводит третье представление контекста помимо текста и скриншотов: непрерывные memory-токены, записываемые в замороженный декодер через интерфейс входных эмбеддингов, без реконструкции текста на инференсе. Небольшой writer, подобранный под reader (адаптер на 4,2–26,2 млн параметров, около 0,1% от декодера), сжимает в 4–16 раз; на LongMemEval он даёт 0,504 при сжатии в 7,7 раза против 0,490 на несжатых доказательствах, сильно обгоняя текстовые саммари (0,184) и сжатие через OCR.

Почему это важно

Более 100 апвотов на HF Daily Papers (110) — показывает, что латентная токен-память может обгонять текстовое суммаризирование для long-context-воспоминаний при почти нулевой стоимости обучения.

Важность: 3/5

HF Daily Papers >=100 апвотов (110)

Источники

вторичный LatentPress — Hugging Face Daily Papers (syndicated from arXiv)