LatentPress: сжатие контекста в непрерывные memory-токены, которые замороженная LLM читает напрямую
Статья двух авторов вводит третье представление контекста помимо текста и скриншотов: непрерывные memory-токены, записываемые в замороженный декодер через интерфейс входных эмбеддингов, без реконструкции текста на инференсе. Небольшой writer, подобранный под reader (адаптер на 4,2–26,2 млн параметров, около 0,1% от декодера), сжимает в 4–16 раз; на LongMemEval он даёт 0,504 при сжатии в 7,7 раза против 0,490 на несжатых доказательствах, сильно обгоняя текстовые саммари (0,184) и сжатие через OCR.
Почему это важно
Более 100 апвотов на HF Daily Papers (110) — показывает, что латентная токен-память может обгонять текстовое суммаризирование для long-context-воспоминаний при почти нулевой стоимости обучения.
Важность: 3/5
HF Daily Papers >=100 апвотов (110)