IBM Research измеряет, сколько агентской памяти реально нужно каждому ярусу моделей
IBM Research
IBM Research опубликовал второй пост ALTK-Evolve о калибровке дозы агентской памяти. Среди 8 frontier-моделей на AppWorld (585 задач, 9 приложений) DeepSeek-V3.2 получил +9,5 п.п. TGC с полным набором руководств, gpt-oss-120b показал наибольший прирост через компактное курируемое извлечение, а GLM-5 насытился — единая политика памяти не подходит для всех ярусов возможностей.
Почему это важно
Даёт эмпирическую калибровку по ярусам моделей для агентской памяти в продакшене: полные руководства для frontier-моделей, курируемое извлечение для меньших и пропуск для насыщенных. Практические советы по кэшированию промптов и контролю затрат, код по адресу github.com/IBM/ALTK-Evolve.
Важность: 2/5
default