Iris: Climbing to the Search Frontier

исследования официальный 2 ист. ~1 мин

Два открытых поисковых агента (35B-A3B и 397B-A17B), обученных чередованием SFT-RL на multi-hop вопросах, построенных из структуры веб-гиперссылок, где ни одну подсказку нельзя найти строковым сопоставлением. С включённым управлением контекстом Iris-pro набирает 88,6 на BrowseComp и 56,4 на HLE — заявлено как лучший результат среди open-source поисковых агентов в своих диапазонах параметров; веса и полный рецепт обещаны к релизу.

Почему это важно

Поиск уровня BrowseComp оставался пробелом open-weights; заявленные 88,6 с полным релизом рецепта «данные плюс обучение» сделали бы deep-search-агентов воспроизводимыми за пределами закрытых лабораторий. 50 апвоутов в HF Daily Papers.

Важность: 3/5

Сильнейшие open-weights результаты на BrowseComp на сегодня с обещанным полным рецептом; 50 апвоутов HF Daily

Источники

официальный Iris: Climbing to the Search Frontier