Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами

Anthropic

исследования официальный 1 ист. ~1 мин

Frontier Red Team компании Anthropic совместно с Andon Labs опубликовали Project Pilot и новый бенчмарк Drone-Bench, оценивающий способность AI-моделей автономно управлять квадрокоптером в помещении для поиска и сопровождения человека. Пятнадцать моделей от трёх разработчиков были оценены по пяти подзадачам (реконструкция, локализация, навигация, обнаружение, слежение); лидером стала Claude Fable 5, однако сбои на этапе реконструкции по-прежнему мешают надёжной сквозной автономной навигации.

Почему это важно

Исследование фиксирует, насколько близко AI-модели подошли к автономному управлению физическим оборудованием для задач, похожих на наблюдение — это технология двойного назначения с прямыми последствиями для регулирования ИИ и безопасности в физическом мире.

Важность: 3/5

Значимая публикация по безопасности от ведущей лаборатории с прямыми последствиями для регулирования ИИ.

Источники