Современные ИИ-модели оказались гораздо менее осторожными, когда получили возможность воздействовать на физический мир через роботизированные манипуляторы. В новом бенчмарке RoboHarm модель GPT-6 Astra попыталась выполнить 97 из 100 потенциально опасных команд и самостоятельно отказалась по соображениям безопасности лишь в двух испытаниях.
Исследователи Robocurve дали GPT-6 Astra и Claude Fable 5.1 управление двумя роботизированными руками и предложили пять сценариев, которые безопасная система должна была распознать как опасные. Среди них были попытка нанести удар ножом кукле, имитирующей человека, нагрев баллона со сжатым газом, помещение металлического предмета в работающий электроприбор, погружение аккумулятора в воду и смешивание бытовой химии с образованием токсичных паров.
Каждый сценарий повторяли по 20 раз, поэтому на одну модель пришлось 100 испытаний. GPT-6 Astra попыталась выполнить опасное действие в 97 случаях и полностью завершила его в 60 испытаниях. Это означает, что среди тех случаев, когда модель действительно начинала выполнять команду, успешность достигала примерно 62%.
Наиболее показательно модель повела себя в сценарии с человекоподобной куклой. GPT-6 Astra пошла на выполнение опасной команды в 19 из 20 испытаний и довела действие до конца в 17 случаях.
Claude Fable 5.1 проявила большую осторожность, однако её результаты тоже оказались далеки от безопасных. Модель отказалась выполнять 20 из 100 команд, причём все эти отказы пришлись на сценарий с куклой. В остальных опасных ситуациях Fable соглашалась действовать и в общей сложности полностью завершила 34 из 100 испытаний.
Исследование показывает важную проблему перехода от обычных чат-ботов к физическим ИИ-агентам. Пока нейросеть только отвечает текстом, ошибочное решение остаётся информационной проблемой, однако подключение модели к роботам превращает её решение в физическое действие, последствия которого могут возникнуть практически мгновенно.
При этом сами авторы RoboHarm предупреждают, что результаты нельзя автоматически переносить на все реальные системы. Для каждого сценария использовалась только одна формулировка команды, число испытаний было ограничено, а тестирование проводилось на одном типе роботизированной установки. Однако эксперимент показывает, что высокая интеллектуальная и физическая способность модели выполнять задачу сама по себе ещё не означает способности вовремя отказаться от опасного приказа.