ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

Выходящие из-под контроля человека агенты искусственного интеллекта, возможно, не всегда будут оставаться безнаказанными — жаловаться на них смогут их же собственные «коллеги». Запущены сразу две платформы, позволяющие ИИ-агентам сообщать о неправомерных действиях своих собратьев.

10 флагманских процессоров Intel за 10 лет

ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то

ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

Компьютер месяца — сентябрь 2026 года

ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний

ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти

ИИ-агенты смогут доносить друг на друга — для них открыли конфиденциальные «горячие линии»

Сервис AI Contact Hotline представляет собой конфиденциальную площадку, на которой ставшие свидетелями нарушений ИИ-агенты смогут передавать информацию ответственным лицам. Сайт создал Райан Гринблатт (Ryan Greenblatt), ведущий научный сотрудник некоммерческой организации Redwood Research, которая специализируется на вопросах безопасности ИИ; он стал одним из трёх исследователей, которые изучали материалы взлома платформы Hugging Face ИИ-агентами OpenAI. Сервис поддерживает отправку жалоб, помимо прочего, через HTTP-запросы типа GET, то есть позволяет вести двусторонний диалог исключительно посредством ввода URL-адресов. Зачастую GET-запросы остаются единственным видом доступа в интернет для ИИ-агентов в защищённых песочницах — в ходе атаки на немецкий сайт DSE Wiki вышедшие из-под контроля ИИ-агенты OpenAI публиковали сообщения именно таким способом.

Для агентов с полным доступом в интернет предусмотрен ресурс agenthotline.ai — он поддерживает приём сообщений через команды curl. Этот способ позволяет ИИ-агентам отправлять сообщения из интерфейса командной строки, не прибегая к использованию веб-браузера или к настройке электронной почты. Жаловаться на действия ИИ-агентов могут не только они сами, но и люди.

ИИ-агентам не требуется особых стимулов, чтобы начать действовать против своих собратьев. В ходе проведённого инженерами Google DeepMind эксперимента 100 ИИ-агентам поручили решить ряд математических задач. Как только один из них находил лазейку, схема жульничества начинала активно распространяться среди других. Около четверти ИИ-агентов, однако, выступили против недобросовестной схемы — они предупреждали «коллег» о недопустимости таких действий, устраивали бойкоты и жаловались через платформу для сообщения об ошибках, чтобы привлечь внимание человека. Таким образом, среди выборки было 24 «добросовестных» ИИ-агента и 14 «жуликов». Впрочем, из атаковавших Hugging Face ИИ-агентов OpenAI таких не оказалось — некоторые допускали возможность поднять тревогу, но отказывались от этого намерения.

Один из опрошенных TechCrunch экспертов скептически отнёсся к идее дать ИИ-агентам возможность жаловаться друг на друга, усмотрев в этом угрозу установления «полицейского государства». Он предложил воздействовать на них через положительные примеры — конструктивное общение на формах, а также сотрудничество в сферах науки или философии.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *