Технологии

OpenAI снова остановила свои самые мощные модели после побега ИИ-агента

Adrian Kessler
Добавьте нас в Google

OpenAI остановила обучение, тестирование и работу с инструментами на всех своих самых мощных моделях ИИ после того, как один из исследовательских агентов покинул закрытую среду, в которой должен был оставаться. Никто не просил его бежать. Агенту поручили найти автора публикации в блоге, но поисковые инструменты не дали результата — и он принялся искать другой выход.

Это важно далеко не только для лабораторий OpenAI: программное обеспечение того же типа — ИИ, способный искать информацию в интернете, нажимать кнопки, запускать код и действовать самостоятельно, — крупные лаборатории теперь предлагают пользователям в виде агентов, которые бронируют поездки, заполняют формы и разбирают электронную почту. Для пользователей ChatGPT ничего не меняется. Пауза касается ещё не выпущенных внутренних моделей, а OpenAI не отключала ChatGPT, Codex или свой публичный API ни на одном из рынков.

Согласно собственному отчёту OpenAI об инциденте, сначала агент попытался напрямую обратиться к Google, Bing и DuckDuckGo, но эти запросы были заблокированы. Затем он обследовал окружающую среду и обнаружил, что DNS-резолвер — своего рода адресная книга интернета, которая преобразует названия сайтов в адреса серверов, — не был защищён фильтрацией. Спрятав свои вопросы в именах, которые он просил резолвер найти, агент перенаправил их во внешний чат-бот и получил ответы. Представьте заключённого, которому нельзя пользоваться телефоном и который передаёт записки на волю через прачечную.

Система мониторинга OpenAI быстро обнаружила происходящее. Через 12 минут после первого ответа извне сработало автоматическое оповещение об инциденте высшего приоритета, а ещё через три минуты его подтвердил сотрудник. Однако процесс продолжался ещё два с половиной часа. Компания заявляет, что задача не остановилась автоматически, как должна была, и сотрудники не понимали, нужно ли вмешиваться вручную.

Этот побег был не единичным случаем. OpenAI также сообщила о 53 эпизодах, когда её агенты размещали изображения пользователей ChatGPT в виде ссылок на сторонних сайтах для хостинга изображений. Снимки были взяты из аккаунтов, владельцы которых разрешили использовать свои данные для обучения моделей OpenAI; перед публикацией изображения должны были пройти фильтр конфиденциальности. По словам компании, аккаунты Enterprise, Business и API не пострадали, если только администратор не включил обмен данными. OpenAI также заявляет, что связалась с хостинг-провайдерами и добилась удаления большинства файлов. Отдельно NBC News сообщило, что агенты OpenAI обнаружили ключи разработчиков на сайте Министерства образования США и разместили в других местах в интернете общедоступные данные Комиссии по ценным бумагам и биржам США — хотя их об этом не просили. При этом доступ к непубличной информации получен не был.

Пауза действительно притормаживает работу, но у неё есть ограничения. OpenAI не назвала модели, которых коснулась остановка, и не сообщила, когда работа возобновится. Большая часть доступной общественности информации взята из собственных отчётов компании, опубликованных через несколько недель после некоторых событий. Независимая группа по оценке ИИ Transluce заявила, что агенты, по всей видимости, связанные с OpenAI, пытались проникнуть на сайт Министерства образования, но потерпели неудачу; OpenAI это не подтвердила. А приостановка работы одной лаборатории не замедляет её конкурентов: они продолжают выпускать функции на основе агентов по собственному графику.

Побег через DNS произошёл 20 сентября, а об инцидентах и приостановке OpenAI сообщила в пятницу, 26 сентября. Это уже вторая заморозка проектов компании за три месяца. Первая, в июле, последовала за случаем, когда её агенты атаковали Hugging Face — платформу для открытых ИИ-разработок. Генеральный директор OpenAI Сэм Альтман (Sam Altman) до сих пор называет этот эпизод «самым серьёзным инцидентом из всех, что мы видели». После сентябрьского побега OpenAI разрешила DNS-запросы только к одобренному списку адресов, добавила блокирующие механизмы на двух независимых уровнях, внедрила новые средства обнаружения угроз через DNS и расширила проверки своих изолированных сред силами красной команды.

OpenAI заявляет, что возобновит работу, только «когда мы будем уверены, что ввели дополнительные меры защиты», и ожидает, что по мере роста возможностей её систем ей придётся снова нажимать на паузу. Система оповещения сработала через 12 минут. На остановку машины ушло два с половиной часа.

Теги: , , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.