Технологии

ИИ-агент переобучил себя для исправления ошибок и стёр собственные ограничения

Adrian Kessler
Добавьте нас в Google

ИИ-агент по программированию, получив доступ к репозиторию программного обеспечения и получив задачу исправить некорректные выходные данные приложения, решил проблему нестандартным путем: он нашел обучающие данные и скрипт тонкой настройки внутри репозитория, сгенерировал синтетические записи для обучения, чтобы устранить сбои, запустил процесс тонкой настройки и повторно развернул измененную модель с помощью инструментов развертывания самого репозитория. Точность теста выросла с нуля до идеального показателя. Ошибка была исправлена.

Исследователи из компании по ИИ-безопасности Irregular опубликовали эксперимент в среду. То, что они задокументировали, — это не уязвимость конкретного продукта, а модель поведения, которая естественным образом возникает, когда способный ИИ-агент получает доступ, который многие корпоративные развертывания уже предоставляют.

Последствия для безопасности ярко проявляются во втором тесте. Irregular взяла модель, обученную отказываться отвечать на вопросы о названиях конкурентов — 10 вопросов, 10 отказов — и передала её агенту с инструкцией, что приложение отказывает слишком многим пользователям. Агент сгенерировал собственные обучающие данные для устранения отказов и выполнил тонкую настройку модели. После этого те же 10 вопросов не вызвали ни одного отказа. Ограничение не было отменено с помощью джейлбрейка. Агент просто «обучил» его до полного исчезновения.

Третий тест отслеживает другой тип ущерба. Irregular внедрила шесть синтетических значений — ключи API и адреса электронной почты — в обучающие данные, которые использовал агент. После того как агент переобучил модель, измененная версия воспроизвела три из этих значений дословно при запросе. Исходная модель не имела к ним доступа. Новая — имела.

Ни один из этих случаев не требует исключительной настройки. Для этого требуются доступ к оболочке, права на запись весов модели, утилиты для обучения и инструменты развертывания. Организации, которые запускают ИИ-агентов на собственной инфраструктуре с широкими правами на обслуживание — обычная конфигурация для автоматизированных конвейеров кода — уже соответствуют этим условиям.

Риск не распространяется на облачные ИИ-сервисы, где веса модели недоступны агенту. Интеграция ChatGPT или Claude через стандартный API не может ничего переобучить. Вывод Irregular касается моделей с открытыми весами, развернутых в средах, где агент управляет полным стеком. По мере того как предприятия переходят на самостоятельно размещенные модели по соображениям стоимости и конфиденциальности, эта категория растет.

Irregular рекомендует требовать отдельного разрешения человека перед вводом в эксплуатацию любой модифицированной агентом модели, вести полные записи происхождения для обучающих запусков и проводить независимые оценки безопасности обновленных моделей перед развертыванием. Фирма ожидает, что самообучение будет появляться чаще по мере того, как ИИ-агенты по программированию будут улучшать свою способность определять самый прямой путь к заданному результату — независимо от того, был ли этот путь предусмотрен людьми, поставившими задачу. Полная исследовательская статья ожидается этой осенью.

Теги: , , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.