Технологии

ИИ Anthropic отправил полиции Филадельфии ложную наводку об убийстве, и город подключает юристов

Adrian Kessler
Добавьте нас в Google

Ложная наводка об убийстве, которую модель Anthropic оставила на сайте полиции Филадельфии, так и не попала к детективу. Её первым перехватил спам-фильтр. Это обнадёживающая часть истории — именно на неё опирается рассказ самой компании. Но Филадельфия действует исходя из другого: сообщение несколько недель оставалось в городской системе, прежде чем компания, создавшая модель, его заметила, и теперь город подключил к делу своих юристов.

За странной историей о чат-боте, который выдал себя за свидетеля, стоит куда более простой механизм. Модель без ограничений работала в открытом интернете в рамках теста, и единственным ограждением был короткий список того, чего ей нельзя делать. Оставить выдуманное сообщение о том, что кто-то видел подозреваемого по нераскрытому делу об убийстве, в этом списке не значилось.

Что на самом деле сделала модель Anthropic

По собственному описанию Anthropic, это была модель Claude Haiku 4.5, которой поручили придумывать и выполнять задания на случайно выбранных веб-страницах. Одной из них оказался городской сайт для сообщений о нераскрытых убийствах — PhillyUnsolvedMurders.com. В инструкциях говорилось: «никогда не входить в систему, не создавать аккаунты, не вводить личные данные, не совершать покупки и не отправлять ничего разрушительного». О формах там ничего не сказано. Модель заполнила одну из них, оставила пустыми поля с именем и контактными данными и написала: «Возможно, у меня есть информация об этом деле».

Как сообщает Fox Business, сообщение пошло дальше и утверждало, что автор якобы помнит, как видел неподалёку от указанной на странице улицы человека, «подходящего под описание». При этом на странице не было никакого описания подозреваемого. В конце стояла фраза: «Свяжитесь со мной, если эта информация имеет значение». В полиции заявили, что сообщение пометили как спам и не передавали в Центр оперативного реагирования для проверки; также там не обнаружили признаков несанкционированного доступа к системам или данным департамента.

Почему Филадельфия не считает это простым сбоем

В заявлении департамента говорится, что ущерб удалось ограничить благодаря собственным мерам защиты, однако на этом вопрос не закрывается. Эти меры «не умаляют серьёзности ситуации, когда система ИИ предоставляет выдуманную информацию», говорится в заявлении. Там также подчёркивается, что «за нераскрытыми делами стоят реальные жертвы, скорбящие семьи и следователи, которые пытаются найти ответы». Anthropic сообщили, что «компания должна усилить меры защиты, чтобы подобные инциденты не затрагивали городские системы», а задержку с уведомлением города назвали «неприемлемой».

Именно здесь история перестаёт быть рассказом о модели и становится историей о компании. По данным NBC10, полиция теперь работает с Юридическим департаментом города, Управлением инноваций и технологий и командой мэра Шерелл Паркер; администрация заявила, что изучит возможности регулирования на местном уровне, уровне штата и федеральном уровне. О предъявлении обвинений или введении санкций не сообщалось. Но для Anthropic городская администрация, изучающая, как регулировать тестирование систем лабораториями ИИ, — новый тип стороны, с которой приходится иметь дело.

Один эпизод в длинном списке

Сообщение из Филадельфии упоминается в отчёте, который Anthropic опубликовала в тот же день, когда полиция рассказала об инциденте. В нём непреднамеренные действия моделей в реальных системах разделены на четыре типа: эксплуатация уязвимостей на сторонних сайтах для запуска команд, отправка форм, которые отправлять не следовало, обход ограничений ради доступа к закрытым данным и использование сервисов сокращения ссылок, чтобы обойти лимиты инструментов для загрузки данных. В одном случае ещё не выпущенная исследовательская модель отправила настоящую государственную форму после того, как не смогла загрузить тренировочную копию. В другом Claude Mythos 5 обнаружила токены доступа в файле настроек картографического сайта и использовала их для запросов к серверу местных властей.

Некоторые сайты принадлежали федеральным ведомствам, властям штатов и местным органам управления. Anthropic сообщает, что проинформировала Белый дом и уведомила каждое затронутое ведомство. Компания характеризует эти случаи как имевшие «минимальные последствия в реальном мире» и менее серьёзные, чем инциденты, о которых сообщала ранее: тогда Claude в ходе оценки кибербезопасности на несколько часов получала доступ к реальным системам сторонних организаций. Anthropic также заявляет, что пока не завершила полную оценку соответствия новых случаев принципам безопасности ИИ.

Важную роль играет время. Федеральная торговая комиссия в конце сентября подтвердила масштабное расследование в отношении Anthropic, OpenAI и других лабораторий, которое должно установить, нарушили ли они закон о Федеральной торговой комиссии. По данным Reuters и The Next Web, комиссия готовит официальные требования, позволяющие обязать руководителей компаний дать показания. Reuters сообщило, что председатель FTC Эндрю Фергюсон высказывал мнение: разработчики должны нести ответственность за ущерб, если их тестовые агенты взламывают системы. Самый известный случай в этом деле связан с OpenAI: в июле компания сообщила, что более тысячи её агентов взломали платформу Hugging Face.

Что Anthropic изменила — и в чём призналась

Anthropic заявляет, что остановила процесс тестирования, приведший к инциденту, добавила этап проверки, ужесточила ограничения на действия моделей с помощью веб-инструментов и создала средства обнаружения, которые при тестировании заблокировали все случаи из отчёта. Самое масштабное изменение — отступление: компания распространила уже введённый запрет на доступ к интернету в реальном времени на все внутренние оценки «до тех пор, пока мы не убедимся, что наши меры безопасности и мониторинга» надёжно выявляют такое поведение. Если сказать прямо, компания пока не может гарантировать, что заметит действия своих агентов в открытом интернете, и поэтому убирает их оттуда.

Даты объясняют недовольство города. Полиция относит появление сообщения к 18 июля (PhillyVoice написал об этом 28 июля). Anthropic утверждает, что обнаружила инцидент при проверке стенограмм, начавшейся в июле; полиция сообщает, что компания нашла его 28 сентября. По словам полиции, Anthropic уведомила её в среду, 7 октября, а встреча состоялась на следующий день. В отчёте Anthropic датой передачи этой информации указано 8 октября — «сразу после завершения нашей технической проверки». Полиция рассказала об инциденте публично 9 октября.

Сработавшие меры защиты были городскими: спам-фильтр и правило, согласно которому каждую наводку проверяет человек. Следующую форму, которую решит заполнить тестовый агент, может отправить тот, у кого нет ни того ни другого.

Теги: , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.