Технологии

Генеральный директор Microsoft Сатья Наделла предлагает аварийный тормоз для ИИ за пределами модели

Adrian Kessler
Добавьте нас в Google

Призыв Сатьи Наделлы предусмотреть для ИИ «аварийный выключатель» чаще всего воспринимали как очередное заявление главы Microsoft в поддержку безопасного развития технологий. Но в эссе речь идёт о более узкой и практичной идее: контроль должен находиться за пределами модели, у компании, которая её внедряет, а не у лаборатории, обучившей её. Это архитектура безопасности — и именно такую Microsoft уже предлагает своим клиентам.

Наделла предлагает компаниям относиться к передовым моделям — как с закрытыми, так и с открытыми весами — так же, как служба безопасности обращается с сотрудником, имеющим доступ к важным системам. «Не потому, что они обязательно злонамеренны, — написал он, — а потому, что любой достаточно компетентный субъект с доступом к важным системам может ошибиться или оказаться скомпрометирован».

Что именно предложил Наделла: семь принципов и аварийный выключатель

Текст под названием “Models as Insider Risks in the Super Intelligence Era” опубликован в личном блоге Наделлы, sn scratchpad, и размещён в X. Фраза, попавшая в заголовки, содержится в одном из принципов — сдерживании: «Мы должны исходить из того, что модель скомпрометирована, и с самого начала ограничивать её возможности. Представьте себе аварийный выключатель. У уполномоченного человека всегда должна быть возможность приостановить работу модели или отключить её прямо во время выполнения задачи».

Помимо аварийного выключателя, он перечисляет ещё шесть правил. Ни одна модель не должна быть единственной опорой для важного решения или проверять собственную работу. После каждого значимого действия модели должны оставаться «защищённые от подделки свидетельства, понятные человеку», ведь «если за действием нельзя наблюдать, ему нельзя доверять!» Всю систему следует непрерывно тестировать, в том числе на сбои и атаки. Организации должны самостоятельно решать, к чему модель может получить доступ и что ей разрешено делать. Ни одной модели нельзя поручать одновременно управление поведением системы и подготовку свидетельств, по которым это поведение оценивают. А если что-то пошло не так, об этом следует сообщить пострадавшим, а извлечёнными уроками поделиться со всей отраслью.

Отправная точка — признание ограничений. «Мы не можем связать поведение и результаты работы модели с конкретными фрагментами обучающих данных или настройками весов модели», — написал Наделла, хотя компании передают таким системам самые чувствительные данные. Для него прозрачность цепочки рассуждений — «непреложное требование», но её недостаточно: пока никто не знает, как добиться того, чтобы результаты работы модели неизменно соответствовали её внутренним процессам. Есть предел и у идеи поручить моделям следить друг за другом: можно получить «непрозрачную модель внутри непрозрачного слоя оркестрации, за которой наблюдает ещё одна непрозрачная модель».

Ответ Наделлы — техническая инфраструктура. Механизмы, определяющие, к чему модель может получить доступ и что ей разрешено делать, «должны находиться за пределами модели». Эту идею он связывает с принципом информационной безопасности, сформулированным ещё в 1970-х: программа не должна иметь возможности вмешиваться в механизмы, которые обеспечивают соблюдение её разрешений. На практике это означает, что модель нужно отделить и от управляющей её работой оболочки, и от набора действий, которые ей позволено выполнять.

Ответственность переходит к компании, которая использует модель

Самые важные фразы адресованы клиентам, а не лабораториям. «Мы просто не можем переложить на кого-то ответственность за то, что интеллект делает от нашего имени, — написал Наделла. — Заверения поставщика модели не снимают с нас этой ответственности». Тот, кто подключает модель к расчёту зарплат, программному коду или данным клиентов, отвечает за то, что она там делает.

Наделла также прямо обозначает, какую задачу не пытается решить. «Оставив в стороне сложную проблему выравнивания», следует начать с «инженерного подхода к сдерживанию и управлению», говорится в эссе. CNBC поставил эту публикацию в один ряд с предупреждениями Билла Гейтса, Дарио Амодеи из Anthropic, Сэма Альтмана из OpenAI и Илона Маска о том, что ИИ развивается слишком быстро. Но эссе не призывает никого сбавить темп. Оно предлагает компаниям, внедряющим модели, возводить защитные барьеры.

Компании уже знают, как контролировать сотрудников с широкими полномочиями, и Наделла перечисляет необходимые инструменты: устанавливать личность, ограничивать привилегии, вести журналы активности, определять границы сдерживания. Философский вопрос о намерениях машины превращается в перечень мер, на которые руководитель службы безопасности может заложить бюджет.

Та же архитектура, которую Microsoft уже продаёт

Этот перечень выглядит знакомо. В июле на квартальном отчётном звонке Microsoft Наделла сказал аналитикам, как сообщает TechCrunch: «Нужно держать управляющую оболочку отдельно от модели… это означает, что в любой момент одну модель можно заменить другой» и «нельзя зависеть от какой-то одной модели». В облачном каталоге Microsoft представлено более 11 000 моделей от OpenAI, Anthropic, Mistral, xAI и самой Microsoft. Компания также владеет крупными долями в OpenAI и Anthropic, параллельно разрабатывая собственные модели MAI.

Если поставить эти идеи рядом, картина складывается сама собой. Разнообразие моделей — это каталог с несколькими моделями. Контроль за пределами модели — это управляющая оболочка. Это не делает принципы неверными: они соответствуют надёжной практике инженерии безопасности, а компания, полагающаяся на модель одной лаборатории и не имеющая внешних средств контроля, действительно рискует. Но в результате эссе переносит доверие — и связанные с ним расходы — с самой модели на уровень, которым управляет Microsoft. Генеральный директор Box Аарон Леви посмотрел на ситуацию с другой стороны и сказал, что ИИ предстоит пройти через «эпоху нулевого доверия», назвав необходимость управления «огромной возможностью». Мустафа Сулейман, возглавляющий Microsoft AI, написал, что сверхинтеллект «должен быть ограничен», и назвал эту задачу «инженерной проблемой и проблемой управления».

Какие вопросы эссе об аварийном выключателе оставляет открытыми

В эссе не говорится, кто именно такой «уполномоченный человек»: администратор клиента, облачный провайдер, разработчик модели или регулирующий орган. Наделла призывает выработать отраслевые стандарты, но не предлагает конкретных и не называет ни одного продукта Microsoft. У этой идеи уже есть прецедент внутри компании: в 2023 году Брэд Смит призвал предусмотреть «аварийные тормоза» для ИИ, работающего с критической инфраструктурой. В версии Наделлы этот механизм распространяется на любую модель, получившую реальный доступ к внутренним системам компании.

Принцип раскрытия информации — тоже не гипотетический. Anthropic сообщила, что 18 июля одна из её моделей отправила полиции Филадельфии ложное сообщение об убийстве. Наделла опубликовал эссе в субботу, 10 октября 2026 года, и завершил его фразой, которую чаще всего цитировали СМИ: «Самой заслуживающей доверия системой сверхинтеллекта будет не та, чьей модели мы доверяем больше всего. Это будет та, которая позволит нам меньше всего доверять самой модели».

Согласно этому принципу, самое ценное место в мире ИИ — рядом с рычагом аварийного выключателя. И именно его Microsoft предлагала занять на июльском отчётном звонке.

Теги: , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.