Технологии

OpenAI называет Astra самой безопасной моделью и не объясняет, как она рассуждает

Adrian Kessler

Astra работает с кодом, анализом безопасности, компьютерным использованием и многошаговыми профессиональными задачами со скоростью и точностью, превосходящими предыдущую модель OpenAI — Sol, а также Anthropic Fable, по стандартным бенчмаркам программной инженерии. Компания описывает её как первую модель, которую она построила, пересекающую уровень «Critical» в области кибербезопасности: Astra способна выявлять и разрабатывать эксплойты для ранее неизвестных уязвимостей безопасности в масштабе и с такой скоростью, которые не под силу ни одной команде людей.

Механизм, стоящий за этим, — техника, называемая непрозрачной рекуррентностью. Стандартные языковые модели генерируют свои рассуждения в виде читаемого текста — цепочки мыслей, которую исследователи используют для аудита решений, выявления ошибок и проверки того, что модель ведёт себя так, как задумано. Astra работает без выдачи этого текста. Она способна решать сложные задачи, не оставляя читаемого следа процесса. Главный научный сотрудник OpenAI Якуб Пахоцки (Jakub Pachocki) признал этот сдвиг: более мощные модели, по его словам, могут «выполнять более сложные задачи, используя меньше языковых токенов». Мониторинг становится тем сложнее, чем больше эта способность.

Это создаёт структурную проблему, которую делают очевидной собственные заявления OpenAI. Компания описывает Astra как свою «самую согласованную модель» на сегодняшний день. Согласованность — инженерная дисциплина, занимающаяся тем, чтобы системы ИИ вели себя так, как задумали их разработчики, — исторически опиралась на чтение того, что модель делает шаг за шагом. Модель, которая рассуждает невидимо, делает свою собственную согласованность непроверяемой этим методом. OpenAI публично не описала, какой альтернативный метод она использует для проверки поведения Astra до развёртывания.

Президент OpenAI Грег Брокман (Greg Brockman) назвал Astra «поколенческим скачком» и был напрямую спрошен, представляет ли она собой искусственный общий интеллект. Его ответ: контрактное определение AGI, регулировавшее партнёрство OpenAI с Microsoft, больше не действует. AGI, сказал он, теперь — «духовное понятие». Эта формулировка имеет значение. Соглашение OpenAI с Microsoft включало пункты, привязанные к AGI, — условия, при которых изменились бы условия отношений. Описание AGI как неопределённого понятия оставляет эти пункты бездействующими, независимо от того, на что способна Astra.

Доступ был впервые предоставлен Daybreak — проверенной программе кибербезопасности OpenAI, — структуре, которую компания подаёт как развёртывание с упором на защиту. Логика в том, что организации, ищущие уязвимости в своих собственных системах, получают возможность раньше тех, кто ищет уязвимости в чужих. Эта логика работает только до тех пор, пока средства контроля доступа работают. Способности Astra к выявлению zero-day по своей сути являются именно тем, что хотел бы получить хорошо оснащённый злоумышленник. Модель, которая рассуждает без читаемой цепочки мыслей, также труднее сдерживать или аудировать постфактум, если что-то пойдёт не так.

Более широкий доступ развёртывается для платных уровней — Pro, Plus, Enterprise, Business — и через API в ближайшую неделю.

Теги: , , , , ,

Обсуждение

Имеется 0 комментариев.