Технологии

OpenAI объявляет о приходе AGI. Упомянутый бенчмарк показывает результат на 37 пунктов ниже

Adrian Kessler

Пост Дженсена Хуана (Jensen Huang) в X уместился в одно предложение и поздравление: «От ChatGPT до o1 и Astra за четыре года — AGI наступил. Поздравляю команду @OpenAI». Он отправил его 6 сентября. Тремя днями ранее Грег Брокман (Greg Brockman), президент OpenAI, использовал почти такую же формулировку в общении с прессой: «Добро пожаловать в эру AGI». Заявления прозвучали почти одновременно, от двух людей с взаимодополняющими интересами, и были восприняты в значительной степени как подтверждение.

Эталонным тестом, лежащим в основе этого утверждения, был ARC-AGI-3. OpenAI заявила, что Astra, её новая граничная модель, выпущенная под обозначением GPT-6, набрала 99,9% в ARC-AGI-3 и 98% в FrontierMath Tier 4. Результаты на таком уровне в стандартных условиях означали бы настоящий разрыв — модель, которая не просто хорошо работает, а попадает в область, которую ранее эталонные тесты рассматривали как недостижимую. Организация, создавшая ARC-AGI-3, опубликовала результат, полученный с помощью их стандартного инструментария оценки: 62,7%.

Тридцать семь процентных пунктов разделяют эти два числа. Оба получены из реальных оценок. Внутренний инструментарий OpenAI и эталонный инструментарий создателей теста — это не один и тот же протокол, и одна и та же модель показывает разные результаты в каждом из них. То, что организация ARC-AGI-3 использует в качестве эталонного условия — то, которое она считает валидным для сравнения моделей в данной области, — дало 62,7%. Внутренняя настройка OpenAI дала 99,9%. Разница между этими числами — это разница между сильным результатом эталонного теста и объявлением о наступлении.

Продажа чипов, стоящая за поздравлением с AGI

Astra обучалась на чипах NVIDIA. Хуан продаёт чипы NVIDIA. Когда генеральный директор публично поздравляет клиента с преодолением исторического порога — порога, который делает оборудование, использованное для создания этого продукта, определяющей инфраструктурой для всего последующего, — это объявление, структурно, является коммерческим заявлением. Не заговор. Структурная реальность: конфликт интересов был очевиден, формулировка касалась наступления, а не производительности, и большинство освещения приняло это без комментариев.

Рынок чипов для инфраструктуры ИИ движется нарративом. Если Astra — это AGI, то всё, на чём обучалась Astra, становится оборудованием мира после AGI — и компании, покупающие чипы для следующего учебного запуска, будут покупать, ориентируясь на этот эталон. Поздравления Хуана, в этом конкретном смысле, также были заявлением о продукте. Это заявление зависело от числа, которое сама организация, создавшая эталон, измерила иначе.

Что показывает независимая проверка — и чего она не показывает

На момент публикации Astra не фигурирует ни в Индексе искусственного интеллекта Artificial Analysis, ни в рейтингах Arena.ai — двух самых наблюдаемых независимых системах оценки граничных моделей. Независимая проверка крупных граничных релизов обычно происходит в течение нескольких дней. Отсутствие здесь не является свидетельством плохой производительности. Это означает, что внешняя валидация, которая обычно сопровождает заявление такого масштаба, пока не материализовалась.

62,7% от создателей эталона — это не опровержение. Результат на таком уровне в ARC-AGI-3 — тесте, разработанном для сопротивления оптимизационным уловкам, которые завышали показатели в более ранних эталонах, — действительно силён. Предшественники ARC-AGI-3 были насыщены: модели поглощали обучающие данные, напоминающие тестовые вопросы, и поднимали числа без улучшения в новом рассуждении. ARC-AGI-3 изменил дизайн вопросов, требуя абстракции поверх извлечения шаблонов. Шестьдесят два целых семь десятых процента в этом тесте, при эталонном инструментарии, — это намного выше всего, что существовало два года назад.

Исследователи, высказавшие возражения, были точны в этом. Способности модели не были их целью. Прыжок от производительности к объявлению — вот что. «Высокие баллы по этим эталонным тестам» и «AGI наступил» требуют промежуточного шага: стабильного, согласованного определения AGI, относительно которого можно измерить наступление. Такого определения не существует в данной области. У OpenAI есть внутреннее. По собственному определению OpenAI, Astra может соответствовать требованиям. Но когда компания измеряет свой продукт по определению, которое сама же написала, это результат иного рода, чем измеренный по внешнему стандарту.

Фраза, которая не сопровождалась определением

В посте Хуана не было оговорок. «AGI наступил» — это утверждение, а не «по некоторым показателям» или «согласно определённым определениям», а чистое прибытие. Названная им четырёхлетняя прогрессия — ChatGPT, o1, Astra — реальна как траектория возможностей. Каждая модель в последовательности расширяла возможное. Представление этой последовательности как путешествия с конечной точкой и объявление этой конечной точки — это другое утверждение: оно говорит, что прибытие отличимо от путешествия, что существует линия, а не наклонная, и что Astra её пересекла.

Число эталонного теста, стоявшее за этим утверждением, составляло 62,7%. Люди, создавшие тест, опубликовали его. Вопрос, который он поднимает — является ли объявление AGI измерением или рыночным ходом — был задан 6 сентября. Освещение в СМИ в основном ответило на него, не задавая.

Теги: , , , , ,

Обсуждение

Имеется 0 комментариев.