Технологии

Фэй-Фэй Ли о продаже World Labs компании AMD: «Вселенная состоит не из слов, а из реальных вещей…»

Объявляя о продаже World Labs компании AMD, Фэй-Фэй Ли повторила идею, на которой построена её лаборатория. В устах будущего главного научного сотрудника производителя чипов это уже не философия, а ставка на железо.
Adrian Kessler
Добавьте нас в Google

Фэй-Фэй Ли (Fei-Fei Li) — учёная, благодаря которой машины научились видеть. Теперь она продала лабораторию, созданную для того, чтобы вывести ИИ за пределы языка. Объявляя о том, что World Labs войдёт в состав AMD — компании по производству чипов, которой руководит её давняя сторонница Лиза Су, — Ли одним предложением вновь сформулировала убеждение, лежащее в основе компании. Это одновременно и вызов эпохе ИИ, в которой на первом месте стоят слова.

«Вселенная состоит не из слов, а из реальных вещей. Для решения многих важнейших задач, стоящих перед ИИ, — от науки и индустрии развлечений до робототехники, — моделям необходимо рассуждать о структуре и поведении физического мира».

Ли написала это в публикации «World Labs to AMD» в своём блоге на Substack; цитату привело издание The Register в материале о сделке. Предшествующее предложение задаёт её суть: компания «руководствовалась фундаментальным убеждением, что одного языка недостаточно для создания моделей».

AMD согласилась приобрести World Labs в рамках сделки с оплатой акциями, оценённой примерно в 8,2 миллиарда долларов. Если регуляторы дадут одобрение, её планируют закрыть до конца 2026 года. Ли станет исполнительным вице-президентом AMD и главным научным сотрудником, подчиняясь напрямую Су. Основанная в Сан-Франциско в начале 2024 года Ли, Беном Милденхоллом и Джастином Джонсоном лаборатория разрабатывает то, что в индустрии называют моделями мира: системы, которые создают, реконструируют и симулируют трёхмерную среду на основе текста, изображений и видео. Если большая языковая модель предсказывает следующее слово, то модель мира, как выразился The Register, представляет себе окружающую среду и уже отталкивается от неё, решая задачу.

Первое, что приходит в голову, — поставить это высказывание в один ряд с позицией Янна ЛеКуна, бывшего главного специалиста Meta по ИИ, который предположил, что большие языковые модели могут оказаться тупиковым путём. Но Ли формулирует мысль осторожнее: The Register отдельно подчеркнул, что она не выступает против больших языковых моделей. Последняя модель её лаборатории, напротив, заимствует их подход: по словам Ли, Atlas предсказывает следующий ракурс по набору двумерных изображений так же, как языковая модель предсказывает следующий токен. Спор у неё не с методом, а с материалом. Текст — это созданная людьми запись о мире; Ли же утверждает, что задачи, которые действительно стоит решать, — от науки и развлечений до робототехники — существуют в самой реальности, описанной словами.

Значение этих слов определяется тем, кто за них заплатил. Производитель чипов не станет тратить миллиарды в виде акций ради одной философской идеи. В объявлении AMD объясняет покупку вычислительными задачами и отмечает, что по мере распространения ИИ в робототехнике, симуляциях и физическом ИИ «требования к вычислительной инфраструктуре становятся всё разнообразнее». Слова Су говорят о главном: «Создание вычислительных платформ для следующего поколения ИИ требует глубокого понимания того, как развиваются модели». Проще говоря, AMD хочет увидеть будущую вычислительную нагрузку ещё до того, как разработает кремний для её обработки. Как отмечает The Register, на фоне Nvidia инженерная команда AMD, отвечающая за программное обеспечение, невелика. World Labs даст компании собственную исследовательскую группу — всего через несколько недель после того, как AMD согласилась купить стартап Taalas, встраивающий веса моделей непосредственно в кремний.

Ли описывает ту же логику с другой стороны. «Без целенаправленной работы над аппаратным обеспечением ИИ ограничен и в эффективности, и в масштабировании. А для наших задач он так и остаётся заперт в цифровом мире», — пишет она. В этом и состоит практический смысл её высказывания. Модель, способная рассуждать о физическом пространстве, полезна ровно настолько, насколько машина может работать с ней достаточно быстро, чтобы управлять роботом. Ли решила, что кратчайший путь к такой машине — перейти в компанию, которая её производит.

Эти слова звучат весомо ещё и благодаря карьере, которая за ними стоит. В 2000 году Ли пришла в эту область, чтобы исследовать зрительный интеллект — и у машин, и у мозга. Работа её лаборатории над ImageNet помогла открыть современную эпоху ИИ; позднее она основала подразделение ИИ в Google Cloud и стала его главным научным сотрудником, а также первым директором Стэнфордского института человекоориентированного ИИ. Четверть века спустя её доводы не изменились. Изменились ставки. Когда сделка будет закрыта, профессор, отстаивавшая эту идею, станет подчиняться Су.

Если Ли права, AMD получила возможность заранее увидеть вычислительные задачи, которые определят следующее поколение оборудования для ИИ. Если она ошибается и язык продолжит поглощать всё вокруг, компания приобрела дорогостоящую страховку. Именно так The Register и трактует сделку: как защиту на случай, если большие языковые модели в итоге окажутся тупиковым путём.

Слова Ли начинаются как утверждение о Вселенной. К моменту закрытия сделки они превратятся в спецификацию.

Теги: , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.