Технологии

AMD покупает Taalas — чип с весами ИИ в кремнии работает в 48 раз быстрее Nvidia

Susan Hill

AMD приобретает Taalas — стартап из Торонто, который создаёт чипы, встраивающие веса ИИ-моделей непосредственно в кремний, а не загружающие их из памяти во время инференса. Чип HC1 генерирует 16 960 токенов в секунду на модели Llama 3.1 8B от Meta — показатель, который, по утверждению AMD, в 48 раз быстрее графических процессоров Nvidia и в 8,5 раза быстрее Cerebras, специалиста по чипам для инференса.

Технология Taalas использует структурную неэффективность текущего процесса ИИ-инференса. Стандартные GPU универсальны: они могут запускать любую модель, переключаться между задачами по требованию и перепрограммироваться при обновлении модели. Однако эта гибкость является и узким местом. Загрузка миллиардов весов модели из высокоскоростной памяти в вычислительные блоки при каждом запросе инференса создаёт задержку, которую невозможно устранить простым добавлением GPU.

Taalas встраивает эти веса непосредственно в кремний чипа на этапе производства. Модель живёт в аппаратном обеспечении, а не в памяти, которая подгружается при каждом запросе. Показатели пропускной способности, которые рекламирует AMD, отражают этот архитектурный выбор — но за цену, которую компания не преуменьшает: как только чип изготовлен с конкретной моделью, её обновление требует нового выпуска фотошаблонов кремния. Taalas утверждает, что для обновления модели достаточно заменить всего два слоя металла, что сокращает цикл, но такие чипы не могут адаптироваться на лету к более новой версии модели.

В рамках плана интеграции AMD чипы Taalas будут обрабатывать генерацию токенов — самую затратную по времени фазу инференса, — в то время как GPU AMD Instinct будут выполнять префилл и вычисления внимания в начале каждого запроса. Объединённая система работает на платформе AMD Helios rack-scale. Для облачных операторов, работающих с фиксированными моделями — боты поддержки клиентов, конвейеры обработки документов, перевод в реальном времени — обещание заключается в пропускной способности на ватт стойки, которую гибкие кластеры GPU не могут достичь при сопоставимой стоимости.

Выдержит ли эта калькуляция темпы обновления моделей в отрасли — центральный вопрос. Крупные лаборатории сейчас обновляют свои производственные модели примерно каждые шесть месяцев. Чип, привязанный к Llama 3.1 8B сегодня, может потребоваться вывести из эксплуатации, когда преемник станет стандартным целевым развёртыванием. Заявление Taalas о двухслойном обновлении металла помогает, но выпуск фотошаблонов всё равно занимает месяцы — существенное отставание, когда модели обновляются быстрее, чем циклы аппаратного обеспечения.

Приобретение происходит через семь месяцев после покупки Nvidia Groq — другого подхода к той же проблеме скорости инференса — за якобы 20 миллиардов долларов. Тензорные потоковые процессоры Groq также оптимизированы для пропускной способности, но сохраняют возможность загрузки разных моделей. AMD платит нераскрытую, но предположительно меньшую сумму за стартап, сделавший противоположную ставку.

Для покупателей приобретение Taalas относится скорее к дорожной карте, чем к каталогу. Чип HC2, ориентированный на модели с до 20 миллиардов параметров, ещё в разработке. Показатель 48x относится к HC1 при определённых условиях — реальные развёртывания со смешанным трафиком и разными размерами пакетов дадут другие результаты. Закрытие сделки ожидается в четвёртом квартале 2026 года при условии одобрения регулирующих органов. HC1 поставлялся в феврале на 6-нм техпроцессе; дата поставки HC2 и целевой техпроцесс остаются неподтверждёнными.

Теги: , , , ,

Обсуждение

Имеется 0 комментариев.