Frozen v2: Google хочет впечатать Gemini прямо в кремний
Google разрабатывает чип Frozen v2, в который навсегда встроена архитектура Gemini. До 10 раз больше токенов на ватт — и риск устареть при смене архитектуры.

Что будет, если спроектировать процессор под одну-единственную нейросеть — так, чтобы он в принципе не мог запускать ничего другого? В Google, судя по всему, решили это выяснить. The Information сообщает со ссылкой на источники в компании: под внутренним кодовым именем Frozen v2 разрабатывается серверный инференс-чип, в кремний которого навсегда «вморожена» архитектура Gemini. Инженеры ожидают от него в 6–10 раз больше токенов на ватт, чем дают новейшие TPU.
Рынок отреагировал мгновенно: акции Alphabet в понедельник подскакивали на 3,7% и закрылись в плюсе — очень кстати за два дня до квартального отчёта, который выходит сегодня.
Почему «замороженный»
Название — отсылка к термину из машинного обучения: «заморозкой» называют фиксацию параметров модели, которые больше не обучаются. Здесь заморожено буквально всё, что касается устройства модели.
Обычный ускоритель — TPU или GPU — универсален: он умеет перемножать матрицы и на лету решает, как раскидать по себе любую модель. За гибкость приходится платить — планированием операций, перемещением данных между чипом и внешней памятью. Перенос данных из памяти обходится примерно на два порядка дороже по энергии, чем сама арифметика. Frozen v2 убирает эти накладные расходы радикально: структура Gemini — размерности слоёв, головы внимания, маршрутизация — прошита прямо в схемотехнике. Чипу не нужно ничего решать в рантайме: он сам и есть модель, точнее её скелет.
Важная деталь: веса при этом остаются загружаемыми. Первую версию проекта Frozen, которую инициировал шеф-сайентист Google DeepMind Джефф Дин, свернули именно потому, что она впечатывала в кремний и обученные веса — такой чип превращался в металлолом с каждым обновлением модели. Во второй версии заморожен только каркас: новые поколения Gemini можно будет заливать на тот же чип, пока они сохраняют ту же архитектуру.
Ставка на то, что трансформер — это навсегда
В этом «пока» и прячется главный риск проекта. Frozen v2 — по сути ставка на то, что архитектура трансформера достигла зрелости и в ближайшие годы не изменится фундаментально. Если Google перейдёт на state-space-модели или другую пост-трансформерную конструкцию, специализированный чип устареет в один день. Источники The Information говорят, что в компании ещё не решили, какую именно часть архитектуры прошивать — чем меньше зафиксируешь, тем безопаснее, но тем меньше выигрыш.
Официально Google проект не подтверждает. В комментарии CNBC компания ограничилась формулой о том, что команды «постоянно исследуют и экспериментируют с новыми решениями ради максимальной производительности и эффективности», и не каждый проект доходит до продакшена.
Зачем это Google
Ответ короткий: вычислений катастрофически не хватает. Сундар Пичаи ещё на отчёте за первый квартал признавал, что Google «ограничена в вычислительных мощностях» и облачная выручка была бы выше, будь у компании возможность удовлетворить спрос. Цифры говорят сами за себя: бэклог Google Cloud приближается к $462 млрд, Gemini API обрабатывает 85 млрд запросов в месяц, а пока строятся собственные дата-центры (более $180 млрд инфраструктурных расходов в этом году), Google платит SpaceX около $920 млн в месяц за аренду ~110 тысяч GPU NVIDIA.
Инференс уже съедает порядка двух третей всех AI-вычислений индустрии — и именно здесь шести-десятикратный выигрыш в энергоэффективности конвертируется в миллиарды. При этом Frozen v2 не заменит TPU: это параллельная экспериментальная ветка рядом с анонсированными в апреле TPU 8t и TPU 8i, с тиражами куда скромнее. Продавать или сдавать такой чип в аренду облачным клиентам почти наверняка не будут — чужие модели он физически не запустит. Развёртывание в собственных дата-центрах Google ожидается не раньше 2028 года.
Что это значит для индустрии
Если ставка сыграет, Frozen v2 станет первым производственным ASIC под конкретное семейство моделей — и тем же вопросом немедленно зададутся Amazon с Trainium, Microsoft с Maia и Meta с MTIA. Аналитики уже сравнивают подход с Apple M-серией: та же философия совместного проектирования железа и софта, доведённая до предела — до одного семейства моделей.
Скептики напоминают, что момент для окончательной фиксации архитектуры Google выбрала странный: следующая Gemini Pro задерживается, DeepMind за год потеряла нескольких ключевых людей, а китайские модели, по свежим оценкам, обслуживают уже 45% токенов американских компаний. Впечатывать в кремний архитектуру, которой ещё предстоит доказать конкурентоспособность, — смелость на грани азарта.
Сегодня вечером Alphabet отчитывается за второй квартал. Подтвердит ли Пичаи существование Frozen v2 — вопрос открытый, но тема энергоэффективности инференса на звонке прозвучит наверняка.

