ИИ переезжает в браузер: 207 ядер WebGPU от Hugging Face
Hugging Face открыла 207 WebGPU-ядер — в среднем в 2,5 раза быстрее ONNX Runtime. Вместе с движком Magnitude и локальным распознаванием речи Oído это день локального ИИ.

Пока фронтир-лаборатории меряются миллионами токенов вывода, в r/LocalLLaMA главной новостью суток стал инструмент, которому вообще не нужно облако. Пост «Мы открыли исходники самых быстрых WebGPU-ядер в мире» от команды WebAI Hugging Face собрал 521 апвоут — для нишевой библиотеки низкоуровневых GPU-операций это аншлаг. Причина простая: это недостающий фундамент для ИИ, который работает прямо на странице браузера — без API-ключей, подписок и отправки данных на чужие серверы.
Что именно выложили
Релиз состоит из трёх частей. Первая — коллекция из 207 WebGPU-ядер под лицензией Apache-2.0: матричные умножения, нормализации, softmax, операции внимания, квантизация — всё, во что в итоге разворачивается любая нейросеть. Вторая — JavaScript-библиотека @huggingface/kernels, которая загружает и запускает эти ядра из Hub парой строк кода. Третья — Fleet, краудсорсинговый бенчмарк: любой желающий прогоняет тесты в своём браузере, и с его согласия результаты помогают находить сбои и тюнить варианты ядер под реальный парк железа, который ни одна тестовая лаборатория не покроет.
Необычен подход к упаковке: каждое ядро — отдельный версионированный репозиторий с манифестом интерфейса, тестами корректности, бенчмарк-кейсами и параметризованными WGSL-шейдерами. Шейдер превращается из файла по ссылке в полноценный программный артефакт, на который можно положиться. Среди авторов — Джошуа Лохнер, известный как Xenova, создатель transformers.js, уже несколько лет методично переносящий машинное обучение в браузер.
Заявку «самые быстрые в мире» команда подкрепляет замерами против WebGPU-бэкенда ONNX Runtime на Apple M4: по 809 сопоставимым кейсам ядра Hugging Face быстрее в 2,57 раза по геометрическому среднему. Поэлементное сложение — в 3,5 раза быстрее, softmax и layer normalization — вдвое, и лишь скромные 1,14x на матричном умножении, которое в ORT и так вылизано. Отдельные патологические случаи дали разрыв до 10 000 раз, но команда честно оговаривает: это экзотика, а не типичное ускорение, и 947 кейсов из сравнения пришлось исключить из-за несовпадающих результатов или ненадёжных таймингов. Улучшения при этом не остаются в огороде Hugging Face — их апстримят в сам ONNX Runtime.
День локального ИИ
Совпадение или нет, но тот же день принёс ещё два релиза той же направленности. Движок инференса Magnitude компилирует и тюнит ядра прямо на устройстве под конкретное железо и обещает до двух раз больше скорости, чем llama.cpp, на Apple Silicon, NVIDIA, AMD и CPU. Сообщество отнеслось сдержанно: проект делают два разработчика два месяца, мульти-GPU нет, совместимость с моделями ограничена — но после сентябрьского ускорения prompt lookup в llama.cpp в 42 раза планка ожиданий от маленьких команд сильно выросла.
Третий релиз — Oído, локальное распознавание речи, которое обходит Whisper-tiny по качеству при работе целиком на устройстве. Вместе три проекта складываются в цельную картину: опенсорс-сообщество строит полный стек локального инференса — от WGSL-шейдеров до прикладных моделей — параллельно облачному, а не вдогонку ему.
Зачем это пользователю
Самый цитируемый комментарий под постом Hugging Face — фантазия про кооперативные игры, где решения принимает модель на 0,8 ГБ, работающая у каждого игрока в браузере. Это звучит игрушечно, но описывает архитектурный сдвиг точнее любого техдока: вычисления переезжают к пользователю, когда перестают требовать дата-центра.
Практические применения уже рядом: транскрипция звонков без выгрузки записи в облако, поиск по документам внутри корпоративной страницы, ассистенты в веб-приложениях, которые продолжают работать в самолёте. На фоне разворачивающегося спора о конце субсидированного компьюта аргумент локального ИИ становится только весомее: за инференс в собственном браузере невозможно поднять цену. Инфраструктурные релизы вроде нынешнего не попадают в заголовки о сингулярности — но именно из них складывается альтернатива, в которой у облачных тарифов появляется настоящий конкурент.


