GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
amdnvidiaunslothrocmфайнтюнинглокальный-ии

Монополия CUDA дала трещину: Unsloth научился обучать LLM на AMD

Unsloth добавил официальную поддержку AMD через ROCm. Файнтюнинг QLoRA одной командой на обычном Radeon, от 3GB VRAM, теперь и на Windows.

Влад МакаровВлад Макаровпроверил и опубликовал
5 мин чтения
Монополия CUDA дала трещину: Unsloth научился обучать LLM на AMD

Долгие годы дообучение языковых моделей было де-факто вотчиной NVIDIA. Не потому, что железо AMD слабое, а потому, что весь софт — bitsandbytes, FlashAttention, кастомные ядра — писался под CUDA. Владелец Radeon мог гонять инференс, но обучение оставалось уделом энтузиастов, готовых воевать с ROCm вручную. 20 июля это изменилось: Unsloth, один из самых популярных фреймворков для файнтюнинга (68,6 тыс. звёзд на GitHub), выпустил официальную поддержку AMD.

Причём выпустил не в одиночку — это совместный релиз с самой AMD, со статьёй на amd.com за подписью Дэниела и Майкла Ханов и благодарностями инженерам AMD. Символично на фоне остальной недели: пару дней назад мы писали, как AMD затаскивает свою стойку Helios в Azure. Теперь компания атакует NVIDIA не только в железе, но и в софтверной экосистеме.

Что именно заработало

Поддерживается весь цикл: обучение (SFT, LoRA, 4-битный QLoRA), reinforcement learning через GRPO, инференс и локальный деплой. И — что важно — не только на Linux, но и на Windows с WSL. Установка сведена к одной команде: curl -fsSL https://unsloth.ai/install.sh | sh, а для Windows есть вариант через PowerShell. Инсталлятор сам подтягивает ROCm-сборки PyTorch, bitsandbytes и llama.cpp.

Список железа охватывает и потребительские карты, и серверные ускорители:

АрхитектураКартыПоддержка
RDNA 4Radeon RX 9000полная (Win + WSL + Linux)
RDNA 3Radeon RX 7000полная (Win + WSL + Linux)
RDNA 3.5Ryzen AI 300 / AI Max «Strix Halo»полная (Win + WSL + Linux)
RDNA 2Radeon RX 6000 (gfx1030)ограниченная, только Linux
CDNA 2–4Instinct MI200 / MI300 / MI350полная, только Linux

Требуется ROCm 6.0 или новее (актуальные гайды ориентированы на 7.x). Порог входа по памяти низкий: обучение Qwen3.5 стартует от 3 ГБ VRAM, Gemma 4 — от 8 ГБ. Для дообучения доступно более 500 моделей, включая свежие DeepSeek-V4, GLM-5.2, Gemma 4 и Qwen3.6.

Насколько это быстро

Важная оговорка: Unsloth сравнивает не с NVIDIA, а свой оптимизированный стек с обычным на том же железе AMD. Гулявшая по пересказам цифра «90% скорости A100» — выдумка, в первоисточниках её нет. Что есть на самом деле — замеры на ускорителе Instinct MI300X.

На задаче LoRA SFT для Llama-3.1-8B шаг обучения занял 2,07 секунды против 2,87 у связки TRL с FlashAttention2 — это в 1,39 раза быстрее. Пик потребления памяти — 18,3 ГБ против 24,3 ГБ, то есть в 1,33 раза экономнее. В целом Unsloth заявляет до 2× ускорения и до 70% экономии VRAM на обучении и до 80% на RL — без потери точности, за счёт собственных ядер на Triton и HIP.

График эффективности обучения Unsloth на AMD Instinct MI300X: время на шаг и потребление VRAM для Llama-3.1-8B Источник: Unsloth

Почему это важно

Дело даже не в конкретных процентах, а в самом факте: впервые мейнстримный тренинг-фреймворк заводится на потребительском Radeon и ноутбучном Ryzen AI одной командой, включая Windows. Для локального сообщества это резкое удешевление входа в файнтюнинг — карты AMD дают больше видеопамяти за доллар, а память в этой задаче решает.

Ограничения авторы указывают честно: на старых RX 6000 поддержка урезана и только под Linux, FlashAttention 2 на AMD пока недоступен (используется откат на Xformers), мультиGPU на Windows нет. Но направление задано. CUDA десятилетиями была рвом, который защищал NVIDIA не хуже самих чипов. Теперь по этому рву пустили первую переправу — и построила её сама AMD в связке с open-source-командой.

Похожие новости

Листайте вниз

для загрузки следующей статьи