Монополия CUDA дала трещину: Unsloth научился обучать LLM на AMD
Unsloth добавил официальную поддержку AMD через ROCm. Файнтюнинг QLoRA одной командой на обычном Radeon, от 3GB VRAM, теперь и на Windows.

Долгие годы дообучение языковых моделей было де-факто вотчиной NVIDIA. Не потому, что железо AMD слабое, а потому, что весь софт — bitsandbytes, FlashAttention, кастомные ядра — писался под CUDA. Владелец Radeon мог гонять инференс, но обучение оставалось уделом энтузиастов, готовых воевать с ROCm вручную. 20 июля это изменилось: Unsloth, один из самых популярных фреймворков для файнтюнинга (68,6 тыс. звёзд на GitHub), выпустил официальную поддержку AMD.
Причём выпустил не в одиночку — это совместный релиз с самой AMD, со статьёй на amd.com за подписью Дэниела и Майкла Ханов и благодарностями инженерам AMD. Символично на фоне остальной недели: пару дней назад мы писали, как AMD затаскивает свою стойку Helios в Azure. Теперь компания атакует NVIDIA не только в железе, но и в софтверной экосистеме.
Что именно заработало
Поддерживается весь цикл: обучение (SFT, LoRA, 4-битный QLoRA), reinforcement learning через GRPO, инференс и локальный деплой. И — что важно — не только на Linux, но и на Windows с WSL. Установка сведена к одной команде: curl -fsSL https://unsloth.ai/install.sh | sh, а для Windows есть вариант через PowerShell. Инсталлятор сам подтягивает ROCm-сборки PyTorch, bitsandbytes и llama.cpp.
Список железа охватывает и потребительские карты, и серверные ускорители:
| Архитектура | Карты | Поддержка |
|---|---|---|
| RDNA 4 | Radeon RX 9000 | полная (Win + WSL + Linux) |
| RDNA 3 | Radeon RX 7000 | полная (Win + WSL + Linux) |
| RDNA 3.5 | Ryzen AI 300 / AI Max «Strix Halo» | полная (Win + WSL + Linux) |
| RDNA 2 | Radeon RX 6000 (gfx1030) | ограниченная, только Linux |
| CDNA 2–4 | Instinct MI200 / MI300 / MI350 | полная, только Linux |
Требуется ROCm 6.0 или новее (актуальные гайды ориентированы на 7.x). Порог входа по памяти низкий: обучение Qwen3.5 стартует от 3 ГБ VRAM, Gemma 4 — от 8 ГБ. Для дообучения доступно более 500 моделей, включая свежие DeepSeek-V4, GLM-5.2, Gemma 4 и Qwen3.6.
Насколько это быстро
Важная оговорка: Unsloth сравнивает не с NVIDIA, а свой оптимизированный стек с обычным на том же железе AMD. Гулявшая по пересказам цифра «90% скорости A100» — выдумка, в первоисточниках её нет. Что есть на самом деле — замеры на ускорителе Instinct MI300X.
На задаче LoRA SFT для Llama-3.1-8B шаг обучения занял 2,07 секунды против 2,87 у связки TRL с FlashAttention2 — это в 1,39 раза быстрее. Пик потребления памяти — 18,3 ГБ против 24,3 ГБ, то есть в 1,33 раза экономнее. В целом Unsloth заявляет до 2× ускорения и до 70% экономии VRAM на обучении и до 80% на RL — без потери точности, за счёт собственных ядер на Triton и HIP.
Источник: Unsloth
Почему это важно
Дело даже не в конкретных процентах, а в самом факте: впервые мейнстримный тренинг-фреймворк заводится на потребительском Radeon и ноутбучном Ryzen AI одной командой, включая Windows. Для локального сообщества это резкое удешевление входа в файнтюнинг — карты AMD дают больше видеопамяти за доллар, а память в этой задаче решает.
Ограничения авторы указывают честно: на старых RX 6000 поддержка урезана и только под Linux, FlashAttention 2 на AMD пока недоступен (используется откат на Xformers), мультиGPU на Windows нет. Но направление задано. CUDA десятилетиями была рвом, который защищал NVIDIA не хуже самих чипов. Теперь по этому рву пустили первую переправу — и построила её сама AMD в связке с open-source-командой.


