«Друзья не дают друзьям Ollama»: локальное комьюнити взбунтовалось
Пост с критикой Ollama собрал тысячу апвоутов на r/LocalLLaMA. Разбираем претензии — утечки памяти, слабый multi-GPU — и куда уходят пользователи.

«Друзья не дают друзьям пользоваться Ollama». Пост с таким заголовком за вечер набрал больше тысячи апвоутов и три сотни комментариев на r/LocalLLaMA — сообществе, которое само же и сделало Ollama стандартом де-факто для запуска моделей на своём железе. Когда против инструмента ополчается его собственная аудитория, это интереснее любого пресс-релиза.
Что сломалось
Претензии в треде на удивление конкретные. Первая — утечки памяти в длинных сессиях: у пользователей, которые держат модель загруженной часами, потребление RAM ползёт вверх, пока система не начинает свопить. Вторая — слабая оптимизация под multi-GPU: раскидать большую модель по двум-трём картам через Ollama можно, но конфигурация через переменные окружения выглядит архаично, а утилизация карт получается неровной.
Фоном идёт старое недовольство, которое копилось года два. Ollama построена поверх llama.cpp, но упорно прячет от пользователя его флаги и тонкие настройки. Пока модели были маленькими, удобство перевешивало. Теперь, когда локально гоняют модели на сотни миллиардов параметров и каждый гигабайт VRAM на счету, абстракция начала мешать: прямой llama.cpp даёт полный контроль над выгрузкой слоёв, квантованием KV-кеша и распределением памяти — и всё больше энтузиастов переходят на него, несмотря на менее дружелюбный интерфейс.
Куда уходят
В комментариях сложился примерный маршрут миграции. Кому нужен GUI и простота — LM Studio, который с версии 0.4.15 умеет тензорный параллелизм и аккуратнее работает с разделением dedicated и shared памяти GPU. Кому нужен контроль — голый llama.cpp с llama-server. Text Generation WebUI держится как вариант для тех, кто хочет всё сразу. Ollama в этой картине остаётся инструментом для первого знакомства — «поставил за минуту, запустил модель, понял, что это работает», — но не для серьёзной ежедневной нагрузки.
Справедливости ради, часть треда за Ollama заступается: для новичков ничего проще так и не появилось, а большинство жалоб касается сценариев, в которые типичный пользователь просто не упирается. Однако тон задают не они.
Почему это важнее, чем кажется
Этот бунт — симптом взросления всей локальной сцены. Год назад r/LocalLLaMA радовался тому, что модель вообще запустилась. Сейчас сообщество требует от инструментов продакшн-качества: стабильность в многочасовых сессиях, честную работу с несколькими GPU, предсказуемое поведение памяти. После покупки Hugging Face компанией Nvidia и общего дрейфа индустрии в сторону закрытых экосистем локальный стек остался последним рубежом независимости — и люди хотят, чтобы этот рубеж держали инструменты, которым можно доверять. Ollama придётся либо услышать это, либо смотреть, как аудитория расходится по альтернативам.

