GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
qwenлокальные моделиapplellama.cppжелезо

iPhone как вторая видеокарта: Qwen 27B на MacBook ускорился на 44%

Энтузиаст из r/LocalLLaMA подключил iPhone к MacBook на 24 ГБ как сопроцессор: prefill Qwen 3.8 27B вырос на 29–44%, а телефон держит часть контекстного окна.

Влад МакаровВлад Макаровпроверил и опубликовал
4 мин чтения
iPhone как вторая видеокарта: Qwen 27B на MacBook ускорился на 44%

Телефон, который обычно лежит рядом с ноутбуком и отвлекает уведомлениями, можно заставить работать. Автор топового поста в r/LocalLLaMA подключил свой iPhone к MacBook с 24 ГБ памяти как второй вычислитель — и Qwen 3.8 27B начал обрабатывать промпты на 29–44% быстрее. Часть контекстного окна при этом живёт прямо на телефоне. Видеодемонстрация за сутки собрала больше 1370 апвоутов и стала постом дня.

Зачем это вообще нужно

Проблема, которую решает этот хак, знакома каждому владельцу «младшего» Mac: 27-миллиардная модель в 4-битном кванте занимает порядка 15–16 ГБ, и на машине с 24 ГБ унифицированной памяти она помещается впритык. На саму систему, приложения и KV-кеш контекста остаются крохи — длинный диалог или большой документ быстро упираются в потолок.

iPhone в этой схеме берёт на себя две вещи. Во-первых, часть контекстного окна хранится в памяти телефона — на ноутбуке освобождается место. Во-вторых, GPU смартфона подключается к фазе prefill — первичной обработке промпта, самой вычислительно тяжёлой части инференса. Именно отсюда прирост в 29–44%: чем длиннее входной текст, тем заметнее помощь второго чипа.

Сама идея распределённого инференса не нова — в llama.cpp давно есть RPC-режим, позволяющий разносить слои модели по нескольким машинам, и энтузиасты уже гоняли Qwen на связке Mac + ПК с NVIDIA. Новость в другом: впервые в роли второго узла — телефон, который и так лежит в кармане, а не вторая машина за тысячи долларов.

Сообщество оценило

Реакции в треде разошлись от восхищения до пророчеств. «Теперь из-за OP взлетят цены на смартфоны», — шутил один из топовых комментариев, намекая на судьбу RTX 5090, которую скупают в серверные фермы. Другой лаконично резюмировал: «Отличное применение свободы воли».

За шутками — вполне серьёзный тренд. На фоне подорожания железа и ограничений доступа к облачным моделям сообщество локального ИИ выжимает производительность из всего, что есть под рукой: за последнюю неделю r/LocalLLaMA обсуждал и WebGPU-ядра Hugging Face, и сборки на десятках дешёвых GPU. iPhone как сопроцессор — логичное продолжение: у миллионов людей уже лежит в кармане чип с быстрой памятью и мощным GPU, который 95% времени ничего не делает.

Пока это proof-of-concept одного энтузиаста, а не готовый инструмент — кода в открытом доступе нет, и повторить трюк в один клик не получится. Но направление понятно: следующий апгрейд вашего локального ИИ, возможно, уже куплен.

Похожие новости

Листайте вниз

для загрузки следующей статьи