iPhone как вторая видеокарта: Qwen 27B на MacBook ускорился на 44%
Энтузиаст из r/LocalLLaMA подключил iPhone к MacBook на 24 ГБ как сопроцессор: prefill Qwen 3.8 27B вырос на 29–44%, а телефон держит часть контекстного окна.

Телефон, который обычно лежит рядом с ноутбуком и отвлекает уведомлениями, можно заставить работать. Автор топового поста в r/LocalLLaMA подключил свой iPhone к MacBook с 24 ГБ памяти как второй вычислитель — и Qwen 3.8 27B начал обрабатывать промпты на 29–44% быстрее. Часть контекстного окна при этом живёт прямо на телефоне. Видеодемонстрация за сутки собрала больше 1370 апвоутов и стала постом дня.
Зачем это вообще нужно
Проблема, которую решает этот хак, знакома каждому владельцу «младшего» Mac: 27-миллиардная модель в 4-битном кванте занимает порядка 15–16 ГБ, и на машине с 24 ГБ унифицированной памяти она помещается впритык. На саму систему, приложения и KV-кеш контекста остаются крохи — длинный диалог или большой документ быстро упираются в потолок.
iPhone в этой схеме берёт на себя две вещи. Во-первых, часть контекстного окна хранится в памяти телефона — на ноутбуке освобождается место. Во-вторых, GPU смартфона подключается к фазе prefill — первичной обработке промпта, самой вычислительно тяжёлой части инференса. Именно отсюда прирост в 29–44%: чем длиннее входной текст, тем заметнее помощь второго чипа.
Сама идея распределённого инференса не нова — в llama.cpp давно есть RPC-режим, позволяющий разносить слои модели по нескольким машинам, и энтузиасты уже гоняли Qwen на связке Mac + ПК с NVIDIA. Новость в другом: впервые в роли второго узла — телефон, который и так лежит в кармане, а не вторая машина за тысячи долларов.
Сообщество оценило
Реакции в треде разошлись от восхищения до пророчеств. «Теперь из-за OP взлетят цены на смартфоны», — шутил один из топовых комментариев, намекая на судьбу RTX 5090, которую скупают в серверные фермы. Другой лаконично резюмировал: «Отличное применение свободы воли».
За шутками — вполне серьёзный тренд. На фоне подорожания железа и ограничений доступа к облачным моделям сообщество локального ИИ выжимает производительность из всего, что есть под рукой: за последнюю неделю r/LocalLLaMA обсуждал и WebGPU-ядра Hugging Face, и сборки на десятках дешёвых GPU. iPhone как сопроцессор — логичное продолжение: у миллионов людей уже лежит в кармане чип с быстрой памятью и мощным GPU, который 95% времени ничего не делает.
Пока это proof-of-concept одного энтузиаста, а не готовый инструмент — кода в открытом доступе нет, и повторить трюк в один клик не получится. Но направление понятно: следующий апгрейд вашего локального ИИ, возможно, уже куплен.

