llama.cpp ускорила prompt lookup в 42 раза: 70B за 20 мс
Новый механизм probabilistic attention caching в llama.cpp дал 42-кратное ускорение драфтинга: 70B-модели отвечают за 20 мс на потребительских GPU.

Локальные 70B-модели научились отвечать быстрее, чем человек моргает. В llama.cpp появился новый механизм prompt lookup drafting, ускоряющий этап драфтинга в 42 раза: задержка ответа моделей класса 70B на потребительских видеокартах упала ниже 20 миллисекунд, а потребление VRAM — на 60%. Пост с разбором держится в топе r/LocalLLaMA с 412 апвоутами и сотней комментариев.
Что произошло
Идея называется probabilistic attention caching — вероятностное кеширование внимания. Классический prompt lookup ищет в уже введённом тексте буквальные совпадения и использует их как черновик для спекулятивного декодирования. Новый механизм идёт дальше: лёгкая байесовская сеть предсказывает наиболее вероятные пути токенов и кеширует соответствующие паттерны внимания заранее. Модель не пересчитывает то, что почти наверняка понадобится, — оно уже лежит готовым.
Отсюда и второй эффект: раз значительная часть attention-состояний переиспользуется, их не нужно держать в памяти в полном объёме. Экономия VRAM в 60% означает, что модели, раньше требовавшие пары RTX 4090, начинают помещаться на одну карту.
Ключевые цифры:
- Ускорение драфтинга: 42x
- Задержка 70B-моделей: менее 20 мс на потребительских GPU
- Экономия VRAM: 60%
- Статус: доступно в llama.cpp
Почему это важно
Двадцать миллисекунд — это порог, за которым диалог с моделью перестаёт ощущаться как переписка и становится разговором. Пользователи в комментариях уже описывают агентов, которые реагируют в реальном времени на локальном железе — без API, подписок и отправки данных наружу. Для сообщества, которое собирает инференс-риги из пары RTX 3090 и обсуждает каждый гигабайт видеопамяти, это ускорение — больший подарок, чем любой новый релиз весов.
Заметен и общий сдвиг: ещё месяц назад r/LocalLLaMA мерился размерами моделей, теперь главные посты — про оптимизацию. Локальный инференс взрослеет: вопрос «влезет ли модель» сменяется вопросом «насколько быстро она полетит».
Что дальше
Ждём портирования подхода в другие рантаймы — от vLLM до MLX — и проверки цифр на широком парке железа. Если 42x подтвердятся за пределами синтетических тестов, разрыв в отзывчивости между локальными моделями и облачными API исчезнет как класс.

