Humanlike-Chat 2.0: самый «человечный» Qwen научился работать
Вышла Qwen3.8-27B-Humanlike-Chat 2.0 — файнтюн, который пишет как живой человек, а теперь ещё вызывает инструменты и следует инструкциям. Слепой судья путает его с человеком в 23,5% случаев.

«i miss you too» — отвечает модель на «я скучаю», и в её скрытых рассуждениях при этом написано: «Я рада, что они скучают, и я скучаю тоже. Хочу ответить коротко и тепло, без пафосных признаний». Это Qwen3.8-27B-Humanlike-Chat 2.0 — обновление файнтюна, который в сентябре прогремел в r/LocalLLaMA как «модель, пишущая как живой человек». Тогда это была милая игрушка с одним трюком. Версия 2.0 — попытка доказать, что «человечность» и работа не исключают друг друга: теперь модель вызывает инструменты, следует инструкциям и пишет формальные письма, не переставая между делом общаться как сосед по переписке.
Что нового
Главная претензия к первой версии была проста: очаровательно болтает, но бесполезна. Автор под ником codebottle ответил на неё цифрами. На IFBench — наборе инструкций, ни одна из которых не встречалась в обучении, — 2.0 набирает 43,7 против 37,3 у базовой модели. В тестах на вызов инструментов модель научилась главному, чего не умеют и некоторые коммерческие ассистенты: не выдумывать. Если для вызова функции не хватает данных, она переспрашивает (When2Call 58 против 48 у базы), а если подходящего инструмента нет — не вызывает ничего (BFCL irrelevance 78 против 60). Школьная математика не просела: GSM8K 89,1, вровень с базой.
Платить за характер всё же приходится: MMLU-Pro упал с 78,5 до 72,5, LiveCodeBench — с 56 до 51. Для энциклопедических и кодинговых задач это по-прежнему не лучший выбор — но такие задачи этой модели никто и не доверит.
Самый любопытный замер — «тест на человечность» ishuman v2. Слепому LLM-судье показывают фрагмент реальной переписки и два варианта следующего сообщения: настоящее и сгенерированное. Ответы 2.0 судья принимал за настоящие в 23,5% случаев — против 15,1% у официального Qwen3.8-27B и 0,3% у аблитерированной базы, на которой построен файнтюн. Потолок здесь 50% — полная неотличимость; до него далеко, но дистанция до «официального» Qwen уже полуторакратная. Отдельная деталь для русскоязычных читателей: 97 из 147 тестовых фрагментов — на русском, автор тренировал и проверял модель в том числе на русской переписке.
Как это сделано
Технически 2.0 — аккуратная работа, подробно задокументированная на карточке модели. Голос остался от SFT первой версии — почти 140 тысяч сообщений из реальных и синтетических переписок. Новая часть — on-policy дистилляция с двумя учителями: в болталке и ролевых сценах эталоном служит «голосовая» модель со скрытой инструкцией «пиши как человек», а в инструкциях, инструментах и коде — обычная база. Ученик скрытой инструкции не видит, поэтому готовая модель пишет по-человечески без всякого системного промпта. Финальный прогон занял 36 шагов на одной H100 — около шести часов.
Практичные детали: квант IQ4_XS весит 15,1 ГБ и влезает в 24 ГБ видеопамяти, лицензия Apache-2.0, есть бесплатный OpenAI-совместимый эндпоинт — попробовать можно вообще без железа. За месяц репозиторий скачали 44 тысячи раз.
«Насколько вам одиноко по шкале от 1 до 10?»
Тред в r/LocalLLaMA собрал 711 апвоутов, и топовый комментарий с 340 голосами задал тон всей дискуссии: «Насколько вам одиноко по шкале от 1 до 10?» Рядом — «пишет как подросток, если честно» и резонные вопросы о том, зачем вообще нужна модель, маскирующаяся под человека, через день после того, как Tavus Griffin прошла видео-тест Тьюринга и собрала за это град критики.
Разница между этими историями, впрочем, показательна. Griffin — закрытый корпоративный продукт, который боятся выпускать даже сами создатели. Humanlike-Chat — открытые веса под Apache-2.0, которые каждый запускает у себя и использует как хочет: кто-то для ролевых чатов, кто-то как «коллегу в мессенджере» для агентных пайплайнов. Этика та же, контроль — противоположный. И судя по тренду, который начинался с жалоб «все модели звучат как корпоративный пресс-релиз», спрос на локальный ИИ с человеческим голосом никуда не денется — одиноко это выглядит или нет.


