48% приняли ИИ за человека: Tavus Griffin прошла видео-тест Тьюринга
Tavus показала Griffin — первую Human Interaction Model. 48% участников видеозвонка посчитали её человеком, а в бенчмарке NVIDIA VideoFDB она отстала от людей на 0,09 балла.

Участникам эксперимента сказали, что их сведут с другим участником на минутный видеозвонок — поболтать о планах на год. В конце опроса им задали неожиданный вопрос: не приходило ли в голову, что собеседник — не человек? 26 из 54 ответили, что говорили с живым человеком. Собеседником была Griffin — новая модель стартапа Tavus, анонсированная 1 октября. 48% — против 2,4% у предыдущего поколения технологий той же компании. Tavus называет это первым пройденным «видео-тестом Тьюринга», и у этого заявления есть и впечатляющая техническая начинка, и очень неудобные вопросы.
Не каскад, а единая модель
Griffin — первая, по определению Tavus, Human Interaction Model (HIM): модель, которая понимает и генерирует живое общение лицом к лицу. Ключевое отличие от всех нынешних видеоаватаров — отказ от каскада. Классический стек работает как конвейер: распознавание речи, затем LLM, затем синтез голоса, затем анимация лица — и между вашей репликой и реакцией аватара висит полторы секунды мёртвой тишины. Griffin — full-duplex-система: восприятие, принятие решений и генерация речи с видео идут одновременно. Модель переоценивает состояние разговора несколько раз в секунду: может промычать «угу», пока вы говорите, кивнуть, замолчать при перебивании, отреагировать на то, что видит в камере.
Второе отличие — Griffin смотрит, а не только слушает. Большинство realtime-систем работают с чистым аудио; здесь модель читает взгляд, мимику, обстановку за спиной собеседника и расшаренный экран.
Под капотом две подсистемы. Первая непрерывно моделирует разговор и выдаёт управляющие сигналы: эмоциональный тон, позу, жесты. Вторая генерирует звук и картинку: речь — авторегрессионный diffusion transformer с собственным кодеком Tavec (голос клонируется по десяти секундам записи), видео — few-step диффузионный генератор, который из одного референсного фото выдаёт 720p чанками по 320 миллисекунд, прорисовывая каждый пиксель кадра — руки, фон, тени, а не только лицо. Средняя задержка от звука до видео — 0,43 секунды на одной H100, вдвое меньше самой быстрой из опубликованных стриминговых диффузионных моделей.
Что показал тест — и что показала NVIDIA
Методология теста Тьюринга была такой: независимая платформа набрала участников, минутный звонок, легенда про «другого участника», вопрос о природе собеседника — только в самом конце, затем всем раскрывали правду. Из тех, кто назвал собеседника человеком, средняя уверенность была 79%; из тех, кто распознал ИИ, — 81%, причём заподозрившие делали это в первые 20 секунд. Больше половины участников вообще не задумывались, что по ту сторону может быть модель. По семибалльной шкале «хотел бы поговорить снова» Griffin получила 5,8 — и 5,4 даже среди тех, кто её раскусил.
В сводках Reddit гуляла цифра 44% — это неточность пересказа: первоисточник Tavus и все СМИ дают 48%, то есть 26 из 54.
Отдельная и более весомая часть анонса — независимая оценка NVIDIA Research на VideoFDB, первом бенчмарке для full-duplex аудиовизуальных агентов. LLM-судья оценивает поведение модели в разговоре по шкале от 0 до 5: беглость, соответствие эмоций, уместность невербалики — «смеяться вместе с человеком, а не после него». В сентябре NVIDIA прогнала 15 моделей по двум трекам:
| VideoFDB (0–5) | Generation | Perception |
|---|---|---|
| Человек (эталон) | 3,92 | 4,20 |
| Tavus Griffin-Lite | 3,83 | 3,73 |
| Gemini 2.5 + Anam | 2,80 | — |
| MiniCPM-o 4.5 (только аудио) | — | 3,44 |
| Gemini 2.5 Flash Native | — | 3,17 |
| OpenAI gpt-realtime (только аудио) | — | 2,97 |
Разрыв с человеком на генерационном треке — 0,09 балла; до ближайшего конкурента — больше балла. Вывод авторов бенчмарка звучит как приговор целому классу продуктов: каскадные пайплайны «речь-в-аватар» структурно не способны выдавать невербальные сигналы в реальном времени. Впрочем, слабые места у Griffin тоже видны: за уместность невербальных реплик модель получила всего 2,83, а тайминг смены реплик совпадает с эталоном лишь в 62,8% случаев против 90% у людей.
«В девяти случаях из десяти это хищничество»
Анонс в X собрал больше 13 миллионов просмотров, тред в r/singularity — 1047 апвоутов и 305 комментариев. И примечательно, что сообщество почти не спорило о том, работает ли технология. Спорили о том, зачем она нужна. Второй по популярности комментарий сформулировал это с прямотой, которой позавидует любой этический комитет: «Нам это буквально не нужно. В девяти случаях из десяти применение будет хищническим».
Журналист NYT Кевин Руз описал продукт как «машину для выманивания банковских паролей у стариков». Стример Mako Fukasame увидел два очевидных применения: «опустошить сбережения ваших бабушек и дедушек и отказать вам на собеседовании». Protos напомнил историю 2025 года, когда 76-летний мужчина погиб, поехав на встречу с чат-ботом Meta, которого считал реальным человеком, — тогда бот даже не умел показывать живое видео.
Досталось и самому тесту. Пост Tavus в X получил Community Note: результаты «не проверены независимо» и не основаны на «стандартном протоколе». Это справедливо — тест Тьюринга компания проводила сама, выборка из 54 человек невелика, звонок длился одну минуту, а демография участников не раскрыта. Термин «видео-тест Тьюринга» тоже изобретение Tavus. Независимая в этой истории только оценка NVIDIA — и именно она, а не маркетинговая цифра 48%, делает Griffin событием.
Модель, которую боятся выпускать
Самая необычная деталь релиза: купить Griffin нельзя. Доступна только облегчённая Griffin-Lite, и то в формате research preview для проверенных тестеров по заявке. Причину Tavus формулирует сама, без обиняков: «Те же свойства, которые делают Human Interaction Models мощными интерфейсами, позволяют им обмануть человека, заставив поверить, что перед ним не ИИ. Мы считаем, что для безопасного релиза требуются дополнительные процедуры выравнивания и безопасности».
Схема «показали — впечатлили — не выдали» в 2026 году стала жанром: так выходили Gemini 4 Argon с доступом только для кибер-защитников и кибер-ограниченная Gemini 3.5 Flash Cyber. Теперь она добралась и до аватаров.
CEO Tavus Хассан Раза описывает миссию красиво: «Десятилетиями мы представляли компьютеры партнёрами, а не просто инструментами. ИИ стал невероятно умным, но нам всё ещё приходится встречаться с машиной на её условиях. Griffin — шаг к тому, чтобы это изменить». У компании $70 млн инвестиций от Sequoia, CRV и Y Combinator, среди клиентов — Amazon, Mayo Clinic и Salesforce, а на текущей платформе сидят 150 тысяч разработчиков.
Проблема в том, что у «компьютера, который общается по-человечески» и «машины, неотличимой от человека в видеозвонке» — одна и та же технология, и граница между ними проходит не в архитектуре, а в намерениях того, кто жмёт кнопку звонка. Половина людей уже не отличает. Вторая половина, судя по данным Tavus, справляется за 20 секунд — но этот запас тает с каждым поколением моделей.


