Заявлено второе место, измерено четвёртое: проверка Kimi K3
Moonshot обещала интеллект «сразу за Fable 5». Независимые замеры дали 4-е место, 51% галлюцинаций и вдвое меньшую скорость. Разбираем, где цифры разошлись.

Через неделю после релиза Kimi K3 на Reddit собрал сотни комментариев пост с простым заголовком: модель работает заметно хуже свежих фронтирных систем, чем следует из анонса. Формулировка резкая — и, если смотреть на данные, преувеличенная. Но за ней стоит настоящий разрыв между тем, что заявила Moonshot AI, и тем, что намерили независимые оценщики. Разбираемся, где именно цифры разъехались.
Что обещали
Kimi K3 вышла 16 июля — модель на 2,8 триллиона параметров с архитектурой mixture-of-experts, крупнейшая открытая модель в мире. Из 896 экспертов на токен активируются 16, контекст — миллион токенов, цена $3 за миллион входных токенов и $15 за миллион выходных.
В анонсе Moonshot заявила, что по общему интеллекту модель уступает только Claude Fable 5, а в кодинге, агентных задачах и фронтирной разработке идёт «чуть ниже Fable 5», обходя её на задачах чистки кодовой базы и длинных инженерных сценариях. Собственные цифры компании:
| Бенчмарк | Заявлено Moonshot |
|---|---|
| Terminal-Bench 2.1 | 88,3% |
| FrontierSWE | 81,2% |
| BrowseComp | 91,2% |
| DeepSWE | 67,5% |
| SWE Marathon | 42,0% |
Рынок отреагировал бурно: полупроводниковые акции просели, Philadelphia Semiconductor Index ушёл в медвежью территорию, а Moonshot, по сообщениям, готовит IPO в Гонконге с оценкой около $30 млрд против примерно $4 млрд в конце прошлого года.
Что намерили
Главный независимый источник — Artificial Analysis, которая прогоняет все модели через собственный набор оценок на одинаковой обвязке. Её Intelligence Index v4.1 ставит Kimi K3 на 57 баллов и четвёртое место среди 186 моделей. Впереди Claude Fable 5 (около 60) и GPT-5.6 Sol (около 59), на одном уровне — Claude Opus 4.8 (около 56).
Это и есть основное расхождение. «Уступает только Fable 5» и «четвёртое место» — разные утверждения. При этом ни то ни другое не является провалом: 57 баллов делают K3 сильнейшей открытой моделью за всю историю замеров.
По отдельным тестам картина неоднородная. На Terminal-Bench v2.1 независимый прогон дал 85% против заявленных 88,3% — разрыв в 3,3 процентных пункта. На GPQA Diamond модель показала 94% и разделила первое место. На длинном контексте (AA-LCR) — 75% и первое место. На Humanity's Last Exam — 44% против 53% у Fable 5. На физическом CritPt — 23%, середина списка.
А на одном публичном лидерборде K3 выиграла вчистую: в Frontend Code Arena от LMArena она заняла первое место с рейтингом 1679, обойдя Fable 5 в 76% слепых сравнений и став первой в шести доменах из семи.
Отдельно показателен замер Fireworks: на примерно 1030 задачах в одинаковой обвязке K3 набрала 92,4% против 92,6% у Fable 5. Разница в пределах шума — при том что на длинных агентных циклах K3 обходится дешевле в разы.
Почему цифры вообще расходятся
Ключ к спору — не честность Moonshot, а понятие «обвязки» (harness). Балл модели на агентном бенчмарке — это всегда результат связки «модель плюс конкретный каркас плюс конкретные настройки». Moonshot мерила Terminal-Bench на собственной обвязке KimiCode, Artificial Analysis — на своей. Отсюда и 3,3 пункта.
Масштаб этого эффекта в индустрии огромен. По данным NxCode, одна и та же модель может разойтись на 10–26 пунктов между обвязками: Opus 4.8 показывает 69,2% на своём каркасе и 51,9% на Scale SEAL, у Gemini 3.1 Pro разброс достигает 26,4 пункта. На этом фоне трёхпунктовая разница у Kimi выглядит скромно.
«Балл с подписью Kimi K3 всегда означает "Kimi K3 плюс конкретная обвязка и конкретные настройки". Таблица вендора показывает, чего достигает сильнейшая система Moonshot. Она не изолирует модель от инфраструктуры». — разбор Emergent
Есть и вторая причина шума, которая к Moonshot отношения не имеет вовсе: значительная часть таблиц с результатами K3, разошедшихся по соцсетям, не публиковалась ни компанией, ни одним из оценщиков. Проще говоря, часть «сенсационных» цифр в обе стороны — просто выдумка.
О чём в анонсе не написали
Куда интереснее не рейтинг, а свойства модели, которые в маркетинговую таблицу не попадают.
Галлюцинации. На тесте AA-Omniscience точность K3 выросла с 33% до 46% относительно предыдущей Kimi K2.6 — хороший результат. Но доля галлюцинаций выросла вместе с ней: с 39% до 51%. Для сравнения: у GLM 5.2 — 28%, у Opus 4.8 — 36%. Правда, у Fable 5 показатель ещё хуже — 55%, так что это болезнь всего поколения, а не только Kimi. Дешёвая, уверенная и неправая модель — не такая уж дешёвая.
Скорость и многословность. Модель выдаёт 33–35 токенов в секунду при медиане по рынку около 78 — это 141-е место из 186. Время до первого токена — 4,78 секунды. На полном прогоне оценок K3 сгенерировала 130 миллионов выходных токенов против медианных 63 миллионов: она заметно многословнее конкурентов.
Цена задачи против цены токена. Дешевизна за токен не всегда переносится на задачу. На агентном бенчмарке AA-Briefcase K3 заняла второе место (Elo 1543 против 1574 у Fable 5) — но потратила 56,4 минуты на задачу против примерно 23 минут у Fable 5, сделала 83 хода и обошлась в $10,57 за задачу. На более коротких задачах экономика обратная: около $0,95 за задачу против $1,04 у Sol и $2,75 у Fable 5.
Что говорят те, кто смотрел внимательно
Самая взвешенная оценка принадлежит независимому исследователю Натану Ламберту, который прямо возражает против трактовки «провал»:
«Это явно сильнейшая открытая модель из когда-либо выпущенных. Moonshot AI идёт вровень с Anthropic и OpenAI, располагая многократно меньшими ресурсами». — Натан Ламберт, Interconnects
Дин Болл из OpenAI сформулировал короче: «очень хорошая, но прожорливая по токенам». Его же более общее замечание объясняет часть политического накала: открытые модели, по его мнению, по своей природе замедляют гонку, и его удивляет, что им радуются как раз «ускорители».
Фон у релиза непростой. В феврале Anthropic обвинила Moonshot, DeepSeek и MiniMax в промышленной дистилляции — более 16 миллионов обменов с Claude через около 24 тысяч поддельных аккаунтов. 22 июля директор OSTP Белого дома Майкл Кратсиос публично заявил, что Moonshot дистиллировала Fable для создания K3, а министр финансов Скотт Бессент пригрозил санкциями. Moonshot по существу этих обвинений публично не отвечала. Ламберт при этом считает, что если дистилляция и вносила вклад, то «в относительно небольшой степени» — архитектурные наработки компании, Kimi Delta Attention и Attention Residuals, опубликованы как открытые исследования заранее.
Ещё одна деталь, которая говорит сама за себя: спустя двое суток после релиза Moonshot приостановила новые подписки — мощностей GPU не хватило под наплыв. Для компании, чей главный аргумент — эффективность, ирония ощутимая.
Итог: чего ждать 27 июля
Развязка близко. Открытые веса Moonshot обещает выложить 27 июля, и после этого проверить заявления сможет кто угодно на собственной обвязке. До тех пор любой балл K3 — это либо цифра вендора, либо результат прогона через закрытый API, а технический отчёт с деталями по деконтаминации данных так и не опубликован.
Честная формулировка на сегодня выглядит так: Kimi K3 не провалила независимую проверку. Она заняла четвёртое место там, где заявляла второе, показала лучший в истории результат для открытой модели, выиграла фронтенд-арену — и одновременно оказалась медленнее, многословнее и склоннее к выдумкам, чем следует из анонса. Всё это умещается в одной модели без противоречий. Не умещается только в заголовок.


