Заводы вместо экзаменов: FactorioBench устроил агентам проверку на выживание
Новый бенчмарк на базе Factorio тестирует долгосрочное планирование AI-агентов. Даже GPT-6 Astra разваливается на каскадных сбоях производства.

771 апвоут за несколько часов и подпись «the real test for agentic AI» — так r/singularity встретил FactorioBench, новый бенчмарк, который проверяет AI-агентов не на задачках с вариантами ответов, а на строительстве завода в Factorio. Задача звучит просто: запустить ракету. Дьявол — в том, что между стартом и ракетой лежат часы производственных цепочек, нехватка ресурсов и атаки местной фауны.
Чем плохи старые бенчмарки
Классические тесты вроде MMLU статичны: модель отвечает на вопрос, получает балл, идёт дальше. Даже игровые бенчмарки — Minecraft, DOTA — по большому счёту меряют короткие цели или бой. Ни один из них не отвечает на вопрос, который сейчас волнует всех, кто выпускает агентов в реальные кодовые базы и бизнес-процессы: что случится через три часа автономной работы, когда одна маленькая ошибка начнёт тянуть за собой остальные?
FactorioBench построен ровно вокруг этого. Агент управляет фабрикой через легковесную обёртку над Lua API игры и обязан удерживать производственные цепочки в рабочем состоянии на длинной дистанции. Метрики считаются не за красивый момент, а за весь прогон:
- Восстановление после каскадных сбоев — штраф за «коллапс производства», когда одна ошибка кладёт всю систему
- Эффективность на длинном горизонте — время до запуска ракеты взвешивается против объёма потраченных впустую ресурсов
- Координация параллельных задач — добыча, логистика и оборона идут одновременно
Идея выросла не на пустом месте: ещё в 2025-м исследователи выпустили Factorio Learning Environment — открытую среду, где агентов гоняли по лестнице из всё более сложных производственных задач. FactorioBench доводит её до полноценного соревновательного бенчмарка с единой системой очков.
Astra споткнулась
Самое обсуждаемое в треде — первые результаты GPT-6 Astra. Модель, которая за последний месяц прошла Portal и RimWorld, блестяще справляется с микрозадачами: поставить бур, протянуть конвейер, собрать схему. Но на каскадных сбоях она сыпется. Кончилась руда на одном участке — встали печи, встали печи — остановились сборщики, и вместо того чтобы найти корень проблемы, агент начинает латать симптомы. Знакомая картина для любого, кто оставлял кодового агента наедине с большим проектом на ночь.
В этом и ценность бенчмарка. Он не спрашивает, умна ли модель, — он спрашивает, надёжна ли она как работник. Пока разрыв между этими двумя вопросами остаётся главной причиной, по которой агентам не доверяют продакшн без присмотра. Теперь у этого разрыва есть числовое выражение и таблица лидеров.


