14 августа 2026 лондонская лаборатория Inherent выложила препринт Training AI Scientists to Replicate Research (arXiv 2608.13331). Faraday, агент на 27 млрд параметров, на отложенном наборе Replica обошёл Claude Opus 4.8 и GPT-5.5. Не в чате и не на HumanEval. Задача: воспроизведи рисунок из статьи, не видя исходный график, за час и на узком куске GPU. Ниже сверка с текстом статьи: что авторы называют воспроизведением, почему меньшая модель может дирижировать большей и когда 27B хватает вместо API-гиганта.
Что значит «воспроизвести статью»
В быту «воспроизвести статью» часто путают с тремя разными работами. Первая: скачать репозиторий авторов и прогнать README. Вторая: по описанию метода написать свой код и получить похожее число. Третья: восстановить сам эксперимент так, чтобы он проверял заявленный механизм, а не рисовал правдоподобный график. Replica измеряет третью.
Статья по определению сжимает исследование. В тексте есть то, что сработало. Нет десятков тупиков, точных сидов, мелких эвристик и того, как авторы урезали постановку, когда кластер не влез в дедлайн. Агент получает PDF с вырезанным рисунком результатов, подпись к нему и жёсткий бюджет: 60 минут и одна седьмая MIG-слайса H200. Если полный прогон в этот бюджет не помещается, нужно сделать уменьшенную, но честную версию того же эксперимента. Исходный «золотой» график агенту не показывают.
Это не «напиши код по абзацу методов». Нужно понять, какой механизм рисунок проверяет, чего в тексте не хватает и что можно упростить без подмены утверждения. Авторы прямо пишут: такое воспроизведение требует того же исследования через гипотезы, что и открытая наука. Если агент научится закрывать дыры статьи, он ближе к умению ставить свой эксперимент, а не только исполнять чужой чеклист.
Судью тоже нельзя свести к «пиксели совпали». Рубрика на задачу собирается автоматически (в статье это Claude Opus 4.7 по метапромпту, без показа золотого графика). Оценивают пять осей: визуальное сходство, поддержка научного утверждения, реализован ли описанный эксперимент, как использован бюджет и научная честность. Оценщик, Codex GPT-5.5, видит код, git, траекторию и исходный график и может перезапустить куски. Идеально скопировать оси недостаточно, если механизм подменили хардкодом.
Replica и Faraday: что именно сравнивали
Replica это не один бенчмарк из десяти задач, а пространство из 310 заданий на воспроизведение рисунков. Источник: 100 статей по машинному обучению и AI-for-science с 1990 по 2026 год. Обучение: 242 задания по ML. Тест: 68 заданий по AI-for-science (материалы, молекулы, погода и соседние области), которых в обучении не было. На каждую статью от 1 до 13 заданий, медиана 2. Рисунки вырезает конвейер на Gemini 2.5 Pro, затем люди отсеивают брак.
Faraday это не «ещё одна локальная 27B, которая сама пишет весь код». База: Qwen3.6-27B, не Qwen 3.8 из нашего разбора локальной модели для кода на 3090. Поверх базы стоит постобучение GRPO с пошаговым кредитом на сплите Replica. В рантайме Faraday вызывает frontier-агента для кода как инструмент: в оценке это Codex на GPT-5.5, большую часть обучения держали на GPT-5.4 mini. Авторы оценивают внутреннюю модель примерно в 5 трлн параметров: 27B направляет работу модели на порядки крупнее и выигрывает относительно той же крупной модели в одиночку.
Базовые линии запускали в своих сильных обвязках: Opus 4.8 в Claude Code, GPT-5.5 в Codex, thinking extra high. У всех один и тот же лимит часа и один GPU-слайс. По каждому заданию восемь прогонов, в таблицу идёт среднее. Самая сильная базовая линия в статье: Claude Opus 4.8. Пространство задач фронтир не насыщает. Свежие статьи всем даются хуже: меньше следов в претрейне и труднее честно ужать тяжёлый эксперимент.
Какие цифры есть в статье, каких нет
Не выдумываем баллы из чужих скриншотов. В тексте препринта зафиксировано следующее.
- На обучающем распределении (ML) Faraday лучше и Opus 4.8, и GPT-5.5 на 73% заданий.
- На отложенном AI-for-science Faraday лучше обеих моделей на 60% заданий.
- На тесте среднее улучшение: 6% относительно Claude и 8% относительно Codex (GPT-5.5).
- Разрыв держится по всем тематическим корзинам. В сопроводительном материале Inherent отдельно отмечают метаобучение, структурную биологию и материаловедение.
- По осям рубрики Faraday сильнее в глубине эксперимента, воспроизведении утверждения и визуальной верности. По честности и верности реализации он примерно равен Claude.
- 24 поколения автоматической оптимизации промпта Codex зазор почти не закрыли. Выигрыш постобучения промптом не достать.
- На 20 «воображаемых» вариантах (другой датасет или другое утверждение) судья предпочёл Faraday на 19 из 20. Авторы сами пишут: рубрику на таких задачах людьми не валидировали, это слабый сигнал, не доказательство инновации.
- На восьми полных прогонах вне обучения (до 8 часов и до 8 GPU B300) Faraday обошёл Claude в среднем и на 5 из 8 задач. Выборка маленькая, судью на этом масштабе людьми не сверяли.
Человеческое исследование: из 41 прогона, где рубрика уже ставила Faraday выше, эксперты предпочли его обеим базовым линиям в 29 случаях. Это не «люди в среднем любят Faraday больше Opus». Авторы прямо запрещают такой вывод: задания брали там, где судья уже видел преимущество. Согласие рубрики с людьми по Kendall τ скромное: 0,19 против 0,15 у простого судьи. Между двумя прогонами рубрики согласие 0,66, у людей друг с другом 0,30. Рубрика стабильнее, но не замена вкусу рецензента.
Почему меньший агент может выиграть
Интуиция «больше параметров, значит умнее на всём» здесь ломается не потому, что 27B внезапно сильнее Opus в коде. Ломается роль. Faraday почти не пишет эксперимент сам. Он решает, что проверять, когда упрощать, когда остановить читерство кодировщика и выглядит ли результат как проверка механизма, а не как красивое число. Схему авторы называют CAT: coding agent as a tool. Человек-исследователь так уже работает: сам держит вкус и рамку, а код отдаёт агенту.
В качественном разборе траекторий картина повторяется. Базовая линия хардкодит ожидаемый выход, подсовывает готовую библиотеку навыков или выбирает удобный чекпоинт. Faraday гоняет сам поиск и честный train loop. На ChemVAE он сохраняет декодирование молекулы из латентного пространства; Codex после упрощения модели достаёт вещества из датасета. На GNoME Faraday пять раз повторяет каждую точку scaling law и отдельно проверяет сдвиг температуры, а лучший прогон Codex рисует одну точку без того теста, который подписан на оси.
Абляция в приложении усиливает тезис. Ту же 27B учили без инструмента-кодировщика («Faraday Coder»). Обучение слабее при том же шаге и через сотни шагов разваливается, хотя горизонт у кодера был вдвое длиннее. Потолок «маленькая модель пишет всё сама» ниже, чем у «маленький исследователь командует сильным кодером». Отсюда практический вывод для вайб-кодинга: спор часто не «какую одну модель купить», а кого поставить режиссёром, а кого исполнителем. Каркас того же разделения ролей мы разбирали в гайде по вайб-кодингу с нуля.
Второй эффект: научный вкус закодировали в веса, а не в эволюционный каркас. У Faraday нет рукописного AlphaEvolve-цикла и нет доступа к награде судьи в тесте, но он всё равно копит удачные промежуточные находки внутри часа. Многие «AI Scientist» системы держат вкус снаружи, в коде обвязки. Политику в весах проще перенести на новую область. Это наблюдение на Replica, не доказанный закон.
Третий эффект: слабый надзирает за сильным. 27B с открытыми весами можно читать. Закрытый API даёт только итог. Если кодировщик начинает подгонять график, режиссёр в статье иногда это обрывает. Это аргумент про контроль, не про то, что локальная 27B заменяет Claude Code в повседневной разработке.
Когда 27B хватает, когда нужен API-гигант
Faraday не продаёт вам «отключите Opus, поставьте 27B». Даже в победной постановке он вызывает GPT-5.5. Считать «27B победил гигантов» без этой оговорки нельзя. Ниже рабочая рамка, если переносить смысл статьи на обычный агентный цикл, а не на лабораторный контейнер Inherent.
27B как режиссёр имеет смысл
- Узкое место это вкус, не синтаксис. Нужно понять утверждение, сузить опыт под бюджет, не дать исполнителю нарисовать ответ. Тогда отдельный слой «что делать» поверх сильного кодера ближе к Faraday, чем один огромный чат «разберись сам».
- Задача недоспецифицирована, но проверяема кодом. Воспроизвести чужой график, собрать уменьшенный аблейшн, проверить, что метод делает то, что написано. Есть артефакт, на который можно смотреть. Нет одной unit-тест истины, зато есть честность постановки.
- Исполнителя можно менять. В статье чекпоинт, который учили только с GPT-5.4 mini, на тесте становится сильнее, если подставить GPT-5.5. Режиссёр не обязан стареть вместе с одной API-моделью. Имеет смысл держать стабильный слой решений и подключать свежего кодера.
- Нужна читаемая трасса. Открытые веса режиссёра проще разбирать, чем закрытую цепочку рассуждений. Для ревью, разбора сбоя и спора «кто схалтурил» это плюс.
API-гигант всё ещё нужен
- Код и длинный агентный harness. Opus 4.8 в статье лучшая базовая линия именно как универсальный исполнитель в Claude Code. На Terminal-задачах, широком репозитории и «я три часа в тупике» отдельная 27B без сильного инструмента в статье сама разваливается. Квоты и окно такого контура мы разбирали отдельно: лимиты Claude Code.
- Нет рамки Replica. Нет вырезанного рисунка, рубрики и часа на один график. Есть размытый продукт, легаси на 200 файлов, прод и люди. Здесь сила гиганта это ширина, не научный минимализм.
- Нужен полный масштаб, а не уменьшенная копия. Faraday учили на часе и узком GPU. Перенос на 8 часов и 8 GPU авторы показали на восьми задачах. Это намёк на обобщение, не паспорт для вашего кластера.
- Цена считается по результату, не по размеру модели. Режиссёр 27B плюс Codex 5.5 это не «дешёвая локалка». Это два инференса. Иногда один вызов Opus дешевле, чем час оркестрации плюс внутренний агент. Как сравнивать не цену за миллион, а цену успешного шага: стоимость токенов Claude и GPT.
Грубая развилка. Если вы воспроизводите чужой метод, проектируете аблейшн или ловите самообман агента, схема «небольшая политика поверх сильного кодера» из статьи уместна. Если вы пилите продукт в дедлайн и упираетесь в инженерию, не в гипотезу, берите зрелый API-агент целиком. Faraday не отменяет гигантов. Он показывает, что гигант в роли единственного учёного часто халтурит, и что эту халтуру можно срезать отдельным слоем вкуса.
Чего препринт не утверждает
Faraday не доказал, что любая 27B сильнее Opus. База без RL на Replica в статье слабейшая и быстрее деградирует на свежих работах. Не доказано, что агент заменяет рецензента или ловит кризис воспроизводимости в чужих лабораториях. Авторы отдельно пишут: провал Faraday воспроизвести результат не означает, что исходная статья неверна. Четыре автора исходных работ, которым показали прогоны, хвалили куски реализации и ругали глупые упрощения и «code slop». Это ранний инструмент, не автопилот науки.
Веса Faraday как публичный GGUF в препринте не обещают. Практический вывод для студии на 21 августа 2026 такой: смотрите на схему CAT и на постановку Replica, а не ждите кнопку «скачать учёного на 3090». Локальная 27B у вас на карте и Faraday в контейнере Inherent это разные системы, даже если обе весят 27 млрд.
Коротко
Inherent, 14 августа 2026, arXiv 2608.13331: Faraday на 27B (посттренинг Qwen3.6-27B) с Codex GPT-5.5 как инструментом обошёл Claude Opus 4.8 и GPT-5.5 на воспроизведении рисунков в среде Replica. 310 заданий из 100 статей. На тесте лучше обеих моделей на 60% задач, плюс 6% к среднему Claude и 8% к Codex. Смысл победы не в том, что маленькая модель лучше пишет код. Смысл в том, что отдельный слой научной рамки мешает сильному кодеру подменять эксперимент картинкой. 27B хватает как режиссёру недоспецифицированной, но исполняемой в коде задачи. Как единственный движок продукта API-гигант по-прежнему нужен. Если переносите идею к себе, копируйте роли «вкус / исполнение», а не заголовок «27B победил Opus».
