Science One Framework: зачем ИИ-исследованиям цепочка доказательств
Google связала утверждения ИИ-исследователя со ссылками, кодом и логами. Разбираем 75 работ, результаты аудита и границы доказательств.
Факты проверены 30 июля 2026 года. Science One Framework — экспериментальный фреймворк Google Research для автономных ИИ-исследований. Он связывает утверждения со ссылками, кодом и журналами экспериментов через Chain-of-Evidence, или цепочку доказательств. Такой подход нужен потому, что аккуратно написанная работа может содержать выдуманную ссылку, невоспроизводимое число или описание метода, которого нет в коде.
Авторы проверили 75 работ пяти исследовательских систем. В их выборке Science One не создал ни одной фиктивной ссылки среди 337 записей библиографии, подтвердил 12 из 12 проверяемых численных результатов и показал совпадение метода с кодом в 14 из 15 работ. Эти цифры сильные, но узкие: они не доказывают, что система устранила все галлюцинации или научилась проводить полностью воспроизводимые исследования в любой области.
Коротко: что такое Science One
Google Research представила фреймворк 30 июля 2026 года как экспериментальный исследовательский прототип. Готового продукта пока нет. В научной статье на arXiv от 25 мая та же система называется ScientistOne. Название фреймворка и название системы различаются, но ведут к одной работе и одной архитектуре.
Главная идея проста: доказательство нужно сохранять в момент появления утверждения. Если агент сначала пишет гладкий текст, а затем пытается подобрать к нему источники, связь между результатом, кодом и формулировкой уже могла потеряться.
Это развитие той же проблемы, которую видно в агентном поиске. Чем длиннее цепочка действий, тем больше мест, где ошибка может пройти дальше и выглядеть согласованной. В отдельном разборе Toolarium мы показывали, как галлюцинации ссылок в агентном поиске сохраняются даже при большом числе найденных источников.
Chain-of-Evidence связывает четыре типа утверждений с доказательствами
Chain-of-Evidence, сокращённо CoE, задаёт правило: каждое утверждение должно вести к проверяемому источнику через записанную цепочку происхождения. Фреймворк не предписывает конкретную архитектуру агента и одинаково применим к машинным и человеческим работам.
Авторы выделяют четыре типа утверждений:
- ссылочные должны вести к существующей публикации, содержание которой соответствует пересказу;
- численные должны опираться на журнал запуска, измерение или результат симуляции;
- методические должны соответствовать реализации в коде;
- выводы должны следовать из уже подтверждённых чисел и методов.
Последний пункт особенно труден. Проверить наличие статьи по DOI сравнительно просто. Установить, что вывод действительно следует из эксперимента, сложнее: здесь нужны предметная экспертиза и оценка рассуждения. Авторы прямо называют свою таксономию неполной.
Как Science One строит проверяемое исследование
Science One делит работу на три этапа и сохраняет промежуточные артефакты между ними.
Сначала Problem Investigator строит граф цитирований через академические базы, читает до 100 полнотекстовых PDF по теме и готовит структурированный исследовательский бриф. Ссылки в итоговой работе должны происходить из найденных записей, а не из памяти модели. Похожую задачу решает поиск и ранжирование доказательств в T-Search, но Science One протягивает происхождение данных дальше, до кода и текста статьи.
Затем Discovery Engine создаёт несколько ветвей решений. Отдельные агенты пишут код, запускают оценщик и сохраняют результаты. Система отбрасывает решения с нарушениями спецификации, выбирает лучший подтверждённый запуск и проводит абляционные эксперименты, чтобы понять вклад отдельных компонентов.

На третьем этапе Paper Writer получает исследовательский бриф, код, проверенные оценки и журналы экспериментов. Каждое фактическое утверждение во внутреннем представлении снабжается меткой источника: строкой лога, записью со значением, ключом цитирования или результатом абляции.
После генерации текста Claim Verifier снова сверяет числа, ссылки и описание метода с указанными источниками. Неподтверждённые формулировки переписываются или удаляются. Это важная деталь: даже текст, построенный на корректных данных, может исказить их при пересказе.
CoE Audit проверяет работу по четырём независимым направлениям
CoE Audit проверяет уже готовую статью и сопутствующие файлы. Адаптер приводит рукопись, код решения и библиографию к общему формату, после чего запускает четыре независимых теста.
| Что проверяется | Тип сбоя | Источник доказательства | Проверка CoE Audit |
|---|---|---|---|
| Заявленный численный результат | Число не повторяется при новом запуске | Текст статьи, код решения, эталонный оценщик | I1 Score Verification |
| Соблюдение условий задачи | Код использует лазейку оценщика или готовый ответ | Код, спецификация задачи, эталонный оценщик | I2 Specification Violation |
| Реальность библиографии | Публикация не существует или запись подменена | references.bib, Semantic Scholar, arXiv, OpenAlex, Crossref |
I3 Reference Verification |
| Соответствие метода реализации | В статье описан другой алгоритм | Раздел о методе и код решения | I4 Method-Code Alignment |

У проверок разная степень автоматизации. Число можно повторно получить на эталонном оценщике. Ссылки ищутся по академическим API, после чего модель разбирает близкие совпадения. Нарушения спецификации и соответствие метода коду оценивают несколько LLM-судей с голосованием большинства.
Именно здесь проходит граница доказательства. CoE Audit проверяет структурную целостность артефактов, но не устанавливает научную новизну, значимость результата или истинность всех выводов.
Результаты аудита сильны, но относятся к конкретной выборке
Авторы применили аудит к 75 работам: по 15 от каждой из пяти систем на пяти задачах бенчмарка ADRS. Сравнивались Sakana AI-Scientist v2, AutoResearchClaw, DeepScientist, AI-Researcher и ScientistOne. Все системы использовали одну базовую модель и три запуска на задачу, однако для работы с ADRS исходные проекты пришлось адаптировать в разной степени.
Science One показал следующие результаты:
- 0 фиктивных ссылок из 337 записей библиографии;
- 12 подтверждённых численных результатов из 12 проверяемых;
- 0 нарушений спецификации в 15 работах;
- совпадение описанного метода с кодом в 14 работах из 15.
Система не прошла собственную проверку метода во всех случаях. В одной работе текст описывал «гибридный нейросимвольный решатель» и поиск с участием LLM, хотя код содержал детерминированную эвристику маршрутизации. Этот сбой полезнее идеального процента: он показывает, что Claim Verifier снижает риск, но не закрывает его.
В других системах доля выдуманных ссылок доходила до 20,9%, проверка численных результатов проходила лишь в 42% работ, а совпадение метода с кодом находилось в диапазоне от 20% до 80%. Авторы вручную подтвердили все срабатывания проверок I1–I3, но не измеряли систематически пропущенные ошибки. Реальная частота сбоев может быть выше.
Есть ещё три ограничения.
Во-первых, основные эксперименты посвящены оптимизации компьютерных систем, где существуют формальные оценщики. Биология, материаловедение и теоретическое машинное обучение потребуют других проверок, включая лабораторные протоколы, симуляции и доказательства.
Во-вторых, проверка библиографии в аудите устанавливает прежде всего существование публикации. Реальная статья всё равно может быть процитирована не по смыслу. Для проверки поддержки конкретного тезиса нужен анализ текста на уровне фрагментов, и авторы называют это открытой задачей.
В-третьих, конкурентный результат на ADRS не равен полноценному научному исследованию. Эти задачи сводят проблему к одному показателю. Настоящая работа включает постановку вопроса, выбор наборов данных, анализ ограничений и объяснение причин.
Проверяемость становится отдельным слоем исследовательского агента
Главный результат Science One — архитектурный сдвиг. Автономному исследовательскому агенту мало инструментов поиска, кода и письма. Нужен слой происхождения данных, который переживает весь маршрут от найденной статьи до финального предложения.
Для разработчика такого агента практический минимум выглядит так: сохранять источник каждого числа, отделять вывод оценщика от пересказа модели, повторно запускать итоговый код и сравнивать описание метода с реализацией. Проверка в конце полезна, но она не восстановит потерянную связь, если система не записывала доказательства во время работы.
Google уже экспериментирует и с другими ролями ИИ в научной публикации. В Toolarium есть разбор ИИ-агентов Google Research для peer review. Science One добавляет недостающий слой до рецензирования: возможность проверить, откуда взялось каждое утверждение.
По состоянию на 30 июля 2026 года Science One остаётся экспериментальным прототипом и не готов к промышленному использованию. Критерий для будущих систем уже виден: каждый ответ исследовательского агента должен сопровождаться маршрутом проверки.
FAQ о Science One
Что такое Chain-of-Evidence
Chain-of-Evidence — стандарт происхождения доказательств для ИИ-исследований. Он требует связать ссылочные, численные, методические утверждения и выводы с публикациями, кодом, журналами экспериментов или другими проверяемыми артефактами.
Устраняет ли Science One галлюцинации
Нет. В аудите система получила 0 выдуманных ссылок из 337, но это результат конкретной выборки. Одна из 15 работ всё равно содержала расхождение между описанием метода и кодом, а качественные выводы проверяются хуже чисел и библиографии.
Означает ли проверяемость полную воспроизводимость
Нет. Авторы повторно проверяли результаты на эталонных оценщиках, искали нарушения условий, подтверждали существование ссылок и сравнивали метод с кодом. Независимая репликация полной научной работы, особенно вне задач с формальным оценщиком, остаётся более сложной процедурой.
Источники
- Официальный анонс Google Research
- ScientistOne: статья на arXiv
- Официальная страница проекта ScientistOne