Science One Framework: зачем ИИ-исследованиям цепочка доказательств

Google связала утверждения ИИ-исследователя со ссылками, кодом и логами. Разбираем 75 работ, результаты аудита и границы доказательств.

Официальная обложка Google Research к анонсу Science One Framework

Факты проверены 30 июля 2026 года. Science One Framework — экспериментальный фреймворк Google Research для автономных ИИ-исследований. Он связывает утверждения со ссылками, кодом и журналами экспериментов через Chain-of-Evidence, или цепочку доказательств. Такой подход нужен потому, что аккуратно написанная работа может содержать выдуманную ссылку, невоспроизводимое число или описание метода, которого нет в коде.

Авторы проверили 75 работ пяти исследовательских систем. В их выборке Science One не создал ни одной фиктивной ссылки среди 337 записей библиографии, подтвердил 12 из 12 проверяемых численных результатов и показал совпадение метода с кодом в 14 из 15 работ. Эти цифры сильные, но узкие: они не доказывают, что система устранила все галлюцинации или научилась проводить полностью воспроизводимые исследования в любой области.

Коротко: что такое Science One

Google Research представила фреймворк 30 июля 2026 года как экспериментальный исследовательский прототип. Готового продукта пока нет. В научной статье на arXiv от 25 мая та же система называется ScientistOne. Название фреймворка и название системы различаются, но ведут к одной работе и одной архитектуре.

Главная идея проста: доказательство нужно сохранять в момент появления утверждения. Если агент сначала пишет гладкий текст, а затем пытается подобрать к нему источники, связь между результатом, кодом и формулировкой уже могла потеряться.

Это развитие той же проблемы, которую видно в агентном поиске. Чем длиннее цепочка действий, тем больше мест, где ошибка может пройти дальше и выглядеть согласованной. В отдельном разборе Toolarium мы показывали, как галлюцинации ссылок в агентном поиске сохраняются даже при большом числе найденных источников.

Chain-of-Evidence связывает четыре типа утверждений с доказательствами

Chain-of-Evidence, сокращённо CoE, задаёт правило: каждое утверждение должно вести к проверяемому источнику через записанную цепочку происхождения. Фреймворк не предписывает конкретную архитектуру агента и одинаково применим к машинным и человеческим работам.

Авторы выделяют четыре типа утверждений:

  • ссылочные должны вести к существующей публикации, содержание которой соответствует пересказу;
  • численные должны опираться на журнал запуска, измерение или результат симуляции;
  • методические должны соответствовать реализации в коде;
  • выводы должны следовать из уже подтверждённых чисел и методов.

Последний пункт особенно труден. Проверить наличие статьи по DOI сравнительно просто. Установить, что вывод действительно следует из эксперимента, сложнее: здесь нужны предметная экспертиза и оценка рассуждения. Авторы прямо называют свою таксономию неполной.

Как Science One строит проверяемое исследование

Science One делит работу на три этапа и сохраняет промежуточные артефакты между ними.

Сначала Problem Investigator строит граф цитирований через академические базы, читает до 100 полнотекстовых PDF по теме и готовит структурированный исследовательский бриф. Ссылки в итоговой работе должны происходить из найденных записей, а не из памяти модели. Похожую задачу решает поиск и ранжирование доказательств в T-Search, но Science One протягивает происхождение данных дальше, до кода и текста статьи.

Затем Discovery Engine создаёт несколько ветвей решений. Отдельные агенты пишут код, запускают оценщик и сохраняют результаты. Система отбрасывает решения с нарушениями спецификации, выбирает лучший подтверждённый запуск и проводит абляционные эксперименты, чтобы понять вклад отдельных компонентов.

Схема конвейера Science One Framework: поиск литературы, параллельное исследование, написание и проверка статьи
Конвейер Science One: от графа цитирований до Claim Verifier. Источник: Google Research.

На третьем этапе Paper Writer получает исследовательский бриф, код, проверенные оценки и журналы экспериментов. Каждое фактическое утверждение во внутреннем представлении снабжается меткой источника: строкой лога, записью со значением, ключом цитирования или результатом абляции.

После генерации текста Claim Verifier снова сверяет числа, ссылки и описание метода с указанными источниками. Неподтверждённые формулировки переписываются или удаляются. Это важная деталь: даже текст, построенный на корректных данных, может исказить их при пересказе.

CoE Audit проверяет работу по четырём независимым направлениям

CoE Audit проверяет уже готовую статью и сопутствующие файлы. Адаптер приводит рукопись, код решения и библиографию к общему формату, после чего запускает четыре независимых теста.

Что проверяется Тип сбоя Источник доказательства Проверка CoE Audit
Заявленный численный результат Число не повторяется при новом запуске Текст статьи, код решения, эталонный оценщик I1 Score Verification
Соблюдение условий задачи Код использует лазейку оценщика или готовый ответ Код, спецификация задачи, эталонный оценщик I2 Specification Violation
Реальность библиографии Публикация не существует или запись подменена references.bib, Semantic Scholar, arXiv, OpenAlex, Crossref I3 Reference Verification
Соответствие метода реализации В статье описан другой алгоритм Раздел о методе и код решения I4 Method-Code Alignment
Четыре проверки CoE Audit: результаты, спецификация, ссылки и соответствие метода коду
Четыре направления CoE Audit и артефакты, которые они проверяют. Источник: Google Research.

У проверок разная степень автоматизации. Число можно повторно получить на эталонном оценщике. Ссылки ищутся по академическим API, после чего модель разбирает близкие совпадения. Нарушения спецификации и соответствие метода коду оценивают несколько LLM-судей с голосованием большинства.

Именно здесь проходит граница доказательства. CoE Audit проверяет структурную целостность артефактов, но не устанавливает научную новизну, значимость результата или истинность всех выводов.

Результаты аудита сильны, но относятся к конкретной выборке

Авторы применили аудит к 75 работам: по 15 от каждой из пяти систем на пяти задачах бенчмарка ADRS. Сравнивались Sakana AI-Scientist v2, AutoResearchClaw, DeepScientist, AI-Researcher и ScientistOne. Все системы использовали одну базовую модель и три запуска на задачу, однако для работы с ADRS исходные проекты пришлось адаптировать в разной степени.

Science One показал следующие результаты:

  • 0 фиктивных ссылок из 337 записей библиографии;
  • 12 подтверждённых численных результатов из 12 проверяемых;
  • 0 нарушений спецификации в 15 работах;
  • совпадение описанного метода с кодом в 14 работах из 15.

Система не прошла собственную проверку метода во всех случаях. В одной работе текст описывал «гибридный нейросимвольный решатель» и поиск с участием LLM, хотя код содержал детерминированную эвристику маршрутизации. Этот сбой полезнее идеального процента: он показывает, что Claim Verifier снижает риск, но не закрывает его.

В других системах доля выдуманных ссылок доходила до 20,9%, проверка численных результатов проходила лишь в 42% работ, а совпадение метода с кодом находилось в диапазоне от 20% до 80%. Авторы вручную подтвердили все срабатывания проверок I1–I3, но не измеряли систематически пропущенные ошибки. Реальная частота сбоев может быть выше.

Есть ещё три ограничения.

Во-первых, основные эксперименты посвящены оптимизации компьютерных систем, где существуют формальные оценщики. Биология, материаловедение и теоретическое машинное обучение потребуют других проверок, включая лабораторные протоколы, симуляции и доказательства.

Во-вторых, проверка библиографии в аудите устанавливает прежде всего существование публикации. Реальная статья всё равно может быть процитирована не по смыслу. Для проверки поддержки конкретного тезиса нужен анализ текста на уровне фрагментов, и авторы называют это открытой задачей.

В-третьих, конкурентный результат на ADRS не равен полноценному научному исследованию. Эти задачи сводят проблему к одному показателю. Настоящая работа включает постановку вопроса, выбор наборов данных, анализ ограничений и объяснение причин.

Проверяемость становится отдельным слоем исследовательского агента

Главный результат Science One — архитектурный сдвиг. Автономному исследовательскому агенту мало инструментов поиска, кода и письма. Нужен слой происхождения данных, который переживает весь маршрут от найденной статьи до финального предложения.

Для разработчика такого агента практический минимум выглядит так: сохранять источник каждого числа, отделять вывод оценщика от пересказа модели, повторно запускать итоговый код и сравнивать описание метода с реализацией. Проверка в конце полезна, но она не восстановит потерянную связь, если система не записывала доказательства во время работы.

Google уже экспериментирует и с другими ролями ИИ в научной публикации. В Toolarium есть разбор ИИ-агентов Google Research для peer review. Science One добавляет недостающий слой до рецензирования: возможность проверить, откуда взялось каждое утверждение.

По состоянию на 30 июля 2026 года Science One остаётся экспериментальным прототипом и не готов к промышленному использованию. Критерий для будущих систем уже виден: каждый ответ исследовательского агента должен сопровождаться маршрутом проверки.

FAQ о Science One

Что такое Chain-of-Evidence

Chain-of-Evidence — стандарт происхождения доказательств для ИИ-исследований. Он требует связать ссылочные, численные, методические утверждения и выводы с публикациями, кодом, журналами экспериментов или другими проверяемыми артефактами.

Устраняет ли Science One галлюцинации

Нет. В аудите система получила 0 выдуманных ссылок из 337, но это результат конкретной выборки. Одна из 15 работ всё равно содержала расхождение между описанием метода и кодом, а качественные выводы проверяются хуже чисел и библиографии.

Означает ли проверяемость полную воспроизводимость

Нет. Авторы повторно проверяли результаты на эталонных оценщиках, искали нарушения условий, подтверждали существование ссылок и сравнивали метод с кодом. Независимая репликация полной научной работы, особенно вне задач с формальным оценщиком, остаётся более сложной процедурой.

Источники

Читайте также

Telegram-канал @toolarium