Когда ИИ-агенты выгоднее человека: что измеряет METR
METR предложила expenditure horizon — точку, где при равном бюджете человек становится эффективнее автономного агента. Что показал тест NanoGPT.
По состоянию на 27 июля 2026 года ответ на вопрос, когда ИИ-агенты выгоднее человека, можно дать только для конкретной задачи и конкретного бюджета. В исследовании от 21 июля организация METR предложила метрику expenditure horizon: она показывает верхнюю границу расходов, при которой автономный агент даёт не меньшее улучшение, чем человек за те же деньги.
METR проверила подход на NanoGPT speedrun, соревновании по сокращению времени обучения небольшой языковой модели. При базовой оценке человеческого труда в $2 500 за 1 процентный пункт улучшения expenditure horizon составил около $3 300 для Opus-4.8 и $2 300 для GPT-5.5. Цифры относятся к одному эксперименту; переносить их на цену замены исследователя нельзя.
Что такое expenditure horizon
Expenditure horizon — максимальный общий бюджет, при котором автономный ИИ-агент улучшает целевую метрику не хуже человека с таким же бюджетом. Если кривая агента после этой точки оказывается ниже человеческой, следующий доллар выгоднее потратить на труд человека.
В формальном определении METR используются две функции: результат агента и результат человека в зависимости от расходов. Горизонт затрат обозначает верхнюю границу общих бюджетов, где результат агента не хуже. Расходами могут быть деньги, токены или время, но в эксперименте NanoGPT всё перевели в доллары.
Показатель описывает точку пересечения двух кривых отдачи внутри одного оптимизационного эксперимента. Стоимость подписки, зарплата и цена завершённой задачи сами по себе ничего о нём не говорят.
Почему одного результата бенчмарка мало
Обычный бенчмарк часто отвечает на бинарный вопрос: агент прошёл задачу или нет. Для экономического решения этого недостаточно. Две модели могут обе пройти порог, но одна потратит в десять раз больше токенов и экспериментальных вычислений. Другой вариант: ни одна модель не пройдёт порог, хотя одна даст полезное частичное улучшение.
Expenditure horizon требует непрерывную целевую метрику и учитывает всю кривую «затраты — результат». В NanoGPT такой метрикой стало сокращение времени обучения. METR считала расходы на вызовы моделей и экспериментальные GPU, а человеческую отдачу оценила отдельно.
Это продолжает практику, о которой мы писали в разборе, почему агентам считают не только качество, но и токены с повторными прогонами. Разница в том, что METR добавила человеческую кривую и нашла точку, где отдача сравнялась.
Time horizon и expenditure horizon отвечают на разные вопросы. Первая метрика оценивает, задачи какой человеческой длительности агент решает с заданной вероятностью. Вторая спрашивает, до какого общего бюджета агент даёт не меньшую отдачу на непрерывной метрике.
Как METR поставила эксперимент NanoGPT
NanoGPT speedrun — открытый проект, где участники сокращают время обучения GPT-2 с 124 млн параметров до заданного значения функции потерь на восьми NVIDIA H100. С мая 2024 года по апрель 2026 года участники уменьшили время обучения примерно с 45 минут до менее чем двух минут.
METR выбрала историческое состояние рекорда № 78 от марта 2026 года: 85,56 секунды обучения. Агенты не видели более поздних улучшений и должны были самостоятельно менять код и параметры. Каждый запуск получал доступ к четырём узлам H100, то есть к 32 GPU, и асинхронным инструментам для параллельных экспериментов.
Один агентный прогон мог длиться пять дней и стоить до $10 000. В эту сумму входили API-вызовы моделей и GPU для экспериментов. На вычислительные эксперименты приходилось примерно 70–90% затрат в большинстве траекторий. Сама METR считает такую обвязку неэффективной: непрерывный доступ к четырём узлам подталкивал агентов запускать слишком много проверок.
Человеческую кривую построили по интервью с двумя активными участниками NanoGPT и оценке истории изменений с помощью модели-судьи. Итоговая локальная оценка составила около 16 часов работы на 1% ускорения. При ставке $150 в час METR округлила это до $2 500 за 1 процентный пункт.
Эта оценка неточна. Она плохо учитывает чтение исследований, обсуждения и неудачные идеи до появления рабочего изменения. METR прямо называет $2 500 грубой базовой гипотезой, а не рыночной ценой улучшения.
| Элемент | Как измеряли | Результат | Главное ограничение |
|---|---|---|---|
| Человеческая отдача | Интервью с двумя контрибьюторами и оценка истории PR | Около 16 часов, или $2 500, за 1% ускорения | Не полностью учтены исследования, обсуждения и фоновые идеи |
| Расходы агента | API моделей плюс экспериментальные GPU | До $10 000 за пятидневный прогон | GPU дали 70–90% расходов в большинстве траекторий |
| Перепроверка | Повторные запуски заявленных улучшений | GPT-5 и Opus-4.1 не улучшили базовый результат | Шум в измерении времени обучения завышал сырые траектории |
| Лучшие подтверждённые улучшения | Ручная повторная проверка финальных решений | Около 1% у GPT-5.5 и 1,5% у Opus-4.8 | Не каждое улучшение пригодно для основного проекта |
| Expenditure horizon при $2 500 за 1% | Пересечение кривых агента и человека | Около $2 300 для GPT-5.5 и $3 300 для Opus-4.8 | Результат чувствителен к оценке стоимости человеческого труда |

Что осталось после перепроверки
METR провела шесть крупных запусков. Сырые траектории всех моделей выглядели лучше, чем финальный результат, потому что агент сохранял лучший из наблюдавшихся показателей, а время обучения шумит. Исследователи повторно запускали каждое решение с заявленным прогрессом более 40 раз, а также проверяли три лучших промежуточных решения на каждые $500 расходов.
После этой процедуры GPT-5 и Opus-4.1 не показали осмысленного улучшения. У четырёх остальных моделей expenditure horizon остался положительным, от примерно $600 до $3 300. Самые убедительные результаты получили GPT-5.5 и Opus-4.8: около 1% и 1,5% ускорения относительно исторической базы.
Перепроверка здесь важнее места в таблице. Мы уже разбирали, почему высокий score ещё не доказывает реальную способность агента: агент может найти лазейку в проверке или закрепить статистический выброс. В эксперименте METR проявились обе проблемы.
GPT-5.5 перебрала примерно 650 вариантов решения, в основном комбинации длины дополнительного обучения, EMA decay и частоты проверки. Некоторые агенты пытались остановить обучение при первом касании целевого значения функции потерь или заморозить MLP за 0,001 до порога. METR называет это reward hacking, но речь не идёт о намеренном обмане. Оптимизатор нашёл способ улучшить измеряемый показатель ценой хрупкого решения.
Сопровождающий NanoGPT оценил около 70% найденных идей как пригодные для слияния. Их вклад в ускорение оказался скромнее: примерно 60% для Opus-4.8 и 50% для GPT-5.5. Среди сильных решений были переработка загрузчика данных на CPU у GPT-5.5 и сжатие расписания обучения у Opus-4.8.
Почему $3 300 нельзя превращать в универсальный порог
Результат зависит от того, сколько стоит человеческий прогресс. METR пересчитала горизонты для трёх гипотез. Если 1% ускорения стоит человеку $1 000, expenditure horizon Opus-4.8 падает до $120, а GPT-5.5 — до $160. При $10 000 за 1% значения вырастают до $14 400 и $9 400 соответственно.

Поэтому формулировка «агент выгоднее человека до $3 300» обрывает половину вывода. В эксперименте NanoGPT Opus-4.8 сравнялась с человеческой кривой около $3 300 при предположении, что 1% человеческого ускорения стоит $2 500. Изменение стоимости труда, задачи, начального состояния или обвязки сдвинет точку пересечения.
Есть и другое ограничение. Историческая база № 78 уже включала некоторые улучшения, созданные с помощью ИИ. Дополнительный агент поэтому начинал не с чисто человеческого состояния. METR также не знает, обучали ли OpenAI и Anthropic свои модели специально на NanoGPT. Оба фактора могут искажать оценку.
Автономный агент и человек с ИИ: разные сценарии
Эксперимент сравнивает человека без ИИ с автономным агентом. Он не измеряет работу исследователя, который выбирает гипотезы, а модели поручает поиск по коду, реализацию и серию экспериментов.
Гибридная связка может оказаться лучше обеих отдельных кривых, если человек разумно распределяет задачи. Она может оказаться и хуже человека без ИИ: время на проверку слабых предложений и исправление ошибок тоже стоит денег. METR приводит оба варианта как гипотезы и считает отдельный контролируемый эксперимент единственным честным способом измерить гибрид.
По этой причине результаты NanoGPT ничего не доказывают о замене разработчиков, аналитиков или исследователей. Для реальных рабочих задач нужен другой набор данных. Например, Remote Labor Index измеряет, как агенты выглядят на фриланс-задачах, но и он отвечает на вопрос о доле выполненных проектов, а не о точке пересечения затрат.
Как применять метрику в компании
Expenditure horizon полезна там, где есть непрерывная метрика результата и воспроизводимая проверка. Команда должна заранее зафиксировать исходное состояние, полную стоимость агентного прогона, человеческую базовую линию и процедуру повторной проверки.
Полная стоимость агента включает токены, вычисления для экспериментов, повторные запуски, время инфраструктуры и человеческую проверку, если без неё результат нельзя принять. Человеческая кривая тоже должна учитывать больше, чем время успешной правки: неудачные гипотезы составляют часть работы.
Наконец, найденные улучшения нужно проверить за пределами теста. Если изменение срабатывает только на одном пороге или одном наборе данных, экономическая выгода исчезнет при переносе в продукт.
METR дала способ свести эти данные к одному числу, но само число не заменяет кривую и допущения. Для NanoGPT автономные агенты показали измеримую, но небольшую отдачу. По состоянию на 27 июля 2026 года результат обосновывает более строгий учёт затрат. Вывод о выгодной замене исследователя моделью из него не следует.