Poolside Laguna S 2.1: что стоит за 70,2% в Terminal-Bench

Poolside выпустила Laguna S 2.1 с открытыми весами. Проверяем 70,2% в Terminal-Bench, лицензию OpenMDW, контекст и локальный запуск.

Официальная обложка анонса Poolside Laguna S 2.1

Факты проверены 23 июля 2026 года. Poolside Laguna S 2.1 — модель с открытыми весами для агентной разработки: 118 млрд общих и около 8 млрд активных параметров на токен, режим рассуждений, вызов инструментов и заявленный контекст до 1 млн токенов.

Главная цифра релиза — 70,2% на Terminal-Bench 2.1. Её опубликовала сама Poolside после запуска модели в собственной агентной обвязке pool с включённым режимом рассуждений. Это сильный результат для такого числа активных параметров, но не независимая оценка и не первое место в общей таблице.

Что выпустила Poolside

Laguna S 2.1 вышла 21 июля 2026 года и заняла среднее место в семействе: она крупнее Laguna XS 2.1 с 33 млрд общих и 3 млрд активных параметров, но меньше Laguna M.1 с 225 млрд и 23 млрд соответственно. Архитектура Mixture-of-Experts включает 256 маршрутизируемых и одного общего эксперта; на каждом токене выбираются десять экспертов.

Модель рассчитана на длинные последовательности действий: работу с репозиторием, терминалом и инструментами. Карточка на Hugging Face указывает окно в 1 048 576 токенов, чередование глобального внимания и скользящего окна, а также сохранение блоков рассуждений между вызовами инструментов.

Параметр Что заявлено на 23 июля 2026 года Источник
Размер и архитектура 118B MoE, около 8B активных параметров на токен; 48 слоёв, 256 маршрутизируемых экспертов и 1 общий карточка модели
Контекст основного чекпойнта До 1 048 576 токенов Hugging Face
Контекст сборки Ollama 256K токенов; это не обещанные 1M основного чекпойнта Ollama Library
Лицензия OpenMDW-1.1: разрешены использование, изменение и распространение переданных материалов с сохранением лицензии и уведомлений текст лицензии
Локальные веса Q4_K_M сейчас занимает 68 ГБ в списке Ollama; текст инструкции всё ещё говорит примерно о 75 ГБ и рекомендует 128 ГБ общей памяти Ollama Library
Terminal-Bench 2.1 70,2% в обвязке Poolside с рассуждениями; 60,4% без них анонс Poolside
DeepSWE v1.1 40,4% в обвязке Poolside с рассуждениями; 16,5% без них анонс Poolside

Ранее Toolarium разбирал предыдущий релиз Laguna XS.2 и M.1. У S 2.1 другой поисковый и практический вопрос: насколько выросло качество на длинных задачах и какой ценой его можно получить локально.

70,2% на Terminal-Bench требуют контекста

Terminal-Bench 2.1 проверяет, как агент решает длинные задачи через терминал. Poolside сообщает 70,2% pass@1, усреднённые по четырём попыткам на задачу. Компания также открыла архив финальных траекторий, где можно изучить команды и ход отдельных запусков.

Официальная диаграмма Poolside с результатами Laguna S 2.1 на Terminal-Bench 2.1 и других тестах
Сравнение, опубликованное Poolside 21 июля 2026 года. Для конкурентов компания брала максимум из данных вендора, авторов теста или сторонних таблиц, поэтому столбцы не означают единый независимый прогон. Источник: Poolside.

Методика не даёт считать диаграмму чистым сравнением моделей. Laguna S 2.1 работала в pool, а у других участников могли быть собственные обвязки или результаты из сторонних таблиц. В DeepSWE Poolside прямо признаёт, что её модель проверялась не в стандартной mini-swe-agent, и называет сравнение менее сопоставимым.

Режим рассуждений заметно влияет и на качество, и на расход вычислений. На Terminal-Bench средний объём завершения вырос примерно с 80 тыс. до 129 тыс. токенов, а результат — с 60,4% до 70,2%. На DeepSWE объём вырос с 99 тыс. до 249 тыс. токенов, а доля решённых задач — с 16,5% до 40,4%. Значит, часть преимущества связана с большим бюджетом на ход решения, а не только с весами модели.

Для команд важнее повторить тест на собственном репозитории, чем спорить о месте в общей таблице. Та же логика применима к другой открытой coding-модели с контекстом 1M: длинное окно и высокий бенчмарк не заменяют проверку конкретной агентной обвязки.

Постобучение на 409 тысячах окружений

Poolside связывает прогресс прежде всего с постобучением. Корпус включает 409 тыс. агентных и обычных окружений: 83 тыс. предназначены для терминальных задач, 168 тыс. — для стандартной разработки. Крупнейшая группа воспроизводит около 38 тыс. реальных коммитов из примерно 17 тыс. репозиториев.

Сначала модель прошла обучение с учителем, частично на синтетических данных, затем обучение с подкреплением на задачах, которые она ещё не решала стабильно. Для S 2.1 Poolside увеличила число ходов, лимиты токенов и время на задачу, обновила песочницы и стала прогонять одни запросы в нескольких агентных обвязках.

Интерфейс браузерного движка, созданного Laguna S 2.1 в демонстрации Poolside
В демонстрации Poolside модель за 50 минут и 181 шаг собрала на JavaScript простой движок HTML/CSS и сравнила его вывод с Chromium. Это кейс разработчика, а не независимый тест Toolarium. Источник: Poolside.

Такой подход объясняет настойчивость модели, но создаёт побочный эффект: она может рассуждать слишком долго. В списке ограничений Poolside также называет ошибки при первом вызове инструментов в сторонних обвязках и некорректное экранирование JSON во вложенных вызовах. Эти сбои особенно важны для автономной работы, где неверный формат инструмента останавливает всю цепочку.

Подробнее о том, почему агенты с длинным горизонтом теряют нить или начинают оптимизировать не ту цель, мы писали в разборе долгих terminal-задач для ИИ-агентов.

Локальный запуск Poolside Laguna S 2.1

Запустить модель локально можно, но не на обычном ноутбуке. Полный BF16-чекпойнт требует примерно 236 ГБ только для весов и нескольких GPU. Квантованная сборка Q4_K_M доступна через Ollama и llama.cpp; в текущем списке Ollama она занимает 68 ГБ, а сопроводительный текст Poolside всё ещё оценивает потребность примерно в 75 ГБ.

ollama run laguna-s-2.1

Практический минимум, который рекомендует Poolside, — машина со 128 ГБ общей памяти: Apple Silicon соответствующей конфигурации или NVIDIA DGX Spark. Компания сообщает о скорости 13–18 токенов в секунду на устройствах этого класса, но Toolarium не проводил независимый замер. Длинный контекст потребует дополнительной памяти поверх весов.

Ограничение контекста зависит от сборки. Основной чекпойнт заявлен с окном 1M, а сборка Ollama ограничена 256K. Для полного контекста понадобятся серверные движки вроде vLLM, SGLang или TensorRT-LLM и подходящая конфигурация GPU; команда Poolside приводит для BF16 пример с четырьмя ускорителями.

OpenMDW-1.1 и границы открытости

Весам присвоена лицензия OpenMDW-1.1. Она разрешает коммерческое и некоммерческое использование, изменение и распространение переданных материалов. При распространении нужно сохранить текст лицензии, уведомления об авторских правах и происхождении.

Лицензия не требует от автора публиковать все компоненты обучения. OpenMDW прямо поясняет: её условия действуют на те материалы, которые действительно выпущены, но сами по себе не обязывают раскрывать данные, весь конвейер обучения или внутреннюю инфраструктуру. Поэтому точная формулировка для Laguna S 2.1 — «модель с открытыми весами под разрешительной лицензией», а не доказанный образец полностью открытого исходного кода.

Карточка модели также отсылает к политике допустимого использования Poolside и рекомендует не обходить защитные ограничения без равноценных мер. Это не отменяет свободы работы с весами, но переносит ответственность за развёртывание и безопасность на пользователя.

Кому подходит Laguna S 2.1

Релиз интересен командам, которым нужны открытые веса, длинные агентные сессии и возможность развернуть модель в своём контуре. При 8 млрд активных параметров Laguna S 2.1 экономнее плотной 118B-модели на каждом токене, хотя все веса всё равно должны поместиться в память.

  • Для быстрого облачного эксперимента проще начать с готового интерфейса Poolside или совместимого провайдера.
  • Для локальной разработки нужна машина примерно со 128 ГБ общей памяти; 32–64 ГБ недостаточно для официальной Q4-сборки.
  • Для оценки качества стоит сохранить режим рассуждений и ту же обвязку, иначе результат нельзя сравнивать с опубликованными 70,2%.
  • Для продакшена нужны собственные тесты вызова инструментов, JSON-аргументов и остановки чрезмерно долгих траекторий.

Poolside Laguna S 2.1 выглядит сильной для своего числа активных параметров, а открытые веса и траектории оценок упрощают проверку. Но 70,2% остаются результатом самой компании в её обвязке, а локальный запуск требует дорогой машины. Перед заменой рабочей модели для программирования её нужно проверить на реальном репозитории, измерив качество, задержку и расход токенов.

Читайте также

Источники и проверка фактов

  • Poolside: Introducing Laguna S 2.1, опубликовано 21 июля 2026 года; архитектура, методика оценок, режим рассуждений, постобучение, кейсы и ограничения; проверено 23 июля 2026 года.
  • Poolside: Laguna S 2.1 Model Card, параметры, контекст 1M, движки запуска, вызов инструментов и ответственное использование; проверено 23 июля 2026 года.
  • Ollama Library: laguna-s-2.1, размеры Q4/Q8/F16, локальный контекст 256K и требования к памяти; проверено 23 июля 2026 года.
  • Poolside: Laguna S 2.1 GGUF, официальные варианты квантования и команды запуска через llama.cpp; проверено 23 июля 2026 года.
  • OpenMDW и текст OpenMDW-1.1 для модели, права, условия распространения и границы охвата лицензии; проверено 23 июля 2026 года.
Telegram-канал @toolarium