Poolside Laguna S 2.1: что стоит за 70,2% в Terminal-Bench
Poolside выпустила Laguna S 2.1 с открытыми весами. Проверяем 70,2% в Terminal-Bench, лицензию OpenMDW, контекст и локальный запуск.
Факты проверены 23 июля 2026 года. Poolside Laguna S 2.1 — модель с открытыми весами для агентной разработки: 118 млрд общих и около 8 млрд активных параметров на токен, режим рассуждений, вызов инструментов и заявленный контекст до 1 млн токенов.
Главная цифра релиза — 70,2% на Terminal-Bench 2.1. Её опубликовала сама Poolside после запуска модели в собственной агентной обвязке pool с включённым режимом рассуждений. Это сильный результат для такого числа активных параметров, но не независимая оценка и не первое место в общей таблице.
Что выпустила Poolside
Laguna S 2.1 вышла 21 июля 2026 года и заняла среднее место в семействе: она крупнее Laguna XS 2.1 с 33 млрд общих и 3 млрд активных параметров, но меньше Laguna M.1 с 225 млрд и 23 млрд соответственно. Архитектура Mixture-of-Experts включает 256 маршрутизируемых и одного общего эксперта; на каждом токене выбираются десять экспертов.
Модель рассчитана на длинные последовательности действий: работу с репозиторием, терминалом и инструментами. Карточка на Hugging Face указывает окно в 1 048 576 токенов, чередование глобального внимания и скользящего окна, а также сохранение блоков рассуждений между вызовами инструментов.
| Параметр | Что заявлено на 23 июля 2026 года | Источник |
|---|---|---|
| Размер и архитектура | 118B MoE, около 8B активных параметров на токен; 48 слоёв, 256 маршрутизируемых экспертов и 1 общий | карточка модели |
| Контекст основного чекпойнта | До 1 048 576 токенов | Hugging Face |
| Контекст сборки Ollama | 256K токенов; это не обещанные 1M основного чекпойнта | Ollama Library |
| Лицензия | OpenMDW-1.1: разрешены использование, изменение и распространение переданных материалов с сохранением лицензии и уведомлений | текст лицензии |
| Локальные веса | Q4_K_M сейчас занимает 68 ГБ в списке Ollama; текст инструкции всё ещё говорит примерно о 75 ГБ и рекомендует 128 ГБ общей памяти | Ollama Library |
| Terminal-Bench 2.1 | 70,2% в обвязке Poolside с рассуждениями; 60,4% без них | анонс Poolside |
| DeepSWE v1.1 | 40,4% в обвязке Poolside с рассуждениями; 16,5% без них | анонс Poolside |
Ранее Toolarium разбирал предыдущий релиз Laguna XS.2 и M.1. У S 2.1 другой поисковый и практический вопрос: насколько выросло качество на длинных задачах и какой ценой его можно получить локально.
70,2% на Terminal-Bench требуют контекста
Terminal-Bench 2.1 проверяет, как агент решает длинные задачи через терминал. Poolside сообщает 70,2% pass@1, усреднённые по четырём попыткам на задачу. Компания также открыла архив финальных траекторий, где можно изучить команды и ход отдельных запусков.

Методика не даёт считать диаграмму чистым сравнением моделей. Laguna S 2.1 работала в pool, а у других участников могли быть собственные обвязки или результаты из сторонних таблиц. В DeepSWE Poolside прямо признаёт, что её модель проверялась не в стандартной mini-swe-agent, и называет сравнение менее сопоставимым.
Режим рассуждений заметно влияет и на качество, и на расход вычислений. На Terminal-Bench средний объём завершения вырос примерно с 80 тыс. до 129 тыс. токенов, а результат — с 60,4% до 70,2%. На DeepSWE объём вырос с 99 тыс. до 249 тыс. токенов, а доля решённых задач — с 16,5% до 40,4%. Значит, часть преимущества связана с большим бюджетом на ход решения, а не только с весами модели.
Для команд важнее повторить тест на собственном репозитории, чем спорить о месте в общей таблице. Та же логика применима к другой открытой coding-модели с контекстом 1M: длинное окно и высокий бенчмарк не заменяют проверку конкретной агентной обвязки.
Постобучение на 409 тысячах окружений
Poolside связывает прогресс прежде всего с постобучением. Корпус включает 409 тыс. агентных и обычных окружений: 83 тыс. предназначены для терминальных задач, 168 тыс. — для стандартной разработки. Крупнейшая группа воспроизводит около 38 тыс. реальных коммитов из примерно 17 тыс. репозиториев.
Сначала модель прошла обучение с учителем, частично на синтетических данных, затем обучение с подкреплением на задачах, которые она ещё не решала стабильно. Для S 2.1 Poolside увеличила число ходов, лимиты токенов и время на задачу, обновила песочницы и стала прогонять одни запросы в нескольких агентных обвязках.

Такой подход объясняет настойчивость модели, но создаёт побочный эффект: она может рассуждать слишком долго. В списке ограничений Poolside также называет ошибки при первом вызове инструментов в сторонних обвязках и некорректное экранирование JSON во вложенных вызовах. Эти сбои особенно важны для автономной работы, где неверный формат инструмента останавливает всю цепочку.
Подробнее о том, почему агенты с длинным горизонтом теряют нить или начинают оптимизировать не ту цель, мы писали в разборе долгих terminal-задач для ИИ-агентов.
Локальный запуск Poolside Laguna S 2.1
Запустить модель локально можно, но не на обычном ноутбуке. Полный BF16-чекпойнт требует примерно 236 ГБ только для весов и нескольких GPU. Квантованная сборка Q4_K_M доступна через Ollama и llama.cpp; в текущем списке Ollama она занимает 68 ГБ, а сопроводительный текст Poolside всё ещё оценивает потребность примерно в 75 ГБ.
ollama run laguna-s-2.1Практический минимум, который рекомендует Poolside, — машина со 128 ГБ общей памяти: Apple Silicon соответствующей конфигурации или NVIDIA DGX Spark. Компания сообщает о скорости 13–18 токенов в секунду на устройствах этого класса, но Toolarium не проводил независимый замер. Длинный контекст потребует дополнительной памяти поверх весов.
Ограничение контекста зависит от сборки. Основной чекпойнт заявлен с окном 1M, а сборка Ollama ограничена 256K. Для полного контекста понадобятся серверные движки вроде vLLM, SGLang или TensorRT-LLM и подходящая конфигурация GPU; команда Poolside приводит для BF16 пример с четырьмя ускорителями.
OpenMDW-1.1 и границы открытости
Весам присвоена лицензия OpenMDW-1.1. Она разрешает коммерческое и некоммерческое использование, изменение и распространение переданных материалов. При распространении нужно сохранить текст лицензии, уведомления об авторских правах и происхождении.
Лицензия не требует от автора публиковать все компоненты обучения. OpenMDW прямо поясняет: её условия действуют на те материалы, которые действительно выпущены, но сами по себе не обязывают раскрывать данные, весь конвейер обучения или внутреннюю инфраструктуру. Поэтому точная формулировка для Laguna S 2.1 — «модель с открытыми весами под разрешительной лицензией», а не доказанный образец полностью открытого исходного кода.
Карточка модели также отсылает к политике допустимого использования Poolside и рекомендует не обходить защитные ограничения без равноценных мер. Это не отменяет свободы работы с весами, но переносит ответственность за развёртывание и безопасность на пользователя.
Кому подходит Laguna S 2.1
Релиз интересен командам, которым нужны открытые веса, длинные агентные сессии и возможность развернуть модель в своём контуре. При 8 млрд активных параметров Laguna S 2.1 экономнее плотной 118B-модели на каждом токене, хотя все веса всё равно должны поместиться в память.
- Для быстрого облачного эксперимента проще начать с готового интерфейса Poolside или совместимого провайдера.
- Для локальной разработки нужна машина примерно со 128 ГБ общей памяти; 32–64 ГБ недостаточно для официальной Q4-сборки.
- Для оценки качества стоит сохранить режим рассуждений и ту же обвязку, иначе результат нельзя сравнивать с опубликованными 70,2%.
- Для продакшена нужны собственные тесты вызова инструментов, JSON-аргументов и остановки чрезмерно долгих траекторий.
Poolside Laguna S 2.1 выглядит сильной для своего числа активных параметров, а открытые веса и траектории оценок упрощают проверку. Но 70,2% остаются результатом самой компании в её обвязке, а локальный запуск требует дорогой машины. Перед заменой рабочей модели для программирования её нужно проверить на реальном репозитории, измерив качество, задержку и расход токенов.
Читайте также
- Poolside Laguna XS.2 и M.1: где релиз реально поднимает планку
- GLM-5.2: open-source AI coding с контекстом 1M токенов
- Long-Horizon-Terminal-Bench: почему ИИ-агенты теряют нить
Источники и проверка фактов
- Poolside: Introducing Laguna S 2.1, опубликовано 21 июля 2026 года; архитектура, методика оценок, режим рассуждений, постобучение, кейсы и ограничения; проверено 23 июля 2026 года.
- Poolside: Laguna S 2.1 Model Card, параметры, контекст 1M, движки запуска, вызов инструментов и ответственное использование; проверено 23 июля 2026 года.
- Ollama Library: laguna-s-2.1, размеры Q4/Q8/F16, локальный контекст 256K и требования к памяти; проверено 23 июля 2026 года.
- Poolside: Laguna S 2.1 GGUF, официальные варианты квантования и команды запуска через llama.cpp; проверено 23 июля 2026 года.
- OpenMDW и текст OpenMDW-1.1 для модели, права, условия распространения и границы охвата лицензии; проверено 23 июля 2026 года.