LLM Muse Spark 1.1 API: как Meta входит в ценовую войну моделей Meta вывела Muse Spark 1.1 в публичный API preview: $1.25 за входные и $4.25 за выходные 1M токенов, 1M context и ставка на агентные задачи.
OpenAI OpenAI обошла людей на AtCoder: что это значит для AI-кодинга OpenAI выиграла Human vs. AI матч AtCoder 2026, решив все пять задач. Главное - не сенсация о замене программистов, а сдвиг в reasoning и test-time compute.
AI-агенты AgentLens benchmark для coding agents: почему pass/fail уже мало AgentLens оценивает coding agents по полной траектории работы, а не только по pass/fail. Разбираем методику, первые результаты Java fold и ограничения paper.
OpenAI OpenAI нашла, что треть SWE-Bench Pro сломана: что это значит для AI-кодинга OpenAI отзывает рекомендацию SWE-Bench Pro после аудита задач. Что значит 30% broken tasks для AI-кодинга, leaderboard и внутренних evals компаний.
безопасность HalluSquatting: supply-chain атака на AI coding tools HalluSquatting делает галлюцинации LLM риском цепочки поставки: coding agent может скачать и запустить ресурс, который атакующий занял заранее.
безопасность Автономные UGV в Украине: что показали Lancer от Forterra Forterra раскрыла применение 100+ Lancer в Украине. Разбираем, где автономность работает, где нужен оператор и почему это вопрос AI safety.
Gemini Gemini API Managed Agents получили background execution и MCP Google добавила в Gemini API Managed Agents background execution, remote MCP servers, custom functions и refresh credentials. Разбираем пользу и ограничения.