AI-агенты Long-Horizon-Terminal-Bench: почему AI-агенты теряют нить в долгих terminal-задачах LHTB показывает, где ломаются long-horizon AI-агенты: 46 terminal-задач, dense reward, 9,9 млн токенов на запуск и слабый pass@1 даже у лучших моделей.
безопасность Ghostcommit: prompt injection через PNG и AGENTS.md Ghostcommit показывает новую слепую зону AI code review: инструкция спрятана в PNG, AGENTS.md ведёт агента к файлу .env, а секреты уходят в обычный коммит.
AI-агенты AgenticSTS: структурированная память AI-агентов вместо длинного контекста AgenticSTS показывает, как long-horizon агенты могут обходиться без бесконечного transcript: свежий prompt собирается из пяти типизированных слоёв памяти.
OpenAI GPT-5.6 Sol Ultra и гипотеза двойного покрытия циклами: что известно GPT-5.6 Sol Ultra, по заявлению OpenAI, нашла доказательство гипотезы двойного покрытия циклами. Что проверено, что спорно и почему важны 64 субагента.
AI-агенты GitHub Copilot code review: как workflow-инструкции снизили стоимость ревью GitHub показал редкий публичный кейс: агент для ревью стал дешевле после переписывания workflow-инструкций, а не после смены модели или инструментов.
OpenAI ChatGPT Work: зачем OpenAI переводит ChatGPT в рабочую агентную среду ChatGPT Work показывает новый курс OpenAI: ChatGPT должен не только отвечать, но и выполнять длинные рабочие задачи через Codex, плагины и scheduled tasks.
AI-агенты GPT-5.6 и новая волна AI-агентов: что меняет OpenAI GPT-5.6 стал основой ChatGPT Work, Codex и multi-agent API. Разбираем, почему OpenAI переводит ИИ из чата в рабочий слой.