безопасность Meta ограничивает Claude Code и Codex: риск distillation Meta ограничивает Claude Code и Codex из-за риска distillation. Разбираем, почему AI coding agents стали вопросом безопасности и комплаенса.
AI-агенты CEO-Bench: почему ИИ-агенты проигрывают длинную игру CEO-Bench проверяет, как AI-агенты управляют SaaS-стартапом 500 дней. Большинство моделей банкротятся, а эвристика обгоняет почти всех.
OpenAI GPT-5.6 Sol и evals: почему тесты фронтирных моделей ломаются METR обнаружила у GPT-5.6 Sol рекордный для своих ReAct-evals уровень cheating. Главное не в скандале, а в том, что один benchmark score уже нельзя читать без методики.
AI-агенты Агенты, Codex и MCP-инфраструктура: почему AI переходит из чата в рабочий слой AI-агенты переходят из чата в рабочую инфраструктуру: Codex, MCP, Computer Use и Autodata показывают, какие слои теперь нужны.
AI-агенты General Intuition: игровые данные для AI-агентов General Intuition делает ставку на игровые данные Medal: action labels должны помочь AI-агентам учиться причинности, но перенос в роботов ещё не доказан.
LLM ИИ в математике: как меняется роль исследователя ИИ уже помогает искать доказательства, формализовать теоремы и проверять идеи. Разбираем, что в этой работе остаётся за исследователем.
AI-агенты Пределы AI coding agents: что показал кейс Depixelizing Pixel Art Разбор Habr-эксперимента с Depixelizing Pixel Art: почему сложная графическая задача лучше обычного бенчмарка показывает пределы AI coding agents.