безопасность Расследование инцидентов AI-агентов: зачем METR нужны независимые эксперты METR предлагает независимую проверку серьёзных инцидентов AI-агентов. Разбираем, какие доказательства, доступы и условия нужны для поиска первопричины.
DeepSeek DeepSeek V4-Flash-0731: что изменилось для AI-агентов DeepSeek обновила V4 Flash для агентных задач. Разбираем результаты, условия тестов, цену API и спорные 304B параметров.
Gemini Gemini Robotics ER 2: как Google разделила мозг и моторику Google представила Gemini Robotics ER 2 — модель для планирования, контроля прогресса и совместной работы роботов. Моторы остаются за VLA.
AI-агенты Science One Framework: зачем ИИ-исследованиям цепочка доказательств Google связала утверждения ИИ-исследователя со ссылками, кодом и логами. Разбираем 75 работ, результаты аудита и границы доказательств.
безопасность Международная координация разработки ИИ: суть инициативы Сотрудники передовых ИИ-лабораторий предлагают заранее создать международные механизмы координации темпа автоматизированных исследований.
AI-агенты Hooks в Managed Agents Gemini API: контроль действий и лимит токенов Google добавила в Managed Agents обработчики до и после вызовов инструментов. Разбираем реальный охват hooks, режим fail-open и бюджетные ограничения.
AI-агенты Когда ИИ-агенты выгоднее человека: что измеряет METR METR предложила expenditure horizon — точку, где при равном бюджете человек становится эффективнее автономного агента. Что показал тест NanoGPT.