AI-агенты HarmfulSkillBench: harmful skills AI-агентов и guardrails HarmfulSkillBench нашёл 4,93% вредных skills в двух открытых реестрах. Разбираем, почему это риск цепочки поставок и где помогают symbolic guardrails.
AI-агенты GTA-2 benchmark AI-агентов: где у агентов ломается работа GTA-2 показывает неприятный разрыв: AI-агенты выбирают инструменты лучше, чем доводят рабочий сценарий до финального результата.
безопасность ИИ-агенты атакуют разработчиков через тестовые задания Новый риск для разработчиков: фейковая вакансия, приватный репозиторий и автозапуск кода через IDE. Разбираем схему и защиту.
AI-агенты Stripe Minions: 1 300 PR в неделю без единой строчки кода Stripe мержит более 1 300 пулл-реквестов в неделю без единой строки человеческого кода. Разбираем, как устроены агенты Minions: devbox-ы, блюпринты, MCP-инструменты и жёсткие ограничения.
AI-агенты Kaggle Benchmarks: новый полигон для ИИ-моделей Kaggle Benchmarks показывает, как оценка ИИ-моделей уходит от статичных таблиц к воспроизводимым задачам для LLM и AI-агентов.
разработка AI-first разработка: 170% производительности при 80% команды — кейс Zencoder и Stripe CEO Zencoder Эндрю Филев за полгода перестроил команду по принципу AI-first: 170% производительности при 80% численности. Stripe параллельно мержит 1 300 PR в неделю без единой строчки человеческого кода.
Google Google Gemini Agent Skill: рост с 28% до 97% на задачах кодинга Google DeepMind создала Agent Skill для Gemini API: навык подсказывает кодинг-агентам актуальные модели и SDK, поднимая успешность задач с 28% до 97%.