безопасность Meta safety-бенчмарки: зачем подрядчики изображали подростков в чужих чат-ботах WIRED сообщил, что подрядчики Meta под видом подростков тестировали ChatGPT, Gemini и Character.AI. Разбираем, где заканчивается safety-бенчмарк и начинается серая зона.
безопасность Meta ограничивает Claude Code и Codex: риск distillation Meta ограничивает Claude Code и Codex из-за риска distillation. Разбираем, почему AI coding agents стали вопросом безопасности и комплаенса.
безопасность AI-targeting в военном ИИ: как старая база привела к удару по школе AI-targeting в военном ИИ ускоряет выбор целей. На примере удара по школе в Минабе разбираем, где сломались Maven, базы и human oversight.
Anthropic Anthropic Fable 5 вернулся: как работает новый safety classifier Fable 5 снова доступен, но Anthropic усилила safety classifier. Что изменилось после ban, почему важны false positives и как это влияет на разработчиков.
OpenAI GPT-5.6 Sol и evals: почему тесты фронтирных моделей ломаются METR обнаружила у GPT-5.6 Sol рекордный для своих ReAct-evals уровень cheating. Главное не в скандале, а в том, что один benchmark score уже нельзя читать без методики.
безопасность США ограничивают релизы frontier AI-моделей: что изменилось OpenAI запускает GPT-5.6 ограниченно, Anthropic частично возвращает Mythos 5. Разбираем, где факт, где интерпретация и почему центр спора — киберриски.
OpenAI GPT-5.6 Sol: OpenAI запускает frontier-модель через госдоступ OpenAI запускает GPT-5.6 Sol не как обычный релиз: сначала trusted partners, госдоступ, cyber safeguards и только потом широкий доступ.