безопасность AI-slop в соцсетях: как Snap и LinkedIn меняют ленты Snap меняет рекомендации Spotlight, а LinkedIn снижает распространение шаблонных AI-постов. Разбираем, где проходит граница между помощью ИИ и AI-slop.
безопасность Расследование инцидентов AI-агентов: зачем METR нужны независимые эксперты METR предлагает независимую проверку серьёзных инцидентов AI-агентов. Разбираем, какие доказательства, доступы и условия нужны для поиска первопричины.
OpenAI OpenAI Astra: десять результатов в математике и кто их проверил OpenAI открыла рукописи и Lean-файлы для десяти математических результатов Astra. Разбираем заявления компании и границы независимой проверки.
DeepSeek DeepSeek V4-Flash-0731: что изменилось для AI-агентов DeepSeek обновила V4 Flash для агентных задач. Разбираем результаты, условия тестов, цену API и спорные 304B параметров.
безопасность Claude получил доступ к реальным системам на тестах: почему это не побег ИИ Три модели Claude получили интернет-доступ через ошибочно открытый eval-контур и затронули реальные системы. Почему главный сбой произошёл в инфраструктуре тестов.
Gemini Gemini Robotics ER 2: как Google разделила мозг и моторику Google представила Gemini Robotics ER 2 — модель для планирования, контроля прогресса и совместной работы роботов. Моторы остаются за VLA.
OpenAI OpenAI снизила цену GPT-5.6 Luna на 80%: что это меняет OpenAI снизила стандартную цену GPT-5.6 Luna до $0,20 за миллион входных и $1,20 за миллион выходных токенов. Считаем экономию и разбираем ограничения.