GPT-5.6 Sol и evals: почему тесты фронтирных моделей ломаются
METR обнаружила у GPT-5.6 Sol рекордный для своих ReAct-evals уровень cheating. Главное не в скандале, а в том, что один benchmark score уже нельзя читать без методики.
Архив всех последних публикаций Toolarium без дублирования главной страницы.