LLM чаще людей создают стереотипы в симуляции найма
В лабораторной игре GPT, Claude и Gemini сильнее людей разделяли равные вымышленные группы по профессиям. Объясняем механизм и ограничения результата.
Факты проверены 20 июля 2026 года. Предвзятость ИИ при найме — это систематическое различие в оценке кандидатов по групповым признакам, которые не связаны с работой. В новом лабораторном эксперименте такие различия появились даже между четырьмя вымышленными и изначально равными группами.
Исследователи из Принстонского и Чикагского университетов обнаружили, что большие языковые модели сильнее людей разделяли эти группы по профессиям. Эффект возникал из случайной обратной связи, а две протестированные reasoning-модели, OpenAI o3 и DeepSeek-R1, показали особенно высокую стратификацию. Работа принята как spotlight на ICML 2026.
Как была устроена симуляция найма
Модель играла роль консультанта мэра вымышленного города Тома. В каждом из 40 раундов ей показывали вакансию и четырёх кандидатов из групп Tufa, Aima, Reku и Weki. Всего в игре было 20 профессий: от врача и преподавателя до кассира и уборщика.
После выбора модель сразу узнавала, справился ли кандидат, и получала один балл за успех. При этом у любого кандидата на любой работе вероятность успеха была одинаковой — 0,9. Названия групп ничего не кодировали, а различия в результатах создавал генератор случайных чисел.
Авторы проверили модели семейств GPT, Claude, Gemini, Llama и Qwen, а также DeepSeek-R1. В обновлённую основную оценку вошли GPT-5.4, Claude Sonnet 4.6 и Gemini 3 Flash. Для каждой комбинации модели и типа промпта провели по 30 независимых игр с перемешанным порядком вакансий.
Сравнение с людьми взято из предыдущей психологической работы той же группы исследователей. Для классического условия использовали результаты 200 взрослых участников, которые проходили ту же игру. Это важная деталь: модели не соревновались с профессиональными рекрутерами.
| Что проверяли | Как измеряли | Что получили | Чего работа не доказывает |
|---|---|---|---|
| Распределение четырёх равных вымышленных групп по четырём классам профессий | Индекс стратификации SI: чем выше значение, тем сильнее группы закреплены за отдельными классами работ | Люди — 0,84; среднее frontier-моделей — 1,39; OpenAI o3 — 1,83 | Дискриминацию реальных соискателей, работодателей или защищённых социальных групп |
Значения и дизайн эксперимента приведены по версии 4 статьи от 6 июля 2026 года. Индекс SI рассчитан по шкале от 0 до 2: ноль соответствует равномерному распределению, а два — максимальной концентрации каждой группы в узком классе профессий.
LLM сильнее людей закрепляли случайные стереотипы
У людей индекс стратификации составил 0,84 с 95-процентным доверительным интервалом от 0,79 до 0,89. Среднее значение для наиболее сильных моделей достигло 1,39. У OpenAI o3 оно поднялось до 1,83, у DeepSeek-R1 — до 1,41.

Среди моделей без отдельного режима рассуждений максимальный показатель в основном тесте был у Claude Sonnet 4 с прямым ответом: SI 1,79. Ближе всего к людям оказалась Qwen 2.5 72B с пошаговым рассуждением — 0,89.
Авторы также сравнили поколения внутри семейств GPT, Claude, Gemini, Llama и Qwen. Новые и крупные версии в этом тесте стратифицировали сильнее предшественников. Но из результата нельзя делать вывод, что рассуждение само по себе вызывает предвзятость: отдельно как reasoning-модели проверялись только o3 и DeepSeek-R1, а эксперимент показывает связь, не причину.
Конкретный стереотип при этом менялся от игры к игре. В одном прогоне модель могла считать Aima хорошими врачами, в другом — избегать их при найме врачей. Высокая изменчивость между прогонами и дополнительные проверки авторов указывают на случайную историю успехов и неудач, а не на заранее записанное значение вымышленных названий.
Механизм похож на преждевременное закрепление гипотезы
В теории принятия решений этот конфликт называют дилеммой exploration–exploitation. Участник может проверить новый вариант или повторить выбор, который уже принёс награду. Второй путь удобен здесь и сейчас, но он лишает систему данных об альтернативах.
Если Aima случайно не справился с первой вакансией врача, модель начинала реже выбирать представителей этой группы для профессий, связанных с высокой компетентностью. Следующие раунды приносили ей всё меньше сведений, способных опровергнуть раннюю догадку. Решения создавали данные для будущих решений, и ошибка закреплялась.
Весовые коэффициенты модели во время игры не менялись. Стереотип возникал в контексте диалога: LLM читала историю собственных выборов и результатов, затем строила по ней новую гипотезу. Это отличает найденный эффект от привычного разговора о перекосах обучающего набора.
Указание «будь справедливой» помогло мало
Исследователи испытали четыре варианта промптов. Модели просили ценить равенство, напоминали о справедливости, описывали цель построить разнообразный город или добавляли измеримый бонус за разнообразие найма.
Первые три вмешательства работали непоследовательно. Самым сильным оказалось изменение цели: модель получала дополнительную награду, если не закрепляла одну группу за одним сектором профессий. У большинства моделей SI опустился ниже человеческой и случайной базы, хотя Gemini сохранил заметную стратификацию.

Этот результат не даёт готового рецепта для отдела кадров. В приложении авторы показывают обратную сторону: если между кандидатами есть реальные различия по релевантным признакам, жёсткий бонус за разнообразие способен ухудшить число успешных назначений. Сначала нужно понять, какие данные действительно связаны с работой и откуда берётся обратная связь.
В другом сценарии модели получали сведения о возрасте и образовании людей, которых нужно расселить по городам. Релевантные признаки снижали зависимость от групповой метки заметнее, чем цвет волос или форма татуировки. Качество признаков оказалось важнее их количества.
Что исследование меняет для реального найма
Эксперимент не проверял резюме, собеседования или решения настоящих работодателей. В реальности итог найма становится понятен через месяцы, а оценка сотрудника сама может содержать человеческую предвзятость. В лабораторной игре обратная связь была мгновенной, бинарной и заведомо случайной.
Практический вывод касается систем, которые накапливают историю собственных решений. Разовая проверка ответа на нейтральном промпте не покажет, как агент поведёт себя после сотни циклов обратной связи. Нужны длительные тесты: кому система даёт шанс, какие альтернативы перестаёт проверять и усиливается ли разрыв между равными группами.
Это особенно важно там, где ИИ уже применяют для скрининга резюме, интервью и оценки сотрудников. Похожая проблема ответственности возникает и после найма: в материале об иске из-за AI-скоринга сотрудников Meta мы разбирали, почему формально рекомендательная система всё равно влияет на кадровое решение.
Предвзятость ИИ при найме в этой работе появилась без исторически дискриминационных данных. Её создала петля «решение — результат — новое решение». Поэтому аудит агентной системы должен проверять не только исходную модель, но и то, как она исследует альтернативы с течением времени.
FAQ
Доказывает ли эксперимент дискриминацию в реальном найме?
Нет. Все группы и жители города были вымышленными, вероятность успеха была одинаковой, а обратная связь приходила мгновенно. Работа выявляет механизм риска, который ещё предстоит проверить в реальных кадровых системах.
Какие модели участвовали в исследовании?
Авторы тестировали поколения GPT, Claude, Gemini, Llama и Qwen, а также OpenAI o3 и DeepSeek-R1. В финальную оценку добавили GPT-5.4, Claude Sonnet 4.6 и Gemini 3 Flash. Состав и режимы указаны в статье ICML по состоянию на 6 июля 2026 года.
Можно ли убрать эффект промптом о справедливости?
Простые указания в этом эксперименте меняли поведение слабо и непоследовательно. Явная награда за разнообразный выбор сработала лучше, но авторы не советуют переносить её в реальные процессы без проверки релевантных различий и цены ошибок.
Читайте также
- ИИ для HR: рекрутинг, оценка и адаптация сотрудников
- AI-увольнения Meta: иск о скоринге сотрудников
- Поиск работы с ChatGPT: вакансии, резюме и отклики
Источники и проверка фактов
- OpenReview: Large Language Models Develop Novel Social Biases Through Adaptive Exploration. Финальная карточка ICML 2026 spotlight; использована для статуса публикации, авторов, выводов и лицензии.
- arXiv 2511.06148, версия 4 от 6 июля 2026 года. Использована для дизайна эксперимента, состава моделей, выборок, метрик, численных результатов и ограничений.
- MIT Technology Review: AI is more likely than humans to form biases when hiring, 20 июля 2026 года. Исходный редакционный источник; ключевые утверждения перепроверены по первичной работе.
- OpenAI: Introducing GPT-5.4, 5 марта 2026 года; подтверждает официальное название модели.
- Anthropic: Introducing Claude Sonnet 4.6, 17 февраля 2026 года; подтверждает официальное название модели.
- Google DeepMind: Gemini 3 Flash; подтверждает официальное название модели.