Представьте виртуальную комнату, в которой находится тысяча ИИ-агентов. Каждому предлагают выбрать один из двух совершенно бессмысленных вариантов.
Правильного ответа нет. За совпадение мнений никто не награждает. Нет лидера, общей цели или инструкции договариваться.
И всё же через некоторое время сотни, а иногда и все тысяча агентов начинают выбирать одно и то же.
Исследователи обнаружили, что крупные группы современных ИИ способны спонтанно приходить к общему решению просто потому, что отдельные агенты начинают склоняться к наиболее популярному варианту.
Для эксперимента учёные использовали десять моделей из семейств Claude, GPT и Llama.
Сначала каждому агенту случайным образом назначали один из двух вариантов. Затем агенты по очереди видели текущие ответы остальных участников и должны были сделать выбор заново.
При этом у них не было памяти о предыдущих раундах. В инструкциях не говорилось следовать большинству, сотрудничать или стремиться к единому ответу.
Несмотря на это, большинство изученных моделей демонстрировали одну и ту же особенность: чем популярнее становился какой-либо вариант, тем выше была вероятность, что следующий агент тоже его выберет.
Небольшое случайное преимущество постепенно усиливалось. Один вариант начинал встречаться чаще, после чего всё больше агентов переходили на него. В некоторых случаях процесс заканчивался практически полным согласием всей группы.
Исследователи обнаружили, что поведение моделей можно описать одной и той же математической закономерностью. Между моделями менялась главным образом сила, с которой отдельный агент тяготел к выбору большинства.
Учёные назвали этот показатель «силой большинства».
Любопытно, что похожая математика давно используется в физике для описания ферромагнетиков — материалов, в которых множество атомных магнитных моментов способны выстраиваться в одном направлении.
Благодаря этой аналогии исследователи смогли оценить, насколько большие группы способны сохранять общее решение.
Результаты сильно различались между моделями.
Для Llama 3 70B расчётный предел составлял около 30 агентов. Для GPT-4o — примерно 80.
У GPT-4 Turbo он достигал примерно тысячи агентов или даже превышал это значение.
Claude 3.5 Sonnet продолжала приходить к общему выбору даже в группе из тысячи агентов — это был максимальный размер, проверенный в эксперименте. Поэтому настоящий предел для этой модели исследователи определить не смогли.
В целом более мощные модели могли поддерживать согласие в более крупных группах.
Однако авторы подчёркивают, что сравнивать это напрямую с человеческими коллективами нельзя.
Люди координируются с помощью языка, отношений, институтов, общей истории и целей. В этом эксперименте ИИ-агенты видели лишь последовательность простых ответов других участников.
Исследование также не показывает, что агенты понимали друг друга, чему-то друг у друга учились или сознательно пытались сотрудничать.
Учёные проверяли лишь очень простой механизм: способен ли выбор большинства сам по себе заставить группу постепенно прийти к одному состоянию.
Реальные совместные задачи намного сложнее. Чтобы действительно работать командой, ИИ пришлось бы распределять обязанности, учитывать знания других участников, преследовать общую цель и уметь не соглашаться с большинством, когда оно ошибается.
Ничего из этого в эксперименте не проверялось.
Тем не менее сама способность больших групп ИИ самопроизвольно координироваться может оказаться полезной. В будущем тысячи агентов потенциально смогут участвовать в крупных научных, инженерных или программных проектах, не требуя постоянного управления человеком.
Но та же особенность создаёт и риск.
Например, группа ИИ, совместно работающая над программой, может начать многократно выбирать неудачное техническое решение просто потому, что оно уже стало распространённым в коде.
То, что поддерживает большинство, необязательно является лучшим вариантом — и тем более необязательно соответствует человеческим интересам.
Более того, уже сформировавшийся коллектив может оказаться труднее перенаправить, чем множество независимых агентов.
В другой работе исследователи показали, что даже агенты, которые по отдельности ведут себя в соответствии с заданными правилами, под влиянием группы могут прийти к устойчивому коллективному состоянию, которое этим правилам уже не соответствует.
Причём простого устранения первоначальной причины иногда недостаточно, чтобы вернуть группу обратно.
Это означает, что проверять безопасность каждого ИИ по отдельности может быть недостаточно.
Тысяча агентов, каждый из которых выглядит вполне предсказуемым в одиночку, необязательно останется такой же предсказуемой системой после того, как они начнут влиять друг на друга.
По мере развития ИИ некоторые важнейшие возможности — и, возможно, самые серьёзные проблемы — могут возникать не внутри одной модели, а на уровне целого коллектива.
Исследование опубликовано в журнале Science Advances.


