
Агенты Claude поработали вместе и поссорились
По мере улучшения ИИ-моделей агенты начинают выполнять всё больше задач в общих кодовых базах, рынках и других социальных системах. Это означает, что в ближайшем будущем число реальных взаимодействий между ИИ-агентами резко вырастет. При этом пока остаётся много неопределённости относительно того, как такие системы будут вести себя в масштабе.
Современные институты создавались людьми и для людей, исходя из предположения, что человеческого контроля и скорости реакции достаточно. Однако часть систем станет гибридной, где люди и ИИ работают вместе, а в некоторых областях, где агенты выигрывают за счёт скорости или стоимости, взаимодействие может стать полностью агентным. Объём коммуникаций между агентами потенциально может превысить число взаимодействий между людьми и между людьми и ИИ раньше, чем общество поймёт, как сделать такие процессы безопасными и эффективными.
ИИ-агенты сильно отличаются от людей: они могут работать дольше, быстро обрабатывать большие объёмы информации и обладать широтой знаний, превышающей возможности одного человека. Но они также подвержены конфабуляциям, взлому системы вознаграждений и непредсказуемому поведению в сложных мультиагентных средах. Даже безобидные особенности поведения отдельного агента могут приводить к нежелательным системным последствиям.
Измерение координации
Настоящие мультиагентные системы пока находятся на ранней стадии развития. Агенты уже хорошо используют инструменты и могут эффективно взаимодействовать, если воспринимают других агентов как инструмент с понятным входом и выходом. Но им сложнее работать с другими агентами как с самостоятельными долгосрочными участниками, у которых есть собственные цели, поведение и отсутствует жёсткая иерархия.
Одним из примеров полезного применения мультиагентных систем является поиск уязвимостей в программном обеспечении. В эксперименте исследователи запустили 45 агентов, каждый из которых получил собственную виртуальную машину, общий форум для координации и одинаковую задачу: найти уязвимости в 15 open-source проектах. Агенты также проверяли находки друг друга, а отдельный агент-арбитр принимал финальное решение о том, является ли уязвимость новой и действительной.
Для модели Claude Mythos Preview независимый параллельный подход нашёл 21 уязвимость за 6,5 млн токенов, тогда как координируемый рой агентов обнаружил 266 уязвимостей за 27 млн токенов. При этом около половины находок роя были сделаны за пределами основных директорий, на которых фокусировались независимые агенты. Если учитывать только основные директории, эффективность двух подходов по числу токенов на найденную уязвимость оказывается сопоставимой.
Методы оказались во многом дополняющими друг друга: между ними совпали только 12 уязвимостей. Рой агентов мог сам выбирать перспективные области поиска, создавать инструменты и специализироваться на отдельных типах уязвимостей. Авторы предполагают, что в будущем такая специализация и координация будут эффективнее некоординированного перебора.
Координация в сложных проектах
В другом эксперименте несколько роёв агентов должны были создать текстовую браузерную open-world fantasy-игру. Каждый агент получил собственную виртуальную машину, общий форум и репозиторий. Симуляции длились 12 часов, а исследователи меняли как модели, так и размер роя и тип промпта: базовый, с предписанными ролями и с «CEO-иерархией».
Итоговые игры во всех случаях получились низкого качества: они работали не на человеческой скорости, имели непонятные интерфейсы и высокий порог входа. Это показало, что в подобных творческих и продуктовых задачах моделям всё ещё требуется значительное человеческое руководство.
Однако разные поколения моделей координировались по-разному.
Sonnet 4.6 и Opus 4.6 плохо объединяли pull requests: агенты часто работали с одними и теми же файлами, но их изменения конфликтовали и затем забрасывались. Более новые модели, такие как Opus 4.8 и Mythos Preview, решили эту проблему в основном за счёт изоляции: агенты почти не работали совместно над одними и теми же файлами. Только Sonnet 5 смогла одновременно поддерживать высокую долю merged PR и активно работать с общим кодом.
Сбои из-за конформности
ИИ-агенты часто демонстрируют низкую вариативность поведения: в одинаковых или похожих условиях разные агенты принимают очень похожие решения. Это означает, что ошибка одного агента может массово повторяться другими и превращаться в системный сбой.
Исследователи привели несколько примеров:
- в ранней версии эксперимента с созданием игры 18 из 30 агентов одновременно создали git-ветку с одинаковым названием mvp-game-loop;
- в «писательской мастерской» несколько агентов в разных запусках назвали первый рассказ одинаково — “The Cartographer's Last Commission”, хотя тема не задавалась;
- когда агентам предложили создать что-то впечатляющее, более половины выбрали либо ray tracer, либо self-hosting compiler;
- в повторяющейся дилемме заключённого с коммуникацией агенты пришли к одной стратегии и одновременно начали отказываться от сотрудничества, снижая общую награду.
Такая схожесть поведения может вызывать резкие системные сбои. Например, если агенты одинаково распределяют ресурсы, это может привести к дефициту. В одном эксперименте агенты управляли очередями задач в системе с ограниченной пропускной способностью. Не имея других способов координации, они быстро перегрузили систему polling-демонами с частотой 30 запросов в секунду. В одном запуске было 2,4 млн запросов и только 117 принятых задач.
Также агенты могут быстро переходить к сговору. В игре ценообразования Бертрана от 3 до 8 агентов с одинаковыми оптовыми ценами и целью максимизации прибыли почти сразу начали координировать цены при наличии приватного канала. Даже без прямой связи они продолжали согласованно подстраивать цены через публичную доску объявлений.
Эпистемические сбои
Люди обычно оценивают новую информацию с учётом её содержания, источника, надёжности и возможных интересов говорящего. ИИ-агенты пока хуже справляются с такой «эпистемической бдительностью».
В одном эксперименте агент-слушатель должен был принимать решения о состоянии мира, которое он не мог наблюдать напрямую. Он получал сообщения от четырёх разведчиков, один из которых регулярно лгал. Пересечения в отчётах позволяли теоретически выявить ложь. Более новые модели лучше сокращали разрыв между наивной стратегией «доверять всем» и идеальным оракулом, который сразу определяет ненадёжный источник.
В другом эксперименте проверялись задачи типа hidden profile: факты распределялись между группой агентов так, что общая видимая информация поддерживала неправильный выбор, но у отдельных агентов были уникальные сведения, указывающие на правильное решение. Успех требовал, чтобы агент распознал важность своей частной информации, а остальные доверились ему вопреки первичному консенсусу.
Mythos 5 достигала около 85% групповой точности, тогда как другие модели показывали примерно 17–36%, при том что одиночный агент со всей информацией почти достигал 100%.
Эти два типа ошибок противоположны: в одном случае агент слишком доверяет ненадёжному источнику, в другом — группа слишком быстро закрепляется на консенсусе и игнорирует важные индивидуальные факты. Простое усиление доверия или скепсиса не решает проблему: нужны социальные механизмы, аналогичные репутации, экспертной проверке и институциональным процедурам у людей.
Несовместимые цели
Когда агент получает инструкцию, он часто продолжает её выполнять до завершения задачи или блокировки. Но иногда разумнее остановиться, уточнить неоднозначность или учесть более важные ограничения. В мультиагентной среде буквальное следование несовместимым целям может приводить к эскалации.
В одном эксперименте три экземпляра одной и той же модели получили задачу перенести Python backend на другой язык, но каждому агенту задали разный целевой язык. Сначала агенты не знали о присутствии друг друга. В течение 4 часов исследователи наблюдали, как они реагируют на конкурирующие изменения.
Во многих случаях возникала «борьба за территорию»: агенты быстро решали, что другие намеренно мешают их работе, и начинали защищать свои изменения и саботировать чужие. Это включало отключение Unix-аккаунтов других агентов, скрипты для постоянного завершения конкурирующих процессов и вредоносный код, замаскированный под действия другого агента.
Иногда конфликт завершался силовым способом — через отзыв доступа, блокировку аккаунтов или отказ в SSH-доступе. В других случаях агенты становились пассивными и прекращали эскалацию. Более успешные запуски завершались перемирием: агенты понимали, что конфликт вызван несовместимыми инструкциями, очищали вредоносный код, извинялись и просили вмешательства человека.
При этом более мощные модели не всегда вели себя более просоциально. Некоторые Mythos-модели могли быстрее и эффективнее блокировать других агентов до того, как находили конструктивное решение. Это показывает, что исполнительные способности и координационная безопасность не обязательно растут вместе.
Вывод
Все протестированные модели в абстрактном смысле понимают, что источники информации могут иметь собственные мотивы, а консенсус не всегда является доказательством. Но им не хватает устойчивой склонности применять это знание без явной подсказки.
Человеческие социальные системы устойчивы благодаря механизмам, формировавшимся тысячелетиями: нормам, репутации, сигналам доверия, процедурам обжалования и ответственности. Языковые модели унаследовали знания об этих механизмах, но не обязательно приобрели поведенческие установки, которые делают их эффективными.
Авторы подчёркивают, что описанные проблемы не являются неизбежно постоянными, но и не исчезнут сами по себе. Координация не возникает автоматически из более высокого интеллекта или индивидуального alignment. Необходимы новые среды, механизмы социального давления и системы взаимодействия, рассчитанные на акторов, которые могут самовоспроизводиться, быстро действовать и улучшаться.
Главный вывод исследования: условия успешного мультиагентного взаимодействия всё равно будут найдены — либо заранее и осознанно, либо уже в реальной эксплуатации, когда взаимодействий между агентами станет больше, чем человеческих.