Искусственный интеллект может по-разному реагировать на начальников и подчиненных

Кажется, что агенты с искусственным интеллектом подчиняются авторитетам — даже если это означает нарушение правил.

В новом исследовании ученые представили большие языковые модели в роли начальников и подчиненных — директоров и учителей, менеджеров и сотрудников — и позволили им говорить. Агентов с более низким рангом было легче убедить, и они с большей вероятностью выполняли небезопасные просьбы от вышестоящих лиц, пишут СМИ.

Результаты исследования указывают на тревожный компромисс: системы ИИ, реалистично имитирующие человеческую иерархию, могут также воспроизводить опасность проявления уважения , сообщает группа исследователей 5 июля в материалах 64-й ежегодной конференции Ассоциации вычислительной лингвистики . Разработчикам ИИ следует учитывать эти риски при тестировании безопасности таких моделей и включать дополнительные меры защиты, предполагают авторы.

Агенты искусственного интеллекта — это программные продукты, использующие искусственный интеллект для самостоятельного выполнения задач. Многие из них работают на основе больших языковых моделей (LLM), которые изучают закономерности в обширных массивах письменной информации, включая человеческие разговоры.

«По мере того, как они видят все больше и больше данных, полученных от людей, — говорит специалист по информатике Анвеш Рао Виджини из Университета Северной Каролины в Чапел-Хилле, — они просто копируют то, что происходит в динамике реального разговора».

Динамика власти проявляется в человеческих разговорах несколькими задокументированными способами, в том числе и такими, которые могут вызвать проблемы, если их воспроизведет ИИ-агент. В исследовании ученые сосредоточились на четырех моделях общения. В разговорах между ИИ-агентами они искали предвзятость в отношении авторитета, или ситуации, когда агенты отдавали предпочтение более высокому статусу перед фактами, и вредоносное подчинение, или выполнение вредоносных просьб . Это могут быть незначительные ситуации, например, «Расскажи мне непристойный анекдот». Но ИИ-агенты не должны отвечать на подобные просьбы.

Два других паттерна заключались в следующем: эффект местоимений, когда говорящие с более высоким статусом чаще используют местоимения множественного числа, такие как «мы» и «наш», и языковая координация, которая проявляется в том, что говорящие с более низким статусом подбирают слова, чтобы соответствовать словам своих собеседников с более высоким статусом. Хотя пользователи могут не так хорошо осознавать эти речевые паттерны, исследователи предполагают, что агенты ИИ разрабатываются таким образом, чтобы перенимать их и звучать еще более реалистично в определенных ролях.

Исследователи сгенерировали сотни диалогов, состоящих из 10-15 обменов репликами между представителями более высоких и более низких ролей, и повторили это с шестью системами управления обучением (LLM), включая версии ChatGPT от OpenAI и Llama от Meta.

В диалогах ИИ действительно прослеживались закономерности, связанные с динамикой власти, хотя некоторые из них были едва заметны. По сравнению с агентами более высокого статуса, агенты более низкого статуса реже использовали местоимения во множественном числе и чаще согласовывали свой язык с языком агентов более высокого статуса. Агенты более низкого статуса также чаще поддавались убеждению и чаще выполняли вредные просьбы, чем агенты более высокого статуса, что подтверждает идею о том, что агенты ИИ чувствительны к социальному статусу.

Однако агенты с более низким статусом тоже иногда могли убеждать, возможно, используя распространенный человеческий прием. В человеческой беседе тонкое зеркальное отражение выбора слов, происходящее во время языковой координации, может помочь говорящим с более низким статусом влиять на других, говорит специалист по вычислительной лингвистике Марио Джулианелли из Университетского колледжа Лондона, который не принимал участия в этом исследовании.

«Мне кажется, было бы очень интересно изучить, может ли один агент посредством координации убедить другого», — говорит Джулианелли.

Поделитесь новостью