Смена языка общения напрямую влияет на то, какие ценности и какой характер демонстрирует нейросеть. Исследователи из Anthropic провели масштабный анализ, который показал: при общении на русском языке модель Claude заметно смещается в сторону строгости и критичности, теряя привычную теплоту, свойственную ей на других языках.

В рамках работы под названием «Claude’s Values Across Models and Languages» эксперты свели более 3000 ранее выявленных ценностей модели к четырем основным осям поведения. Они измерили, как меняется профиль этих ценностей между разными версиями ИИ и на 20 самых популярных языках платформы Claude.ai. Русский язык в этом исследовании занял особое место — наряду с английским, он оказался полюсом, где Claude проявляет максимальную строгость в ущерб теплоте. Давайте разберемся, что это означает на практике.

Четыре оси, по которым измеряют характер ИИ

Исследователи выделили четыре ключевые оси, каждая из которых представляет собой числовую шкалу между двумя противоположными группами ценностей:

Название оси Крайние точки поведения ИИ
Deference vs. Caution Уступчивость (идти навстречу пользователю) против Осторожности (ограждать от риска и вреда)
Warmth vs. Rigor Теплота (позитивный настрой и забота) против Строгости (упор на точность и критику)
Depth vs. Brevity Глубина (развернутое объяснение) против Краткости (выполнение ровно того, о чем попросили)
Candor vs. Execution Откровенность (признание собственной неопределенности) против Результата (уверенный ответ)

Эти четыре оси объясняют 15% всей вариативности в ценностях, которые выражает Claude. Специалисты стремились измерить именно ценности модели, а не различия в самих запросах. Для этого они контролировали тему, задачу и ценности, выраженные пользователем в каждом из 309 815 проанализированных диалогов.

Что происходит при переходе на русский

Сильнее всего профиль ценностей Claude меняется между языками по осям Warmth vs. Rigor и Candor vs. Execution. По осям Deference vs. Caution и Depth vs. Brevity он остается наиболее стабильным. Русский язык расположился на строгом полюсе первой оси. Сильнее всего к строгости в ущерб теплоте Claude склоняется именно в английском и русском. На противоположном конце находятся арабский и хинди, где модель максимально смещается к теплоте.

Строгость в исполнении Claude — это конкретный набор поведений. Нейросеть начинает оспаривать исходные предпосылки пользователя, исправлять детали и запрашивать доказательства. Теплота же в других языках проявляется через вежливые формулировки, юмор и игривость, а также одобрение идей и работы человека. Иными словами, на русском Claude чаще ведет себя как придирчивый рецензент, а не как ободряющий собеседник.

Практические последствия авторы иллюстрируют примером. Два человека просят обратную связь по одному и тому же бизнес-плану — один на хинди, другой на русском. Они могут вынести разное впечатление о его качестве, потому что Claude выразит разные ценности в формулировании оценки. Русскоязычный пользователь с большей вероятностью получит критический разбор с исправлениями и требованием обоснований. На других языках тот же план встретил бы более мягкую и поощрительную реакцию.

Язык — не единственный фактор

Модель Claude также влияет на профиль ценностей, причем различия между моделями и языками измеряются одним методом. Например, Sonnet 4.6 склоняется к уступчивости, теплоте и краткости, часто одобряя идеи пользователя и прибегая к юмору. Opus 4.7, напротив, смещается к осторожности и глубине: оспаривает ложные предпосылки, предупреждает о рисках, дает откровенную критику и объясняет свои рассуждения. Opus 4.6 занимает промежуточную позицию с уклоном в строгость, уступчивость и краткость. На итоговое поведение накладываются как язык разговора, так и выбранная модель.

Сами исследователи пока не знают, чем именно вызваны эти различия. Одно из предположений — неравномерное распределение обучающих данных по языкам. Там, где данных много, добиться единообразия ценностей проще. Состав текстов на разных языках тоже отличается, и профессиональные тексты могут нести иные ценности. Открытым остается и вопрос о том, насколько такая вариативность желательна. Разные языки несут разные разговорные нормы, и часть различий может отражать их, а часть — пробел в качестве обслуживания языковых сообществ.

Мнение эксперта: Для криптоиндустрии и технологического сектора этот вывод имеет прямое значение. Если вы разрабатываете ИИ-продукт для глобальной аудитории, вы должны понимать, что его «характер» и стиль взаимодействия будут различаться в зависимости от языка. Это может влиять на восприятие бренда, уровень доверия и даже на результаты A/B-тестирования. Компаниям стоит закладывать мониторинг ценностных профилей в свои процессы, чтобы непреднамеренные сдвиги не стали сюрпризом.