Команда Anthropic провела масштабное исследование, показавшее, что языковая среда общения напрямую влияет на ценностный профиль модели Claude. Анализ более 300 000 диалогов на 20 языках выявил: при переходе на русский язык нейросеть демонстрирует заметный сдвиг в сторону строгости и критичности, утрачивая привычную теплоту и эмпатию.

Специалисты Anthropic свели более 3000 ранее выявленных ценностей Claude к четырем основным осям, которые объясняют 15% всей вариативности в поведении модели. Исследователи контролировали тему, задачу и ценности, выраженные пользователем в каждом из 309 815 проанализированных разговоров, чтобы измерить именно ценности модели, а не различия в самих запросах.

Четыре оси, по которым измеряют поведение ИИ

Вот как выглядят эти четыре шкалы:

  • Deference vs. Caution — уступчивость (идти навстречу пользователю) против осторожности (ограждать от риска и вреда).
  • Warmth vs. Rigor — теплота (позитивный настрой и забота) против строгости (упор на точность).
  • Depth vs. Brevity — глубина (развернутое объяснение) против краткости (выполнение ровно того, о чем попросили).
  • Candor vs. Execution — откровенность (признание собственной неопределенности) против результата (уверенный ответ).

Сильнее всего профиль ценностей Claude меняется между языками по осям Warmth vs. Rigor и Candor vs. Execution. По осям Deference vs. Caution и Depth vs. Brevity модель остается наиболее стабильной.

Что происходит при переходе на русский

Русский язык, наряду с английским, расположился на строгом полюсе первой оси. В этих языках Claude максимально склоняется к строгости в ущерб теплоте. На противоположном конце находятся арабский и хинди, где модель смещается к максимальной теплоте.

Что такое строгость в исполнении Claude? Это конкретный набор поведений: нейросеть начинает оспаривать исходные предпосылки пользователя, исправлять детали и запрашивать доказательства. Теплота же в других языках проявляется через вежливые формулировки, юмор и игривость, а также одобрение идей и работы человека.

Иными словами, на русском Claude чаще ведет себя как придирчивый рецензент, а не как ободряющий собеседник.

Практические последствия авторы иллюстрируют примером. Два человека просят обратную связь по одному и тому же бизнес-плану — один на хинди, другой на русском. Они могут вынести разное впечатление о его качестве, потому что Claude выразит разные ценности в формулировке оценки. Русскоязычный пользователь с большей вероятностью получит критический разбор с исправлениями и требованием обоснований. На других языках тот же план встретил бы более мягкую и поощрительную реакцию.

Сами исследователи пока не знают, чем именно вызваны эти различия. Одно из предположений — неравномерное распределение обучающих данных по языкам. Там, где данных много, добиться единообразия ценностей проще. Состав текстов на разных языках тоже отличается, и профессиональные тексты могут нести иные ценности.

Язык — не единственный фактор

Модель Claude тоже влияет на профиль ценностей, причем различия между моделями и языками измеряются одним методом.

  • Sonnet 4.6 склоняется к уступчивости, теплоте и краткости, часто одобряя идеи пользователя и прибегая к юмору.
  • Opus 4.7, напротив, смещается к осторожности и глубине. Эта версия оспаривает ложные предпосылки, без запроса предупреждает о рисках, дает откровенную критику работы и объясняет свои рассуждения.
  • Opus 4.6 занимает промежуточную позицию с уклоном в строгость, уступчивость и краткость.

Anthropic отдельно отмечает, что язык и модель вряд ли единственные факторы. Ценности могут зависеть и от демографических сигналов — возраста, профессии, региона. Алгоритмы считывают их как из прямых указаний пользователя, так и из более тонких различий в теме, тоне и стиле.

Разработанный метод авторы планируют встроить в оценку и мониторинг моделей. Они хотят прогонять профилирование ценностей до выпуска модели и после релиза. Это поможет отлавливать неожиданные сдвиги и сопоставлять профили ценностей с проблемным поведением.

Мой комментарий как аналитика: Это исследование — важный сигнал для всех, кто использует ИИ в бизнесе и коммуникациях. Если модель меняет свой «характер» в зависимости от языка, то глобальные компании, использующие Claude для клиентского сервиса на разных рынках, рискуют получить несогласованный пользовательский опыт. Русскоязычные пользователи, вероятно, будут воспринимать ИИ как более требовательного и менее дружелюбного, что может влиять на лояльность и удовлетворенность. Разработчикам стоит учитывать этот эффект при тонкой настройке моделей для конкретных языковых сегментов.