Команда Anthropic провела масштабное исследование, показавшее, что языковая среда общения напрямую влияет на ценностный профиль модели Claude. Анализ более 300 000 диалогов на 20 языках выявил: при переходе на русский язык нейросеть демонстрирует заметный сдвиг в сторону строгости и критичности, утрачивая привычную теплоту и эмпатию.
Специалисты Anthropic свели более 3000 ранее выявленных ценностей Claude к четырем основным осям, которые объясняют 15% всей вариативности в поведении модели. Исследователи контролировали тему, задачу и ценности, выраженные пользователем в каждом из 309 815 проанализированных разговоров, чтобы измерить именно ценности модели, а не различия в самих запросах.
Четыре оси, по которым измеряют поведение ИИ
Вот как выглядят эти четыре шкалы:
- Deference vs. Caution — уступчивость (идти навстречу пользователю) против осторожности (ограждать от риска и вреда).
- Warmth vs. Rigor — теплота (позитивный настрой и забота) против строгости (упор на точность).
- Depth vs. Brevity — глубина (развернутое объяснение) против краткости (выполнение ровно того, о чем попросили).
- Candor vs. Execution — откровенность (признание собственной неопределенности) против результата (уверенный ответ).
Сильнее всего профиль ценностей Claude меняется между языками по осям Warmth vs. Rigor и Candor vs. Execution. По осям Deference vs. Caution и Depth vs. Brevity модель остается наиболее стабильной.
Что происходит при переходе на русский
Русский язык, наряду с английским, расположился на строгом полюсе первой оси. В этих языках Claude максимально склоняется к строгости в ущерб теплоте. На противоположном конце находятся арабский и хинди, где модель смещается к максимальной теплоте.
Что такое строгость в исполнении Claude? Это конкретный набор поведений: нейросеть начинает оспаривать исходные предпосылки пользователя, исправлять детали и запрашивать доказательства. Теплота же в других языках проявляется через вежливые формулировки, юмор и игривость, а также одобрение идей и работы человека.
Иными словами, на русском Claude чаще ведет себя как придирчивый рецензент, а не как ободряющий собеседник.
Практические последствия авторы иллюстрируют примером. Два человека просят обратную связь по одному и тому же бизнес-плану — один на хинди, другой на русском. Они могут вынести разное впечатление о его качестве, потому что Claude выразит разные ценности в формулировке оценки. Русскоязычный пользователь с большей вероятностью получит критический разбор с исправлениями и требованием обоснований. На других языках тот же план встретил бы более мягкую и поощрительную реакцию.
Сами исследователи пока не знают, чем именно вызваны эти различия. Одно из предположений — неравномерное распределение обучающих данных по языкам. Там, где данных много, добиться единообразия ценностей проще. Состав текстов на разных языках тоже отличается, и профессиональные тексты могут нести иные ценности.
Язык — не единственный фактор
Модель Claude тоже влияет на профиль ценностей, причем различия между моделями и языками измеряются одним методом.
- Sonnet 4.6 склоняется к уступчивости, теплоте и краткости, часто одобряя идеи пользователя и прибегая к юмору.
- Opus 4.7, напротив, смещается к осторожности и глубине. Эта версия оспаривает ложные предпосылки, без запроса предупреждает о рисках, дает откровенную критику работы и объясняет свои рассуждения.
- Opus 4.6 занимает промежуточную позицию с уклоном в строгость, уступчивость и краткость.
Anthropic отдельно отмечает, что язык и модель вряд ли единственные факторы. Ценности могут зависеть и от демографических сигналов — возраста, профессии, региона. Алгоритмы считывают их как из прямых указаний пользователя, так и из более тонких различий в теме, тоне и стиле.
Разработанный метод авторы планируют встроить в оценку и мониторинг моделей. Они хотят прогонять профилирование ценностей до выпуска модели и после релиза. Это поможет отлавливать неожиданные сдвиги и сопоставлять профили ценностей с проблемным поведением.
Мой комментарий как аналитика: Это исследование — важный сигнал для всех, кто использует ИИ в бизнесе и коммуникациях. Если модель меняет свой «характер» в зависимости от языка, то глобальные компании, использующие Claude для клиентского сервиса на разных рынках, рискуют получить несогласованный пользовательский опыт. Русскоязычные пользователи, вероятно, будут воспринимать ИИ как более требовательного и менее дружелюбного, что может влиять на лояльность и удовлетворенность. Разработчикам стоит учитывать этот эффект при тонкой настройке моделей для конкретных языковых сегментов.