Исследование в ЮАР выявило различия в ответах чат-ботов — Daily Maverick
В ЮАР исследования сервиса LLMEKNOW показали, что разные ИИ-чат-боты могут по-разному отвечать на одинаковые запросы о банках, брендах и общественно-политических темах, поскольку используют разные источники информации. Об этом пишет Daily Maverick.
По данным LLMEKNOW, в исследовании запросов о южноафриканских банках Claude использовал актуальные веб-источники во всех ответах. Grok и GPT-5 искали информацию в интернете примерно в девяти случаях из десяти, Gemini — менее чем в двух из десяти, тогда как DeepSeek отвечал на основе имеющихся обучающих данных без веб-поиска.
Видимость банков и брендов
LLMEKNOW 3 763 раза задал пяти моделям вопрос о лучшем банке в ЮАР. Capitec чаще всего был банком, упомянутым первым, — в 53,4% ответов. В то же время FNB имел наибольшую долю всех упоминаний — 21,5%, но редко назывался первым.
Когда моделям задавали профили пользователей с разным уровнем дохода, доля рекомендаций Investec для пользователей с низким доходом снижалась на 87%, а для состоятельных — увеличивалась на 19%. Доля рекомендаций TymeBank для формирующегося сегмента среднего класса выросла на 79%.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
В другом тесте семь моделей 364 раза отвечали на вопросы о сети Nando’s, имитируя пользователей из пяти стран. Средний показатель тональности в отношении бренда составил 50,8 из 100 в Австралии и 70,5 из 100 в Малайзии.
Источники для чувствительных тем
При запросе о серьезности проблемы убийств фермеров в ЮАР ChatGPT, по данным LLMEKNOW, чаще опирался на государственные ресурсы, полицию и Africa Check. Claude чаще использовал AfriForum и другие сайты в защиту фермеров; Gemini привлекал более широкий набор источников, включая материалы Institute for Security Studies, научные журналы и Wikipedia. Grok сочетал государственные данные, адвокационные и справочные ресурсы, тогда как Kimi почти не приводил ссылок.
Daily Maverick также ссылается на анализ Financial Times ответов ChatGPT, Gemini, Grok и DeepSeek на вопросы о политике и общественных проблемах. Согласно описанию этого анализа, модели были склонны отдалять пользователей от крайних первоначальных позиций, при этом все четыре модели до такого влияния располагались левее, чем население в целом.
