
Вчера запостил в одной из социальных сетей свой давний текст, и он почему-то вызвал особенно резкую реакцию у местной аудитории. Особенно за мои глаза зацепился уже до боли знакомый ответ: «Вот факт-чек от нейронки, шах и мат!»…
Очень многим сегодня почему-то кажется, что чат-боты немыслимо точны в своих данных. Это не так. Достаточно взглянуть на наиболее цитируемые их источники (1): (на скриншоте. Сайты вроде реддита — это в лучшем случае пространство для творчества людей с очень специфическими политическими взглядами. Про википедию я даже делал отдельное видео, ну а всё остальное… Эх.
Одна из демонстраций была опубликована меньше недели назад (2): учёные решили проверить данные по спорным темам, связанным с медициной. Результат?
50% всех ответов оказались проблематичными, а 20% крайне проблематичными. Ни один из чатботов не мог произвести список источников по темам, не производя тонны галлюцинаций.
Да, с каждым месяцем модели обучаются на более качественных данных, но не нужно думать, что это ваш личный научный советник, который за пару секунд просканирует всю доступную научную литературу и скажет вам правильный ответ. До этого, скажем так, ещё долго. Даже специальные сервисы, созданные специально для обзора медицинских тем, сервисы, в которые загружены буквальные десятки миллионов исследований, требуют проверки и досмотра, чего уж говорить об обычных моделях.
Ещё более потешная тема — непредвзятость. Люди почему-то и правда в большей степени доверяют (3) ботам, а их ответы кажутся нам более нейтральными, чем человеческие. Нужно ли говорить, что создатели всех этих сервисов — люди со своими предвзятостями (не машины объективной правды)? Чтобы понять, насколько могут отличаться «непредвзятые» ответы, достаточно сравнить chatGPT и Grok по ряду спорных вопросов.
У меня есть имя для этого феномена. «ChatGPT, докажи, что это неправда».
Немного длинное название, но кажется, оно ярко иллюстрирует модель поведения, которую я надеюсь не увидеть хотя бы среди своих подписчиков 🙂
————————
Наше Сообщество личной эффективности: https://link.prosto.social/r/vktext
Источники:
1. https://www.semrush.com/blog/ai-mode-comparison-study/
2. https://bmjopen.bmj.com/content/16/4/e112695
3. https://arxiv.org/pdf/2604.02592
Телеграм: t.me/ainewsline
