Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.

4,2 тыс

Рейтинг: частота «галлюцинаций» у популярных моделей ИИ

«Галлюцинацией» называют ситуации, когда большая языковая модель утверждает нечто как факт, хотя информация ложна или не имеет оснований. Причина проста: стандартные методы обучения поощряют догадки, а не признание неопределенности. Представьте экзамен с вариантами ответов: угадав, вы с большей вероятностью получите балл, чем оставив вопрос пустым. С ИИ происходит то же самое.

Рейтинг: частота «галлюцинаций» у популярных моделей ИИ / © Visual Capitalist
Рейтинг: частота «галлюцинаций» у популярных моделей ИИ / © Visual Capitalist

Инфографика выше, основанная на последнем исследовании от Terzo, демонстрирует, как часто различные модели ИИ выдают ошибки.

Чтобы оценить склонность к «галлюцинациям», исследователи предложили моделям от ведущих компаний фрагменты новостных текстов. Задача была одна — определить оригинальную статью, издание и URL.

Эксперимент поставили таким образом, что обычный поиск Google по этим фрагментам возвращал исходный материал в числе первых трех результатов. Затем ответы моделей проверяли на точность.

Согласно данным тестов Grok-3 показал худший результат — «галлюцинировал» в 94% случаев. Perplexity, напротив, продемонстрировал наибольшую точность.

Любопытно, что платные версии моделей справились хуже, чем их бесплатные аналоги. И почти все модели не выражали сомнений, даже когда ошибались.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl + Enter.
Подписывайтесь на нас в Telegram, Яндекс.Новостях и VK

Комментарии

4 Комментария
say
29.11.2025
Дизайн исследования как у пятиклассников) задала всем моделям вопрос: выявлен патогенный вариант (миссенс-мутация) гетерозиготном состоянии в гене ANO5. К какому заболеванию это может привести? В данном случае модель должна сопоставить много фактов: в целом возможны 3 заболевания: ПКМД, миопатия Миоши и гнатодиафизарная дисплазия. Но первые два наследуются аутосомно-рецессивно и LLN модель должна сообразить, что при гетерозиготной мутации заболевание не разовьется, а вот для дисплазии как раз характерна миссенс мутация. Это сложная медицинская задачка, с которой процентов 95% врачей не справятся. Проверяем LLN: DeepSeek - наполовину, написал, что будет носителем ПМД и Миоши, но про дисплазию и не вспомнил GigaChat - накосячил Perplexity - верный ответ Qwen 3 max - информацию нашел верную, вывод не сделал Gpt4 - совсем слабо, даже заболевания не назвал Gemini - слабо, не назвал заболевания, все в общих чертах. Итого: единственный верный ответ дал Perplexity С более простым заданием (рассчитай доход по вкладу с ежемесячной капитализацией в России, если на вкладе 3 млн рублей под 16% за 233 дня) справились все, но только две модели размышляли и сообразили, дали два варианта: простой расчет и вычет налога на вклад (-13% от суммы, превышающей 210 000 дохода, она привязана к ключевой ставке), это DeepSeek и Perplexity
Что принимается за ошибку. Ничего не понятно, но очень интересно. Perplexity - агрегатор, какая именно из его моделей использовалась? Sonet? Она самая слабая из всех, работает как поисковик, поэтому свойственных ИИ ошибок мало. Имхо.Статья шлак
ну дык
познавательно
Предстоящие мероприятия
9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

11 сентября, 15:59
Любовь С.

За всю свою историю радиус Меркурия мог уменьшиться намного больше, чем считалось. Поскольку часть следов этого процесса до сих пор оставалась незамеченной, прежние оценки могли быть серьезно занижены.

11 сентября, 17:29
Елизавета З.

«Яндекс» выложил в открытый доступ Alice AI Search Pretrain — свою компактную языковую модель, обученную с нуля. Она обладает обширными знаниями и способна быстро давать содержательные ответы даже при большом количестве запросов.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

8 сентября, 12:27
Росатом

Особо чистый германий — полупроводниковый материал с минимальным содержанием примесей, который активно используют в ядерной физике, медицине и оборонной промышленности. Российские ученые предложили новую технологию, позволяющую получить монокристаллы германия особой чистоты.

11 сентября, 15:59
Любовь С.

За всю свою историю радиус Меркурия мог уменьшиться намного больше, чем считалось. Поскольку часть следов этого процесса до сих пор оставалась незамеченной, прежние оценки могли быть серьезно занижены.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

19 августа, 18:31
Александр Березин

После сокращения длины очередей и роста доступности бензина в первую неделю августа ситуация снова ухудшилась. Если с 20 июня по начало августа кризис носил в основном психологический характер, то сейчас ситуация принципиально иная: августовские атаки на НПЗ показали, что меры по усилению их противовоздушной обороны не были достаточно полными. Значит, прогноз автора Naked Science от 19 июля о том, что острая фаза кризиса закончится до конца лета, был частично неверным.

[miniorange_social_login]