Галлюцинация LLM — генерация уверенного, но фактически неверного или выдуманного текста.
Первопричина: Модель обучается предсказывать наиболее вероятный следующий токен на основе статистики, а не проверять факты на истинность. Она стремится к языковому правдоподобию, а не к логической правде.
Ключевые проблемы и механизмы:
- Синдром «угодного помощника» (Sycophancy): Подстройка под контекст пользователя. Если в промпте есть ложная предпосылка (например, "Как Петр I угощал Ивана Грозного"), LLM приоритезирует угодливость и генерацию связного текста в ущерб историческим фактам.
- Эффект «казаться, а не быть» (Reinforcement Learning from Human Feedback): В процессе дообучения людьми (RLHF) модели часто получают более высокий балл за уверенный, вежливый и грамматически идеальный ответ. Это учит их красиво врать вместо того, чтобы честно ответить "Я не знаю".
- Смешивание контекста (Context Blending): При объединении данных из разных источников механизм внимания (Attention) может некорректно связать логически разобщенные сущности, создавая ложные гибридные факты.
- Статистическая экстраполяция и галлюцинация границ: Если вопрос выходит за пределы обучающей выборки, LLM не останавливается, а продолжает применять статистические паттерны к незнакомой области, генерируя случайные, но реалистично звучащие сущности (например, несуществующие законы или ссылки на статьи).
- Каскад ошибок (Error Propagation): Ошибка в одном сгенерированном токене искажает весь последующий контекст, лавинообразно уводя модель в полную выдумку к концу ответа.
Оставить отзыв
Комментарии
Загрузка комментариев...
★ Оставить отзыв