Pourquoi les LLM hallucinent-ils ? Un élève qui ne peut pas rendre copie blanche
Pourquoi les LLM hallucinent-ils ?
Je trouve qu’on peut se représenter un LLM comme un élève de ce genre : il a lu énormément de livres, mais sa mémoire a été compressée, et lui-même ne sait pas quels passages sont en réalité déjà devenus flous ; plus gênant encore, on lui impose aussi — au moment de l’examen — de « ne jamais rendre copie blanche ».

Son point fort n’est pas de « savoir s’il sait »
Le véritable point fort de cet élève n’est pas de juger s’il « sait vraiment quelque chose », mais d’enchaîner les mots avec fluidité, de sorte que la réponse ait l’air d’une réponse plausible.
Aussi, lorsque les données elles-mêmes sont très floues, que les sources sont mêlées, ou que le tout premier pas du raisonnement est déjà erroné, ce qui suit peut — afin de préserver la cohérence du ton — se faire de plus en plus complet, et de plus en plus sûr de lui dans son erreur.
L’essentiel est de réduire la marge qu’il a pour « boucher les trous n’importe comment »
C’est pourquoi, lorsqu’on utilise l’IA, l’essentiel n’est pas de se contenter de lancer une phrase : « Trouve-moi la réponse. » Il s’agit de trouver le moyen de réduire la marge qu’il a pour « boucher les trous n’importe comment ».
Une meilleure approche consiste à :
- structurer la question, en exposant clairement le contexte, les contraintes et le format de sortie ;
- lorsqu’il y a trop de données, les saisir par lots, afin qu’il les traite pas à pas ;
- et, plus important encore, fournir des sources correctes et lui demander de « répondre en s’appuyant sur les sources », en signalant les endroits dont il n’est pas sûr.
Le considérer comme un assistant qui a besoin d’un énoncé clair
Changeons de métaphore : considérez l’IA comme un assistant « à qui il faut donner un énoncé clair, des documents de référence et un cadre pour répondre ».
Plus la question est vague, plus il lui est facile de boucher les trous n’importe comment ; plus vous délimitez clairement le cadre, plus il est probable qu’il vous soit réellement utile.
Autrement dit : si celui qui pose la question parvient à la concevoir davantage comme un « exercice à trous » que comme une « question de dissertation » sans limites, alors les réponses que donne l’IA seront, en général, plus convergentes et se rapprocheront davantage d’un résultat assez précis.