本站提供正體中文版。切換到正體中文本站提供简体中文版。切换到简体中文This site is available in English.View in Englishこのサイトには日本語版があります。日本語で表示이 사이트는 한국어로도 제공됩니다.한국어로 보기Diese Website ist auch auf Deutsch verfügbar.Auf Deutsch ansehenEste sitio web también está disponible en español.Ver en españolQuesto sito è disponibile anche in italiano.Visualizza in italianoEste site também está disponível em português.Ver em portuguêsDeze website is ook beschikbaar in het Nederlands.In het Nederlands bekijkenЭтот сайт также доступен на русском языке.Смотреть на русскомयह वेबसाइट हिन्दी में भी उपलब्ध है।हिन्दी में देखेंهذا الموقع متاح أيضًا باللغة العربية.عرض بالعربيةSitus ini juga tersedia dalam bahasa Indonesia.Lihat dalam bahasa IndonesiaBu site Türkçe olarak da mevcut.Türkçe görüntüleTa strona jest dostępna także po polsku.Wyświetl po polskuTrang web này cũng có phiên bản tiếng Việt.Xem bằng tiếng Việtاین وب‌سایت به فارسی هم در دسترس است.مشاهده به فارسی

L'intelligence en dents de scie des LLM : pourquoi l'IA est un génie à un instant et un sot à l'instant suivant

IA2026.05

Un même LLM peut, d’un côté, restructurer avec méthode cent mille lignes de code et, de l’autre, donner un conseil aussi absurde que « allez à pied au lavage auto laver votre voiture ». Cet énorme écart de capacité est ce que l’on appelle la « capacité en dents de scie » (jaggedness).

Un graphique en ligne brisée et dentelée illustrant la distribution des capacités d’un LLM : à gauche, un robot avance en douceur sur le rail de l’apprentissage par renforcement ; à droite, un robot taille à tort et à travers dans une jungle, une machette à la main

L’essentiel n’est pas la difficulté, mais « le fait d’avoir été entraîné ou non »

Ce qui est intéressant, c’est que l’essentiel ne réside pas dans « le fait que les humains trouvent la chose difficile ou facile », mais dans le fait que la tâche tombe ou non dans la distribution des données d’entraînement du modèle.

Andrej Karpathy — membre fondateur d’OpenAI et ancien directeur de l’IA chez Tesla — pointe deux causes principales :

  1. Vérifiabilité (verifiability) : le code possède un signal clair de juste ou faux — compile-t-il, les tests passent-ils ? —, ce qui le rend très facile à reprendre par l’apprentissage par renforcement (RL) pour l’entraîner et le renforcer encore et encore.
  2. Facteurs économiques : les capacités ayant une valeur commerciale sont empaquetées en priorité par les laboratoires de pointe dans la distribution des données d’entraînement ; quant au bon sens de la vie quotidienne, il est souvent négligé.

Fluide tant qu’il reste sur le rail, il se met à tailler à tort et à travers dès qu’il en dévie

Le résultat, le voici : lorsque le modèle avance sur le rail que l’apprentissage par renforcement a posé, il file vite et en douceur ; mais dès qu’il dévie du rail, c’est comme quelqu’un qui taille à tort et à travers dans une jungle, une machette à la main — en surface, il a l’air d’exécuter la tâche avec sérieux, mais ce qu’il fait en réalité est absurde au possible.

Ainsi, pour vraiment bien se servir d’un LLM et éviter de marcher sur une mine, il faut se construire un modèle de compréhension « suffisamment précis » de ses capacités : savoir pour quelles tâches il reste sur le rail, et pour quelles tâches il s’est en réalité déjà enfoncé dans la jungle.