本站提供正體中文版。切換到正體中文本站提供简体中文版。切换到简体中文This site is available in English.View in Englishこのサイトには日本語版があります。日本語で表示이 사이트는 한국어로도 제공됩니다.한국어로 보기Este sitio web también está disponible en español.Ver en españolQuesto sito è disponibile anche in italiano.Visualizza in italianoCe site est également disponible en français.Afficher en françaisEste site também está disponível em português.Ver em portuguêsDeze website is ook beschikbaar in het Nederlands.In het Nederlands bekijkenЭтот сайт также доступен на русском языке.Смотреть на русскомयह वेबसाइट हिन्दी में भी उपलब्ध है।हिन्दी में देखेंهذا الموقع متاح أيضًا باللغة العربية.عرض بالعربيةSitus ini juga tersedia dalam bahasa Indonesia.Lihat dalam bahasa IndonesiaBu site Türkçe olarak da mevcut.Türkçe görüntüleTa strona jest dostępna także po polsku.Wyświetl po polskuTrang web này cũng có phiên bản tiếng Việt.Xem bằng tiếng Việtاین وب‌سایت به فارسی هم در دسترس است.مشاهده به فارسی

Die zackige Intelligenz von LLMs: Warum KI im einen Moment ein Genie und im nächsten ein Dummkopf ist

KI2026.05

Ein und dasselbe LLM kann einerseits methodisch hunderttausend Zeilen Code umbauen und andererseits einen so grenzenlos absurden Rat geben wie „geh zu Fuß zur Waschanlage, um dein Auto zu waschen“. Genau dieses gewaltige Gefälle in den Fähigkeiten ist die sogenannte „Zackigkeit“ (jaggedness).

Ein zackiges Liniendiagramm, das die Verteilung der Fähigkeiten eines LLM veranschaulicht: links gleitet ein Roboter geschmeidig über eine Schiene des bestärkenden Lernens; rechts hackt ein Roboter mit einer Machete wild durch einen Dschungel

Der Knackpunkt ist nicht schwer oder leicht, sondern „ob es geübt wurde“

Interessant ist, dass der Knackpunkt nicht darin liegt, „ob Menschen die Sache schwer oder leicht finden“, sondern darin, ob die Aufgabe in die Verteilung der Trainingsdaten des Modells fällt.

Andrej Karpathy – ein Gründungsmitglied von OpenAI und ehemaliger KI-Direktor bei Tesla – nennt zwei Hauptursachen:

  1. Verifizierbarkeit (verifiability): Code hat ein klares Richtig-oder-falsch-Signal – lässt er sich kompilieren, bestehen die Tests? –, was ihn bestens dafür geeignet macht, dass bestärkendes Lernen (RL) ihn immer wieder trainiert und verstärkt.
  2. Wirtschaftliche Faktoren: Fähigkeiten mit kommerziellem Wert werden von den führenden Laboren vorrangig in die Verteilung der Trainingsdaten gepackt; der Alltagsverstand des täglichen Lebens hingegen wird oft übersehen.

Auf der Schiene läuft es geschmeidig, kaum weicht es ab, hackt es wild drauflos

Das Ergebnis ist dies: Solange das Modell auf der Schiene bleibt, die das bestärkende Lernen verlegt hat, fliegt es schnell und geschmeidig dahin; doch sobald es von der Schiene abweicht, ist es, als hackte jemand mit einer Machete wild durch einen Dschungel – oberflächlich sieht es aus, als führte es gewissenhaft etwas aus, doch was es tatsächlich tut, ist über alle Maßen absurd.

Um ein LLM also wirklich gut einzusetzen und Fallstricken zu entgehen, musst du dir ein „hinreichend genaues“ Verständnismodell seiner Fähigkeiten aufbauen: zu wissen, bei welchen Aufgaben es auf der Schiene bleibt und bei welchen Aufgaben es in Wahrheit schon in den Dschungel geraten ist.