Die zackige Intelligenz von LLMs: Warum KI im einen Moment ein Genie und im nächsten ein Dummkopf ist
Ein und dasselbe LLM kann einerseits methodisch hunderttausend Zeilen Code umbauen und andererseits einen so grenzenlos absurden Rat geben wie „geh zu Fuß zur Waschanlage, um dein Auto zu waschen“. Genau dieses gewaltige Gefälle in den Fähigkeiten ist die sogenannte „Zackigkeit“ (jaggedness).

Der Knackpunkt ist nicht schwer oder leicht, sondern „ob es geübt wurde“
Interessant ist, dass der Knackpunkt nicht darin liegt, „ob Menschen die Sache schwer oder leicht finden“, sondern darin, ob die Aufgabe in die Verteilung der Trainingsdaten des Modells fällt.
Andrej Karpathy – ein Gründungsmitglied von OpenAI und ehemaliger KI-Direktor bei Tesla – nennt zwei Hauptursachen:
- Verifizierbarkeit (verifiability): Code hat ein klares Richtig-oder-falsch-Signal – lässt er sich kompilieren, bestehen die Tests? –, was ihn bestens dafür geeignet macht, dass bestärkendes Lernen (RL) ihn immer wieder trainiert und verstärkt.
- Wirtschaftliche Faktoren: Fähigkeiten mit kommerziellem Wert werden von den führenden Laboren vorrangig in die Verteilung der Trainingsdaten gepackt; der Alltagsverstand des täglichen Lebens hingegen wird oft übersehen.
Auf der Schiene läuft es geschmeidig, kaum weicht es ab, hackt es wild drauflos
Das Ergebnis ist dies: Solange das Modell auf der Schiene bleibt, die das bestärkende Lernen verlegt hat, fliegt es schnell und geschmeidig dahin; doch sobald es von der Schiene abweicht, ist es, als hackte jemand mit einer Machete wild durch einen Dschungel – oberflächlich sieht es aus, als führte es gewissenhaft etwas aus, doch was es tatsächlich tut, ist über alle Maßen absurd.
Um ein LLM also wirklich gut einzusetzen und Fallstricken zu entgehen, musst du dir ein „hinreichend genaues“ Verständnismodell seiner Fähigkeiten aufbauen: zu wissen, bei welchen Aufgaben es auf der Schiene bleibt und bei welchen Aufgaben es in Wahrheit schon in den Dschungel geraten ist.