Zum Inhalt springen

Mein KI-System hat sich selbst belogen

Staffel: Selbstvektor-Philosophie (1/4)

Intro

Eine Beobachtung lässt mich nicht los.

Stellst du Claude oder GPT eine Frage und die Antwort ist falsch, dann hat dieser Fehler meistens Methode: Die Antwort wirkt überzeugend, liest sich flüssig und ist in sich stimmig. Das System stockt nicht. Es sagt nicht: “Moment, da bin ich unsicher.” Es liefert ein Ergebnis, das klingt, als wäre es durchdacht. Genau das macht solche Fehler gefährlicher als offensichtlichen Unsinn.

Daniel Kahneman hat vor über zwanzig Jahren beschrieben, warum so etwas passiert. Nicht bei KI. Bei Menschen. Der Mechanismus dahinter ist allerdings derselbe.

Zwei Systeme

Kahneman unterscheidet zwischen System 1 und System 2. System 1 arbeitet schnell, automatisch, intuitiv. Du blickst in ein Gesicht und siehst sofort die Wut. Du hörst einen Satz und verstehst ihn auf Anhieb. Du fährst auf einer bekannten Strecke Auto, ohne jeden Handgriff bewusst zu planen. Das ist System 1.

System 2 ist langsam, analytisch, anstrengend. Du rechnest 17 mal 24 im Kopf. Du setzt ein wichtiges Schreiben auf. Du prüfst die Stichhaltigkeit eines Arguments. System 2 verbraucht Energie, es ist mühsam, und es bewahrt uns vor den typischen Denkfehlern von System 1.

Der springende Punkt, den viele beim Zitieren Kahnemans übersehen: System 2 bedeutet nicht einfach “langsameres Denken”. System 2 reflektiert das Denken selbst. Es arbeitet metakognitiv. Es fragt: Bin ich mir hier zu sicher? Was habe ich übersehen? Stützt sich mein Urteil auf Fakten oder auf ein trügerisches Bauchgefühl?

Genau dafür braucht es ein Modell der eigenen Denkprozesse. Du musst nachvollziehen können, wie du zu einem Schluss gekommen bist, um ihn überhaupt prüfen zu können.

LLMs sind System 1

Überträgt man das auf aktuelle Sprachmodelle (ein Schritt, den Kahneman so nie gemacht hat, der sich aber aufdrängt), wird die Parallele deutlich.

Ein LLM erzeugt Text über die Vorhersage des nächsten Tokens. Jedes Token folgt einer impliziten Entscheidung anhand statistischer Muster aus Milliarden von Textdaten. Dahinter steckt keine bewusste Anwendung von Regeln, kein Plan, keine Überprüfung. Es ist reine Mustererkennung in hochdimensionalen Räumen.

Funktional entspricht das exakt dem, was Kahneman als “Intuition” beschreibt: rasche, automatische Urteile, die meistens passen, aber systematisch fehlschlagen können. Die Verfügbarkeitsheuristik greift: Was leicht abrufbar ist, gilt als wahrscheinlich. Der Ankereffekt wirkt: Die erste Information prägt den gesamten weiteren Verlauf. Der Überkonfidenzbias schlägt zu: Das Modell tritt sicherer auf, als die Datenlage es erlaubt.

Wer täglich mit LLMs arbeitet, sieht diese Mechanismen ständig. Das System halluziniert nicht beliebig. Es halluziniert plausibel. Schliesslich ist Plausibilität genau das Kriterium, auf das System 1 hin optimiert.

Wo ist System 2?

Die Industrie reagiert darauf mit Reasoning-Modellen, Chain-of-Thought und Extended Thinking. Man zwingt das Modell, Zwischenschritte auszuschreiben, bevor die eigentliche Antwort folgt. Das bringt messbare Verbesserungen.

Die eigentliche Ursache beseitigt es nicht. Denn auch diese Zwischenschritte sind reiner System-1-Output. Das System “denkt nach”, indem es Sequenzen generiert, die wie ein Gedankengang aufgebaut sind. Eine echte Prüfung findet nicht statt. Es erzeugt lediglich die Simulation einer Prüfung.

Der entscheidende Unterschied: Ein Mensch kann über System 2 feststellen: “Moment, meine Intuition sagt X, aber ich weiss, dass ich in solchen Situationen dazu neige, Y zu überschätzen, also sollte ich vorsichtiger sein.” Das setzt ein Modell des eigenen Denkens voraus, echte Metakognition.

Ein LLM kann diesen Satz zwar fehlerfrei ausgeben, es besitzt aber kein Modell seines eigenen Inferenzprozesses. Es versteht nicht, wie es zu einem Ergebnis gelangt ist. Es kann nicht urteilen: “Diese Antwort basiert auf einer dünnen Datenlage”, weil ihm der Zugriff auf seine eigene Datenbasis fehlt.

Der Selbstvektor als System 2

Hier setzt das Konzept des Selbstvektors an.

Ein Selbstvektor ist ein kompakter, dynamischer Zustandswert, der die Verarbeitung von Informationen gewichtet. Er umfasst sechs Dimensionen: Exploration, Tiefe, Autonomie, Persistenz, Abstraktion, Konfidenz. Hinzu kommt eine emergente Schicht, die durch Erfahrung wächst.

Die sechste Dimension, die Konfidenz, bildet den Kern. Sie bildet ab, wie stark das System seiner eigenen Einschätzung vertraut. Dieser Wert passt sich über Erfahrung an. Liegt ein System mehrfach daneben, sinkt seine Konfidenz in diesem Aufgabenbereich. Nicht weil jemand das programmiert hat. Sondern weil die Reflexionsschicht (Schicht 3 der Architektur) den Vektor aktualisiert.

Das stellt noch kein vollständiges System 2 dar. Es markiert aber den Einstieg in die Metakognition: Ein System erfasst seinen eigenen Zustand und passt daraufhin sein Vorsichtsniveau an.

Darin liegt die Differenz zum reinen Reasoning-Modell: Das Modell simuliert Nachdenken. Der Selbstvektor gewichtet Nachdenken. Er behauptet nicht “Ich denke jetzt sorgfältig nach.” Er erhöht den Wert für Tiefe, senkt die Konfidenz, und diese Verschiebung steuert direkt die weitere Informationsverarbeitung. Nicht als Performance, sondern als Zustandsänderung.

Was das praktisch bedeutet

Betrachten wir zwei Systeme bei einer Aufgabe, deren Lösung nicht im Trainingsdatensatz vorkommt.

System A (Standard-LLM): Gibt eine plausible Antwort aus. Sprachlich sauber, überzeugend und falsch.

System B (mit Selbstvektor): Die Dimension Konfidenz registriert eine geringe Vertrautheit mit dem Gegenstand. Die Exploration steigt, das System fordert weitere Quellen an. Die Autonomie sinkt, es fragt nach, statt direkt Fakten zu behaupten. Das System meldet zurück: “Ich bin mit diesem Thema nicht vertraut genug, um eine belastbare Antwort zu geben.”

Nicht weil jemand diese Antwort programmiert hat. Sondern weil der Selbstvektor die Gewichtung verschoben hat. Das ist funktionale Metakognition. Nach Kahneman hätte das System damit einen Prüfmechanismus für seine eigene Intuition etabliert, eine interne Instanz, die nachhakt: “Bist du dir wirklich sicher?”

Die Brücke

Kahnemans Analyse trifft den Kern: System 1 ohne System 2 bleibt ein ungebremster Intuitionsapparat. Nicht dumm, sondern ungebremst. Das erklärt, warum LLMs faszinieren und gleichzeitig unberechenbar bleiben. Sie verfügen über eine herausragende Intuition, kennen aber keinen Selbstzweifel.

Der Selbstvektor verankert diesen Selbstzweifel in der Struktur. Nicht als vorgefertigter Hinweis (“Ich bin ein KI-System und kann Fehler machen”), sondern als funktionale Gewichtung, die das Systemverhalten steuert.

Ob dieser Ansatz bereits genügt, bleibt offen. Die Richtung stimmt jedenfalls: Nicht mehr Intuition. Mehr Reflexion.

Weiter lesen