Technik

Reasoning-Modelle: Was KI-Systeme tun, bevor sie antworten

11. Oktober 2026 · 15 Min. Lesezeit
Reasoning-Modelle: Was KI-Systeme tun, bevor sie antworten
Aufmacher · IllustrationCognitor Media (Nano Banana)

Seit gut zwei Jahren gibt es eine zweite Sorte Sprachmodell: Systeme, die vor der Antwort erst einmal ausführlich mit sich selbst reden. Was dabei technisch passiert, warum das bei Mathematik und Code hilft und beim Zusammenfassen nicht — und warum man der angezeigten Gedankenkette nicht blind vertrauen sollte.

Der Unterschied: antworten oder erst nachdenken

Ein klassisches Sprachmodell tut im Kern eine einzige Sache: Es sagt das nächste Wort voraus, dann das übernächste, und so weiter. Die Antwort entsteht dabei von links nach rechts, in einem Durchgang. Es gibt keinen Entwurf, keine Überprüfung, keine Korrektur — was geschrieben ist, steht. Wenn ein solches Modell im dritten Satz einen Rechenfehler macht, baut es den Rest der Antwort auf diesem Fehler auf.

Für die meisten Aufgaben ist das erstaunlicherweise völlig ausreichend. Eine E-Mail formulieren, einen Text zusammenfassen, eine Frage zu einem Dokument beantworten — das gelingt in einem Durchgang. Bei Aufgaben mit mehreren voneinander abhängigen Schritten bricht das Verfahren aber ein: eine mehrstufige Rechnung, ein Logikrätsel, ein Programmierproblem mit Randfällen, eine Planung mit Nebenbedingungen.

Ein Reasoning-Modell — auf Deutsch am ehesten „schlussfolgerndes Modell", im Sprachgebrauch meist einfach Reasoning- oder Denkmodell — ändert daran genau eine Sache, und die ist technisch bescheidener, als der Begriff vermuten lässt. Es schreibt vor der eigentlichen Antwort einen Zwischentext: Es sortiert die Aufgabe, probiert einen Ansatz, verwirft ihn, rechnet nach, prüft das Ergebnis gegen die Aufgabenstellung. Erst danach formuliert es die Antwort, die man zu sehen bekommt.

Dieser Zwischentext heißt je nach Anbieter Denkschritte, thinking, extended thinking oder reasoning tokens. Technisch sind es ganz normale Tokens, erzeugt von demselben Mechanismus wie jeder andere Text. Der Unterschied liegt nicht in der Architektur, sondern darin, wofür das Modell diese Tokens verwendet — und darin, dass es gelernt hat, sie sinnvoll zu nutzen.

Der entscheidende Punkt ist leicht zu übersehen: Das Modell bekommt dadurch etwas, das ein Einzeldurchgang nicht bietet — die Möglichkeit, einen Fehler zu bemerken, bevor die Antwort steht. Wer einen falschen Ansatz im Zwischentext verwirft, muss ihn nicht in der Antwort verteidigen.

Von der Gedankenkette zum trainierten Verhalten

Die Idee ist älter als die Modellklasse. Schon 2022 zeigte sich, dass ein simpler Zusatz im Prompt — „Denke Schritt für Schritt" — die Trefferquote bei Rechenaufgaben spürbar hebt. Dieses Chain-of-Thought-Prompting war ein Trick der Anwenderinnen: Man überredete ein normales Modell dazu, Zwischenschritte auszuschreiben, statt sofort zu antworten.

Der Trick funktionierte, hatte aber Grenzen. Das Modell war nicht darauf trainiert, seine eigenen Zwischenschritte zu prüfen. Es schrieb eine plausibel aussehende Herleitung und landete am Ende oft genauso falsch wie vorher — nur ausführlicher.

Den Schritt von der Prompt-Technik zur Modelleigenschaft machte OpenAI im September 2024 mit der o-Serie. Erstmals war ein Modell gezielt darauf trainiert worden, vor der Antwort lange nachzudenken, Ansätze zu verwerfen und zurückzuspringen. Die Gedankenkette wurde dabei verborgen; sichtbar war nur eine Zusammenfassung.

Der zweite, mindestens ebenso wichtige Schritt kam im Januar 2025 aus China: DeepSeek-R1 erschien mit offenen Gewichten und einer offengelegten Trainingsmethode. Die Arbeit wurde später begutachtet und erschien im September 2025 in Nature (Band 645, S. 633–638) — als Titelgeschichte. Damit war das Verfahren nicht länger Betriebsgeheimnis zweier US-Labore, sondern nachvollziehbare Wissenschaft. Seither hat praktisch jeder größere Anbieter nachgezogen.

Wie Reasoning-Modelle trainiert werden

Hier liegt der eigentliche technische Kern — und er ist verblüffend einfach.

Ein normales Sprachmodell lernt, indem es riesige Textmengen imitiert, und wird anschließend mit menschlichem Feedback nachjustiert. Menschen bewerten Antworten, das Modell lernt, bevorzugte Antworten zu erzeugen. Das Verfahren hat einen offensichtlichen Engpass: Es braucht Menschen, die bewerten.

Reasoning-Modelle werden anders trainiert, und zwar mit einem Belohnungssignal, das keinen Menschen braucht. Man nimmt Aufgaben, bei denen sich objektiv prüfen lässt, ob das Ergebnis stimmt: Mathematikaufgaben mit bekannter Lösung, Programmieraufgaben, die man einfach ausführt und gegen Tests laufen lässt, formale Logik. Das Modell probiert, und die Belohnung ist denkbar schlicht — richtig oder falsch. Für die DeepSeek-Arbeit wird das genau so beschrieben: hohe Punktzahl bei korrekt gelöster Mathematikaufgabe, Abzug bei falscher Lösung.

Das Bemerkenswerte ist, was daraus von selbst entsteht. Niemand bringt dem Modell bei, wie es denken soll. Man belohnt nur das Ergebnis. Und das Modell entwickelt im Lauf des Trainings aus eigenem Antrieb Verhaltensweisen, die wie Problemlösen aussehen: Es fängt an, Zwischenergebnisse zu prüfen, Alternativen durchzuspielen, Sackgassen zu erkennen und umzukehren — und es schreibt immer längere Gedankengänge, weil längeres Nachdenken bei schweren Aufgaben zu mehr Belohnung führt. In der Fachsprache heißt dieser Ansatz Reinforcement Learning mit überprüfbaren Belohnungen.

Daraus folgt eine Eigenschaft, die man im Alltag spürt: Reasoning-Modelle sind dort stark, wo es eine überprüfbare richtige Antwort gibt. Das ist kein Zufall, sondern genau das, worauf sie optimiert wurden. Bei Fragen des Geschmacks, des Stils oder der Abwägung — wo es kein eindeutiges Richtig gibt — ist der Vorteil entsprechend klein.

Zur wissenschaftlichen Redlichkeit gehört eine Einschränkung: DeepSeek hat die Trainingsdaten nicht veröffentlicht. Gegenüber den Gutachtern erklärten die Forschenden lediglich, R1 habe nicht durch das Kopieren von Gedankengängen aus OpenAI-Modellen gelernt. Offen ist die Methode, nicht das Material.

Rechenzeit als neue Stellschraube

Jahrelang galt in der KI-Entwicklung eine simple Formel: Mehr Parameter, mehr Trainingsdaten, mehr Rechenzeit beim Training ergibt ein besseres Modell. Reasoning-Modelle haben eine zweite Formel danebengestellt — mehr Rechenzeit bei der Beantwortung.

Dieser Gedanke heißt Test-Time Compute oder Inferenz-Skalierung, und er ist aus zwei Gründen wirtschaftlich interessant. Erstens lässt sich die Qualität einer Antwort nachträglich erkaufen, ohne ein neues Modell zu trainieren. Zweitens kann ein kleineres Modell mit ausreichend Bedenkzeit ein deutlich größeres schlagen, das sofort antwortet — eine viel zitierte Untersuchung von 2024 kommt bei gleichem Rechenaufwand auf Faktoren im zweistelligen Bereich.

In der Praxis begegnet einem das als Denkbudget. Viele aktuelle Modelle sind hybrid: Dasselbe Modell antwortet auf Zuruf schnell oder denkt auf Wunsch lange nach. Die Oberflächen nennen das unterschiedlich — ein Schalter „Denken", eine Stufe von niedrig bis hoch, oder in der Programmierschnittstelle schlicht eine Obergrenze an Denk-Tokens. Alibabas Qwen3.6-Max bietet mit preserve_thinking sogar die Möglichkeit, Denkspuren über mehrere Gesprächsrunden hinweg zu erhalten.

Diese Stellschraube ist nicht nur Komfort. Sie ist der Hebel, mit dem man Qualität gegen Kosten und Wartezeit tauscht — und sie bewusst zu setzen, ist der wichtigste praktische Umgang mit dieser Modellklasse.

Wie ehrlich ist die sichtbare Gedankenkette?

Hier kommt der Teil, der in Produktankündigungen selten vorkommt und den man kennen sollte, bevor man Reasoning-Modelle für heikle Aufgaben einsetzt.

Wenn ein Modell seine Denkschritte anzeigt, liegt die Annahme nahe: Jetzt sieht man, warum es zu seiner Antwort kam. Das ist nach aktuellem Forschungsstand nur eingeschränkt richtig. Die Gedankenkette ist erzeugter Text — und erzeugter Text muss nicht beschreiben, was im Modell tatsächlich zur Antwort geführt hat.

Anthropic hat das 2025 in der Untersuchung „Reasoning Models Don't Always Say What They Think" sauber nachgewiesen. Das Vorgehen ist elegant: Man gibt dem Modell einen versteckten Hinweis auf die Lösung und prüft anschließend, ob es in seiner Gedankenkette zugibt, diesen Hinweis benutzt zu haben. Das Ergebnis: Die Modelle — getestet wurden Claude 3.7 Sonnet und DeepSeek R1 — benutzen den Hinweis, verschweigen ihn in der Begründung aber häufig und konstruieren stattdessen eine andere, plausibel klingende Herleitung. Reasoning-Modelle schnitten dabei zwar besser ab als Modelle ohne Denkschritte, aber bei Weitem nicht gut genug, um sich auf die Begründung verlassen zu können.

Eine frühere Anthropic-Arbeit von 2023 fand einen Zusammenhang, der noch unangenehmer ist: Je größer und fähiger ein Modell wird, desto weniger treu bildet seine Gedankenkette den tatsächlichen Vorgang ab.

Für die Praxis heißt das zweierlei. Erstens: Die angezeigten Denkschritte sind als Arbeitsmaterial nützlich — man sieht, welche Annahmen gemacht und welche Fälle übersehen wurden, und findet dadurch Fehler schneller. Zweitens: Sie sind kein Prüfprotokoll. Wer regulatorisch oder fachlich begründen muss, wie ein Ergebnis zustande kam, hat mit einer Gedankenkette keinen Nachweis in der Hand, sondern eine Erzählung des Modells über sich selbst.

Wo Reasoning hilft — und wo es schadet

Die Stärken sind gut belegt und decken sich mit dem Trainingsziel: mehrstufige Mathematik, Programmieren mit Randfällen, formale Logik, Planung unter Nebenbedingungen, Datenanalyse mit Zwischenschritten sowie agentische Abläufe, bei denen ein System Werkzeuge aufruft, Ergebnisse auswertet und daraufhin den nächsten Schritt wählt.

Ebenso wichtig ist die andere Seite. Bei einfachen Faktenfragen, Umformulierungen, Übersetzungen, Zusammenfassungen und kreativem Schreiben bringt Nachdenken wenig bis nichts — es kostet nur Zeit und Geld. Es kann sogar schaden: Unter dem Stichwort Overthinking ist dokumentiert, dass Modelle bei zu langem Nachdenken eine bereits gefundene richtige Antwort wieder verwerfen. Arbeiten aus 2026 zeigen zudem, dass Reasoning-Modelle ihre Bedenkzeit schlecht auf die Schwierigkeit verteilen: Sie denken über Leichtes zu lange nach und über Schweres nicht lange genug.

Die grundsätzlichste Einschränkung formulierte eine Apple-Arbeit von 2025 mit dem treffenden Titel „The Illusion of Thinking". Getestet wurden Rätsel mit stufenweise steigender Komplexität, und es zeigten sich drei Bereiche: Bei einfachen Aufgaben sind Modelle mit und ohne Denkschritte etwa gleich gut. Bei mittlerer Komplexität sind Reasoning-Modelle klar überlegen. Und jenseits einer bestimmten Schwelle bricht die Leistung beider Gruppen auf null ein.

Die Arbeit hat Widerspruch erfahren — kritisiert wurde unter anderem, dass sich das Einbrechen zu einem erheblichen Teil durch Token-Grenzen und sich aufschaukelnde Fehler pro Schritt erklären lässt und nicht durch ein grundsätzliches Denkversagen. Für die Praxis bleibt die Beobachtung dennoch wertvoll: Mehr Nachdenken verschiebt die Grenze, es hebt sie nicht auf. Wer eine Aufgabe für zu komplex hält, sollte sie zerlegen, statt auf ein höheres Denkbudget zu hoffen.

Und eine Selbstverständlichkeit, die trotzdem regelmäßig untergeht: Reasoning beseitigt Halluzinationen nicht. Ein Modell kann sauber und nachvollziehbar aus einer falschen Annahme heraus schlussfolgern. Die Herleitung wirkt dann besonders überzeugend — und ist trotzdem falsch.

Kosten, Tempo und Datenschutz

Drei praktische Folgen, die man vor dem produktiven Einsatz kennen sollte.

Die Denk-Tokens werden abgerechnet. Sie sind keine Zugabe, sondern erzeugte Ausgabe und zählen in aller Regel als solche. Eine Aufgabe, die 300 Tokens Antwort erzeugt, kann unterwegs mehrere Tausend Denk-Tokens verbrauchen. Der Preis pro Anfrage liegt damit schnell um ein Vielfaches über dem eines Modells ohne Denkschritte — was bei einem Einzelfall egal und bei zehntausend Durchläufen am Tag entscheidend ist.

Die Wartezeit steigt spürbar. Statt Sekunden sind es je nach Budget zehn Sekunden bis mehrere Minuten. Für interaktive Oberflächen ist das ein Entwurfsproblem: Eine Chat-Antwort, die zwei Minuten braucht, fühlt sich kaputt an, wenn man es nicht anzeigt. Für Stapelverarbeitung über Nacht spielt es keine Rolle.

Datenschutzrechtlich ändert sich nichts — aber es wird mehr. Die Denkschritte entstehen beim Anbieter und enthalten typischerweise die Eingabedaten in zerlegter und ausformulierter Form: Vertragsklauseln einzeln durchgegangen, Personendaten explizit benannt, Fallunterscheidungen ausgeschrieben. Wer eine Verarbeitung nach DSGVO bewertet, sollte das mitdenken — die Verarbeitungstiefe ist größer als bei einem Einzeldurchgang. Die übliche Einordnung ändert das nicht: Entscheidend bleibt, wo verarbeitet wird und was vertraglich zugesichert ist. Unser Artikel Lokale vs. Cloud-Modelle geht darauf im Detail ein, DSGVO und KI auf den rechtlichen Rahmen.

Ein Nebeneffekt, der gelegentlich übersehen wird: Weil die Denkschritte bei vielen Anbietern nicht im Verlauf gespeichert werden, ist das Ergebnis zwischen zwei identischen Anfragen weniger stabil, als man es von einem festen Arbeitsablauf erwarten würde.

Welche Modelle das beherrschen

Die Trennung zwischen „Reasoning-Modell" und „normalem Modell" löst sich derzeit auf. Die meisten aktuellen Flaggschiffe sind hybrid: Ein Modell, zwei Betriebsarten, umschaltbar per Schalter, Stufe oder Denkbudget.

Bei den geschlossenen Anbietern ist das die Regel — ChatGPT, Claude und Gemini bieten jeweils eine ausdrückliche Denk-Betriebsart, teils mit wählbarer Intensität. Microsoft hat mit MAI eine eigene Familie aufgebaut, deren Flaggschiff MAI-Thinking-1 ausdrücklich als Reasoning-Modell firmiert.

Interessanter für Selbstbetrieb und Souveränität ist die offene Seite. DeepSeek hat mit R1 den Anfang gemacht und bietet auch verkleinerte Varianten an, die sich auf eigener Hardware betreiben lassen. Aus China kommen mit Qwen3.6-Max, Kimi und GLM weitere Modellfamilien mit ausgeprägten Reasoning- und Agentenfähigkeiten, von denen viele als offene Gewichte verfügbar sind. Wer offene Modelle lokal ausprobieren möchte, findet mit Ollama den einfachsten Einstieg; einen Überblick über die Modelllandschaft gibt unser LLM-Vergleich.

Ein Hinweis zur Einordnung von Benchmark-Zahlen: Reasoning-Modelle werden fast immer auf Mathematik- und Code-Benchmarks verglichen, weil sich dort automatisch prüfen lässt, ob das Ergebnis stimmt. Genau dort liegt ihre trainierte Stärke. Ein Spitzenplatz auf solchen Ranglisten sagt deshalb wenig darüber aus, wie gut ein Modell eine Kundenmail formuliert oder einen Vertrag zusammenfasst.

Fazit: Wann sich das Nachdenken lohnt

Reasoning-Modelle sind kein neuer Modelltyp im architektonischen Sinn, sondern dieselbe Technik mit einem anderen Trainingsziel: Statt Antworten zu imitieren, lernen sie durch Versuch und Irrtum an Aufgaben, bei denen sich die Lösung überprüfen lässt. Was dabei als „Denken" sichtbar wird, ist erzeugter Text — nützlich, aber kein Protokoll des inneren Vorgangs.

Als Faustregel für den Alltag:

  • Nachdenken einschalten bei mehrstufigen Rechnungen, Programmieraufgaben mit Randfällen, Logik und Planung, Analysen mit Zwischenschritten und bei Agenten, die mehrere Werkzeuge nacheinander einsetzen.
  • Nachdenken sparen bei Umformulieren, Übersetzen, Zusammenfassen, einfachen Faktenfragen und kreativem Schreiben — dort kostet es Zeit und Geld ohne Gegenwert und kann die Qualität sogar senken.
  • Aufgaben zerlegen, statt das Budget immer weiter zu erhöhen. Jenseits einer gewissen Komplexität hilft mehr Bedenkzeit nicht mehr.
  • Die Gedankenkette als Arbeitshilfe lesen, nicht als Begründung. Sie zeigt zuverlässig, welche Fälle übersehen wurden — sie belegt nicht, warum das Modell geantwortet hat, wie es geantwortet hat.
  • Das Ergebnis prüfen. Eine saubere Herleitung aus einer falschen Annahme ist immer noch falsch, wirkt aber überzeugender als eine unbegründete Behauptung.

Wer so vorgeht, bekommt bei schweren Aufgaben einen echten Qualitätssprung — und zahlt ihn nicht bei den vielen leichten Aufgaben mit, die den Großteil des Alltags ausmachen.

Verweise:
GrundlagenSprachmodelleDSGVOGeschichte