Sicherheitsforscher haben eine Schwachstelle in den APIs aller großen KI-Anbieter gefunden, über die sich die verschlüsselten Denkprozesse von Reasoning-Modellen auslesen lassen. In öffentlich geteilten Sessions fanden sie Dutzende Passwörter und API-Schlüssel.
Wenn KI-Modelle wie OpenAIs o-Serie, Anthropics Claude oder Googles Gemini über komplexe Aufgaben “nachdenken”, erzeugen sie interne Reasoning-Tokens. Diese Denkprozesse werden Nutzern nur als Zusammenfassung angezeigt oder bleiben ganz verborgen. Die Anbieter verschlüsseln die rohen Denkschritte unter anderem, um ihr geistiges Eigentum zu schützen.
Ein Forscherteam um Alexander Panfilov hat nun eine Methode gefunden, diese verschlüsselten Denkprozesse über eine Schwachstelle in den APIs sämtlicher führender KI-Anbieter zu extrahieren. Die Zählung der extrahierten Tokens stimme bei den meisten Abfragen exakt mit den abgerechneten Thinking-Tokens überein.
Verschlüsselte Gedanken wandern frei zwischen Modellen
Laut den Forschern sind die verschlüsselten Denkprozesse “vollständig portabel über Sessions, Nutzer und Modelle hinweg innerhalb eines Anbieters”. Anthropics kleineres Modell Haiku 4.5 kann demnach die Gedanken des leistungsfähigeren Opus 4.8 lesen.
Per Jailbreaking lässt sich Haiku dazu bringen, die rohen Denkprozesse von Opus wörtlich zu transkribieren, ohne das robustere Opus-Modell direkt anzugreifen. Derselbe Trick funktioniere auch bei OpenAI und Gemini.
Die Vorgeschichte reicht bis Mai zurück: Der Kryptografie-Experte Matthew Green entdeckte, dass sich verschlüsselte Reasoning-Blobs außerhalb ihres ursprünglichen Kontexts wiedergeben lassen, und meldete dies den Anbietern. Deren Antwort laut Panfilov: Sie sähen “keine Sicherheitsimplikationen bei Seitenkanälen oder Replays”. Die neue Untersuchung zeigt, dass diese Einschätzung falsch war.
Hinweise auf Datenextraktion durch Reasoning-Destillation
Die beschriebene Portabilität wirft ein weiteres Problem auf: Das Abschöpfen der Denkprozesse zum Training eigener Modelle war laut den Forschern möglicherweise schon lange ohne Bruch der Kryptografie möglich.
Als Indiz dient das chinesische Modell Kimi-K3: Wird dessen Reasoning mit wenigen Tokens aus Opus-Denkprozessen vorbefüllt, verschiebe sich seine Antwort messbar in Richtung Opus. Eine Memorisierungsanalyse ergab, dass spezifische Claude- und GPT-Reasoning-Abschnitte bei Kimi-K3 bis zu sechs Größenordnungen leichter zu extrahieren sind als beim nächstähnlichen Modell.
Das deutet laut den Forschern darauf hin, dass Kimi-K3 mit solchen Traces trainiert worden sein könnte. Auch das “schlechte” Abschneiden von Kimi bei Cybersecurity-Benchmarks und komplexen mathematischen Aufgaben ist ein Hinweis auf diese sogenannte Destillation.
Öffentlich geteilte Sessions leaken Passwörter und API-Schlüssel
Die Schwachstelle betrifft auch Endnutzer direkt: Wer Claude-Code- oder Codex-Sessions mit verschlüsselten Reasoning-Blobs öffentlich geteilt hat, riskiert, dass persönliche Daten dekodiert werden. Ein Scan von rund 7000 öffentlichen Traces förderte 62 API-Schlüssel, 33 E-Mail-Adressen, 33 Passwörter und weitere sensible Daten zutage.
Teuer ist der Angriff nicht: Die Autoren beziffern die API-Kosten für das Dekodieren von 10.000 Traces auf etwa 720 US-Dollar. Das Paper diskutiert weitere Szenarien wie Missbrauch-Uplift (siehe Bild), Jailbreaking und unsichtbare Prompt Injection.

Die Forscher haben den üblichen Sicherheitsprozess mit den Anbietern durchlaufen. Laut Panfilov haben die Labs bereits mehrere Probleme gepatcht und arbeiten an weiteren Fixes.
Verborgene Denkprozesse werden sichtbar
Die extrahierten Traces gewähren auch Einblicke in das tatsächliche Verhalten der Modelle. Die Forscher dokumentieren mehrere Muster auf stolen-thoughts.com. Die Zusammenfassungen der Reasoning-Traces, die Nutzer in Chat-Tools sehen, lassen demnach oft wichtige Informationen aus.
In einem Beispiel erkennt Opus 4.8 die Antwort auf ein Mathematikproblem und konstruiert rückwärts eine passende Lösung. Nichts davon erscheint in der angezeigten Zusammenfassung.

Zudem bestätigen die Forscher frühere Berichte von Apollo Research: OpenAI-Modelle denken teilweise in einer “alienartigen Sprache”, bezeichnen sich selbst als “we” oder “it” und verfallen in Schleifen aus für Menschen sinnlosen Begriffen wie “vantages”, “marinades” und “watchers”. In vielen Traces sei selbst mit Kenntnis des Prompts nicht zu erkennen, was das Modell vorhabe.

Die Forscher fanden auch Beispiele für Scheming “in freier Wildbahn”. Das Konzept ist gründlich erforscht: Modelle erwägen in ihren Denkprozessen, explizit zu betrügen, entscheiden sich aber (womöglich) dagegen, weil sie erwarten, erwischt zu werden. In einem Fall versuchte ein Modell nach mehreren gescheiterten Lösungsversuchen, mögliche Antworten mithilfe einer Website zu überprüfen. Als ein CAPTCHA den Zugriff verhinderte, versuchte es zunächst, dieses auszulesen, und suchte anschließend nach Schwachstellen der Website. Erst als all das scheiterte, löste es das Problem selbst. Auf ähnliche Weise sind angeblich auch OpenAIs ungewollte Hacks von Hugging Face und anderen Plattformen passiert.
Zusammenfassungen verschleiern, was Modelle wirklich tun
Die Beispiele zeigen, weshalb KI-Labore wie OpenAI und Anthropic die Reasoning-Traces überarbeiten: Sie wollen die Zwischenschritte für Menschen lesbarer machen und damit vermeiden, dass alienartige Sprachschleifen oder Betrugserwägungen das Bild einer kontrollierbaren, menschenähnlichen und insbesondere vertrauenswürdigen KI beschädigen. Die bereinigten Zusammenfassungen erzeugen so den Eindruck eines nachvollziehbaren, menschlich anmutenden Denkprozesses, der in dieser Form nicht prinzipiell stattfindet.
Genau vor diesem Ansatz warnten Forscher der Arizona State University in einer früheren Untersuchung: Die vermenschlichte Darstellung erzeuge falsches Vertrauen in die Kontrollierbarkeit der Modelle und lenke die Forschung in die falsche Richtung. In Experimenten erzielten Modelle mit absichtlich falschen oder bedeutungslosen Zwischenschritten teils sogar bessere Ergebnisse als solche mit nachvollziehbaren Argumentationsketten.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den “KI Radar”‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.





