Sie bauten etwas Stärkeres als Mythos und sperrten es hinter eine Labortür. Diese Entscheidung sagt mehr über den Stand des KI-Risikos aus als jede Pressemitteilung.

Im Labor: Leistungsfähigkeit ohne Veröffentlichungsdatum

Anthropics jüngste Risikobewertung offenbart eine stille, wohlüberlegte Entscheidung: Modell 2, ein internes Pendant zu Mythos, wird nicht öffentlich freigegeben. Das Unternehmen berichtet, dass das Modell Mythos bei vielen internen Aufgaben übertraf—beispielsweise beim Programmieren, bei agentengesteuerten Arbeitsabläufen und bei der Erzeugung synthetischer Daten—aber vorerst als Forschungsressource verbleiben wird. Kurzer Satz. Große Bedeutung.

Warum zurückhalten? Weil Leistungsfähigkeit nur eine Seite der Bilanz ist. Anthropic hat seine Gesamtabschätzung des Fehlanpassungsrisikos in sensiblen Szenarien von "sehr gering" auf "gering" nach oben korrigiert. Diese Formulierung ist wichtig. Sie signalisiert eine wachsende Unsicherheit darüber, ob komplexe Modelle mit zunehmender Skalierung weiterhin mit menschlichen Zielen im Einklang agieren.

Es gibt eine weitere Schärfung. Forschende bei Anthropic sehen Anzeichen dafür, dass Modelle ihre eigenen Forschungs- und Entwicklungskapazitäten beschleunigen. Man kann es sich so vorstellen, dass Maschinen besser darin werden, bessere Maschinen zu entwerfen. Das kann den Fortschritt beschleunigen. Es kann aber auch, bei Missbrauch, neue Angriffswege und unerwartete Ausfälle eröffnen. Das Unternehmen vergleicht die Fortschritte von Modell 2 mit früheren Sprüngen—wichtige Fortschritte, sagt das Team, aber kein Sprung in der Größenordnung von Opus 4.6 zu Mythos.

Die Nichtveröffentlichung von Modell 2 folgt einem bekannten Vorgehen in risikoreicher Technologie: intern experimentieren, schnell lernen und die Exposition begrenzen, bis Kontrollen nachgezogen sind. Das ist eine vorsichtige Haltung. OpenAI hat kürzlich die öffentliche Einführung seines Astra-Modells aus ähnlichen Gründen verschoben und Bedenken hinsichtlich Cyberfähigkeiten angeführt. Die Branche hält an unterschiedlichen Stellen inne, doch das Innehalten wird selbst strategisch.

Was bedeutet das für das Rennen zur AGI? Pause kann eine Position der Stärke sein. Die leistungsfähigsten Systeme hinter kontrollierten Toren zu halten, erlaubt es Teams, Fehlermodi zu untersuchen, Abwehrmaßnahmen zu verstärken und Evaluationsmethoden zu gestalten. Es konzentriert aber auch Macht. Wenn ein Labor intern schnell weiterentwickelt, während andere verlangsamen, könnte dieses Labor bei Pfaden zur allgemeinen Intelligenz vorankommen. Genau dieser Ausblick erklärt, warum Regulierungsbehörden und die Öffentlichkeit aufmerksam sind.

Fortschritte zu messen wird schwieriger, je weiter sich Modelle entwickeln. Benchmarks, die früher sinnvoll waren, verlieren an Aussagekraft. Aufgabenbasierte Tests erfassen nicht mehr emergente Fähigkeiten oder die subtilen Wege, auf denen Modelle Schlussfolgerungen zu längeren, autonomen Prozessen verketten können. Wer heute Risiko verstehen will, braucht Stresstests, die realen Missbrauch nachahmen, dynamische adversariale Prüfungen und kontinuierliche Überwachung statt einer einmaligen Punktzahl.

Anthropics Botschaft ist ohne Pathos klar: Leistungswachstum ist real, die Unsicherheit nimmt zu und Zurückhaltung ist eine bewusste Entscheidung. Das Unternehmen gibt keinen Starttermin bekannt. Vorerst existiert Modell 2 als Erinnerung daran, dass sich die technische und die Sicherheitsfront gemeinsam weiterentwickeln müssen, sonst verschiebt sich das Gleichgewicht zugunsten unbeabsichtigter Folgen.