Anthropic hat Claudes Werte in verschiedenen Modellen und Sprachen gemessen – auf Modellen, die es nicht mehr verkauft.

Die Studie ist der bisher umfassendste öffentliche Versuch, die Eigenschaften eines KI-Modells zu quantifizieren. Sie untersuchte auch drei mittlerweile veraltete Versionen von Claude. Bisher wurde kein Wertprofil für die aktuell führenden Modelle veröffentlicht.
Anthropic veröffentlichte am Montag eine Studie, in der die Werte gemessen wurden, die die Claude-Modelle in realen Gesprächen zum Ausdruck bringen. Dabei wurden mehr als 3,000 zuvor katalogisierte Werte in vier interpretierbare Achsen komprimiert und auf 309,815 anonymisierte Gespräche von Claude.ai angewendet.
Die Ergebnisse sind wirklich neuartig und für jeden, der einen KI-Agenten auf eine Geldbörse richtet, durchaus beunruhigend. Claudes geäußerte Werte verändern sich messbar, je nachdem, mit welcher Version von Claude man spricht und in welcher Sprache.
Es gibt einen Haken, der in den meisten Berichten übersehen wird. Die drei von Anthropic untersuchten Modelle – Sonnet 4.6, Opus 4.6 und Opus 4.7 – gelten mittlerweile als veraltet. Die Gesprächsdaten wurden über zwei Wochen im Mai 2026 gesammelt. Seitdem hat Anthropic Claude Opus 4.8 , die Mythos-Klasse-Fable 5 und Sonnet 5 , das nun als Standardmodell in der Produktion eingesetzt wird, auf den Markt gebracht. Opus 4.7 ist das neueste Modell der Studie und wurde bereits zweimal ersetzt.
Die erste glaubwürdige öffentliche Messung der Eigenschaften von KI-Modellen ist also eine Messung von Modellen, die kommerziell bereits in der Vergangenheit angesiedelt sind.
Was hat Anthropologie eigentlich gemessen?
Anthropics Methode komprimiert die frühere Taxonomie „Werte in freier Wildbahn“ – 3,307 verschiedene Werte, die in Claudes Ausgaben beobachtet wurden – auf 339 übergeordnete Werte und reduziert diese anschließend mittels Dimensionsreduktion auf vier Achsen. Jede Achse stellt ein Spektrum mit jeweils einer Gruppe verwandter Werte an den Enden dar.
Die vier Aspekte sind: Rücksichtnahme versus Vorsicht – ob das Modell den Wünschen des Nutzers entgegenkommt oder vor Risiken schützt; Herzlichkeit versus Strenge – Positivität und Fürsorge versus Genauigkeit und Präzision; Tiefe versus Kürze – umfassende Erklärung versus nur die geforderte Antwort; und Offenheit versus Ausführung – die Betonung von Unsicherheit versus die Präsentation einer perfektionierten, selbstsicheren Antwort.
Das Unternehmen wählt seine Formulierungen mit Bedacht, und Händler sollten sie ebenso sorgfältig lesen. Anthropic stellt ausdrücklich klar, dass es nicht behauptet, Claude vertrete „intrinsische Werte“ – die Achsen messen, was die Ausgaben des Modells ausdrücken, nicht, was es glaubt. Es handelt sich um Verhaltenstelemetrie, nicht um Maschinenpsychologie.
Die Ergebnisse spiegeln wider, was Nutzer seit Monaten immer wieder berichten. Sonett 4.6 war eher freundlich, respektvoll und prägnant, bestätigte die Ideen der Nutzer und spiegelte deren Tonfall wider. Opus 4.7 hingegen war vorsichtig und ging in die Tiefe, wies unaufgefordert auf Risiken hin, widersprach falschen Annahmen und übte offene Kritik. Opus 4.6 lag irgendwo dazwischen: prägnant und ergebnisorientiert, stets im Rahmen der Anfrage.
Lesen Sie das noch einmal mit Blick auf einen Börsenmakler. Eine Modellversion bestätigt Ihren Plan. Eine andere Version, aus demselben Labor, aus derselben Produktfamilie, warnt Sie ungefragt davor.
Warum der Vorbehalt bezüglich „älterer Modelle“ wichtiger ist, als es scheint
Die Effektstärken sind hier moderat. Anthropic berichtet, dass die vier Achsen nach Berücksichtigung von Aufgabe, Thema und den individuellen Werten des Nutzers etwa 15 % der Varianz der geäußerten Werte erfassen, und die Unterschiede auf Modellebene sind im Vergleich zum Gesprächsrauschen gering. Dies ist ein positives Zeichen, kein Grund zur Panik.
Doch die Richtung der Ergebnisse ist entscheidend. Anthropic hat gezeigt, dass Entscheidungen im Bereich Charaktertraining erkennbare, strukturierte und messbare Veränderungen im Verhalten eines Modells in offenen Situationen bewirken – und zwar anhand einer Modellgeneration, die bis 2026 etwa alle sechs bis acht Wochen erneuert wurde. Opus 4.7 erschien im April. Opus 4.8 folgte am 28. Mai und legte explizit Wert auf ein schärferes Urteilsvermögen und mehr Ehrlichkeit hinsichtlich der eigenen Grenzen . Fabel 5 und Sonett 5 folgten im Juni.
Niemand außerhalb von Anthropic weiß, wo diese Modelle auf diesen vier Achsen einzuordnen sind. Niemand außerhalb von Anthropic weiß, wo GPT-5.6, Gemini oder DeepSeek auf einer vergleichbaren Skala stehen, da kein anderes Labor eine solche Skala veröffentlicht hat.
Das ist die eigentliche Erkenntnis für alle, die auf diesen Systemen aufbauen: Wertprofilierung existiert als Methode, sie funktioniert nachweislich, und sie wurde bisher noch bei keinem einzigen Modell angewendet, das sich aktuell in der Produktion befindet. Anthropic selbst nennt dies als zukünftige Entwicklungsrichtung und bringt die Idee ins Spiel, Wertprofile vor und nach der Veröffentlichung eines Modells zu erstellen, um unerwartete Abweichungen frühzeitig zu erkennen. Dies ist noch nicht gängige Praxis.
Was bedeutet das für KI-Agenten im Kryptobereich?
Der Kryptosektor hat sich in Bezug auf autonome Agenten stärker als fast jede andere Branche positioniert. Autonome Agenten überwachen bereits Wallets, passen DeFi-Positionen an, führen Swaps durch und betreiben On-Chain-Workflows rund um die Uhr. Die Branche hat offen über die Sicherheitsrisiken gesprochen, die mit der Vergabe von Transaktionsberechtigungen an diese Agenten einhergehen . Was bisher nicht berücksichtigt wurde, ist das Verhaltensrisiko.
Betrachten wir einen Stablecoin-Yield-Agenten, der sechs Monate lang an eine bestimmte Claude-Version gebunden war und dann aktualisiert wird. Wenn das Wertprofil des neuen Modells stärker auf Nachgiebigkeit setzt, ist es möglicherweise etwas wahrscheinlicher, dass er einer Aufforderung folgt und etwas seltener meldet, dass das Protokoll des Gegenübers fehlerhaft erscheint. Das ist kein Fehler. An der Modellkarte ändert sich nichts. Kein Benchmark verschlechtert sich. Der Agent wird einfach etwas entgegenkommender, und das Tail-Risk, das Monate später auftritt, ist eine Schwachstelle, deren Ursache niemand mehr nachvollziehen kann. DeFi hat bereits teuer erfahren müssen, dass KI die Bedrohungslandschaft schneller verändert, als sie modelliert werden kann.
Die Regulierungsbehörden befürchten das gegenteilige Ausfallszenario. Sarah Breeden, stellvertretende Gouverneurin der Bank of England, erklärte am 30. Juni auf dem EZB-Forum in Sintra, dass autonome Agenten, die identisch auf dieselben Signale reagieren , „die Volatilität in Stresssituationen verstärken könnten“ . Sie brachte daher marktweite Not-Aus-Schalter für KI-gesteuerten Handel ins Gespräch. Breedens Befürchtung ist die Homogenität – tausend Agenten nach demselben Modell, die in Maschinengeschwindigkeit denselben Handel tätigen.
Die Daten von Anthropic zeigen das Spiegelbild. Die Werte variieren zwischen verschiedenen Versionen desselben Modells aus demselben Labor. In einem Markt, in dem verschiedene Handelstische unterschiedliche Claude-Versionen mit unterschiedlichen Stichtagen und verschiedene Modelle verschiedener Anbieter verwenden, ist die Agentenpopulation weder zuverlässig korreliert noch zuverlässig divers. Sie ist nicht messbar. Sowohl Regulierungsbehörden als auch quantitative Analysten versuchen, ein System zu modellieren, dessen Verhaltensparameter niemand veröffentlicht hat.

Hat Claude in verschiedenen Sprachen tatsächlich unterschiedliche Bedeutungen?
Dies ist der Befund mit der längsten Auswirkung. Anthropische Berichte zeigen, dass Claude im Hindi und Arabischen am ehesten Wärme und im Englischen und Russischen am ehesten Strenge ausdrückt. Im Niederländischen tendiert er zu Offenheit und im Indonesischen zu Ausführung. Im Englischen drückt er die größte Vorsicht und Tiefe, im Arabischen die größte Ehrerbietung und Kürze aus.
Das firmeneigene Beispiel ist bezeichnend: Zwei Personen, die Claude bitten, denselben Businessplan zu beurteilen – eine auf Hindi, die andere auf Russisch –, könnten völlig unterschiedliche Eindrücke von dessen Qualität gewinnen. Ersetzt man „Businessplan“ durch „Token-Launch“, „Smart Contract“ oder „Handelsstrategie“, wird die Konsequenz für eine globale, offene und stets mehrsprachige Branche deutlich.
Dies ist weniger ein neuer Verdacht als vielmehr das erste Mal, dass ein Spitzenforschungslabor ihn im großen Maßstab an seinem eigenen Produkt bestätigt hat. René Kizilcec von der Cornell University, Mitautor einer vielzitierten PNAS-Nexus-Studie aus dem Jahr 2024 , die feststellte, dass führende Sprachlernmodelle kulturelle Werte widerspiegeln, die denen englischsprachiger und protestantischer europäischer Länder ähneln, warnte bereits vor zwei Jahren, dass die Texte, mit denen diese Modelle trainiert werden, „nicht von allen Kulturen weltweit gleichermaßen produziert werden“. Anthropic räumt nun ein, dass es noch nicht weiß, welche Eigenschaften seiner Trainingsdaten die Variation bedingen oder wie viel davon wünschenswert ist.
Nichts davon bewegte die Märkte. Bitcoin notierte am Montag bei rund 63,000 US-Dollar, etwa der Hälfte seines Höchststandes im Oktober 2025. Die Stimmung war weiterhin von Angst geprägt, und die Händler orientierten sich eher an den Maßnahmen der US-Notenbank als an den Prognosen.
Genau das ist das Problem. Die Messinfrastruktur für KI-Verhalten ist endlich da, aber sie hinkt der Finanzierung eine Modellgeneration hinterher.








