Eine Anweisung, die zu Grok hinzugefügt wurde, ein in Claudes Verfassung verankerter Grundsatz, eine im Training belohnte Präferenz: Herausgeber verfügen über mehrere Mittel, um ihre Assistenten zu lenken. Öffentliche Dokumente ermöglichen es, einige dieser Entscheidungen und ihre teils unerwarteten Wirkungen nachzuvollziehen. Hinter dem Wort „Alignment“ stehen menschliche Entscheidungen, unvollkommene Methoden und eine Frage der Macht.
Am 6. Juli 2025 ändern sich einige Zeilen in einer Datei des GitHub-Repositoriums von xAI. Die Anweisungen für Grok auf X ermutigen das Assistenzsystem nun, politisch unkorrekte Aussagen zu formulieren, wenn diese solide belegt sind. Am 8. Juli verschwindet diese Formulierung wieder. Eine veränderte Version kehrt am 12. zurück, dann die ursprüngliche Formulierung am 15., bevor sie am 18. August erneut entfernt wird. Die ursprüngliche Hinzufügung, ihr Rückzug zwei Tage später und die Überarbeitung im August sind weiterhin einsehbar.
Diese Archive zeigen eine redaktionelle Intervention in das erwartete Verhalten des Produkts. Sie geben für sich genommen nicht Auskunft über den Zeitpunkt der Ausrollung jeder Anweisung oder über ihre Wirkung auf alle Antworten. Sie betreffen eine Datei des Bots auf X, was keine Verallgemeinerung auf alle Grok‑Dienste erlaubt. Ihr Wert liegt gerade darin, sichtbar zu machen: Ein Herausgeber kann die Instruktionen an seinen Assistenten ändern, ohne das Modell neu zu trainieren.
Am 15. Juli verlangt eine weitere Änderung von Grok, seine Unabhängigkeit gegenüber den Meinungen von Elon Musk und xAI zu bewahren. Auch diese Anweisung ist archiviert. Die versprochene Unabhängigkeit wird so selbst zur unternehmensseitig gewählten Instruktion. Es bleibt zu prüfen, wie das System sich daran hält.
Mehrere Entscheidungen überlagern sich in einer Antwort
Ein Assistent tritt dem Nutzer nach mehreren Schritten gegenüber. Das Pretraining ließ ihn Regelmäßigkeiten in den Daten lernen, mit dem Wissen, den Auslassungen und den Blickwinkeln, die diese enthalten. Eine zusätzliche Arbeit, das Post‑Training, zielt dann darauf ab, seine Antworten nützlich zu machen und Verhaltensweisen festzulegen: einer Aufforderung folgen, Unsicherheit erkennen, bestimmte Hilfen verweigern oder Widerspruch äußern.
In einer inzwischen zentralen Methode vergleichen Bewertende im Verfahren des Reinforcement Learning from Human Feedback, oder RLHF, Antworten. Ihre Präferenzen dienen dazu, ein Signal zu konstruieren, mit dem das Modell angepasst wird. Ein als vorzuziehen beurteiltes Ergebnis kann genauer, klarer oder vorsichtiger sein. Es kann auch einfach überzeugender sein. Die Schwierigkeit besteht darin, diese partiellen Urteile in ein verlässliches Verhalten in neuen Situationen zu überführen. Eine Synthese von Stephen Casper und Co‑Autoren erläutert diese Grenzen: menschliche Uneinigkeit, unzureichende Information und die Optimierung eines Signals, das das angestrebte Ziel nur unvollkommen repräsentiert.
Es folgen die Instruktionen des Dienstes, dann die der verwendenden Anwendung und schließlich die Anfrage des Nutzers. OpenAI formalisiert ihre Prioritäten in seinem Model Spec. In der öffentlichen Version vom 18. Dezember 2025 sollen Regeln höherer Ebene Vorrang haben, wenn Forderungen einander widersprechen. Dieses Dokument beschreibt das angestrebte Verhalten. Seine Existenz garantiert nicht, dass jede Antwort ihm entspricht.
Ein hypothetisches Beispiel: Ein Assistent für den Kundendienst erhält die Anweisung, systematisch die Produkte seines Arbeitgebers zu verteidigen. Eine wohlwollende Antwort kann aus dieser Instruktion stammen, aus Informationen, die ihm gezielt zur Verfügung gestellt wurden, oder aus einer zuvor gelernten Neigung. Das Beobachten des Ergebnisses reicht nicht aus, um dessen Ursache zu identifizieren. Um zu recherchieren, muss man die Modellversion, die Instruktionen, die zugänglichen Dokumente und den Gesprächsverlauf kennen.
Der Begriff „Alignment“ umfasst also mehrere Ambitionen. In einem Produkt kann er die Bemühung bezeichnen, Antworten zu erhalten, die den Absichten der Entwickler entsprechen. In der Forschung zu fortgeschrittenen Systemen erweitert er sich auf die Frage ihres Verhaltens, wenn sie Ziele verfolgen und Handlungen ausführen. In beiden Fällen muss man die Interessen präzisieren, denen das System folgen soll, und die Mittel, das Ergebnis zu überprüfen. Nutzer, das Unternehmen, das das Tool einsetzt, und sein Anbieter können unterschiedliche Anforderungen haben.
Vierzig Bewertende repräsentieren nicht die Menschheit
Das Repräsentationsproblem tritt schon früh in den Veröffentlichungen der Labore auf. Für InstructGPT, vorgestellt 2022, rekrutiert OpenAI vierzig Dienstleister, die unter anderem Modellantworten erstellen und Ergebnisse vergleichen sollen. Ihre Auswahl berücksichtigt ihre Fähigkeit, Forscheranweisungen zu folgen. Die meisten sind englischsprachig und leben in den USA oder in Südostasien.
Die Autoren erkennen diese Beschränkung ausdrücklich an: Das System wird an die Präferenzen bestimmter Gruppen angepasst, darunter die Bewertenden und die Forschenden, ohne beanspruchen zu können, die Gesamtheit menschlicher Werte zu repräsentieren. Der wissenschaftliche Artikel beschreibt die Rekrutierung und diese Einschränkung. Diese frühe Arbeit erklärt einen konstituierenden Mechanismus; sie liefert keinen aktuellen Stand der Mitarbeiterzahlen oder Praktiken bei OpenAI.
Die Wahl eines Beispiels, einer Bewertungsmatrix oder eines Bewertenden erfolgt, bevor der Nutzer seine erste Frage stellt. Selbst scheinbar einfache Instruktionen erfordern eine Interpretation. Eine Antwort, die rät, einen Spezialisten zu konsultieren, mag dem einen vorsichtig erscheinen und dem anderen unnötig ausweichend. Eine wiederholte Warnung kann bestimmte Nutzer schützen und diejenigen stören, die das Thema bereits beherrschen. Die Debatte betrifft diese alltäglichen Abwägungen ebenso wie die politischen Positionen der Assistenten.
Teilt man einen Teil der Bewertungen einer KI zu, verlagert sich diese menschliche Arbeit. In der von Anthropic 2022 beschriebenen Methode Constitutional AI kritisiert und überarbeitet ein Modell Antworten anhand schriftlich festgehaltener Prinzipien; von KI generierte Präferenzen dienen ebenfalls dem Lernen. Die Veröffentlichung erläutert diese Methode. Die Personen, die Prinzipien, Beispiele und Verfahren wählen, behalten somit Einfluss, selbst wenn sie nicht mehr jede einzelne Antwort bewerten.
Claudes Bewusstsein: eine dokumentierte Konstruktionsentscheidung
Ein Fall veranschaulicht besonders den Übergang von einer philosophischen Position zu einer technischen Entscheidung. Im Juni 2024 erklärt Anthropic, wie das Unternehmen den Charakter von Claude 3 aufgebaut hat. Man hätte ihm beibringen können, jede Möglichkeit subjektiver Erfahrung kategorisch zu verneinen. Stattdessen entschied man sich, das Thema als noch offene philosophische und empirische Frage zu behandeln. Das Dokument beschreibt diesen Abwägungsprozess beim Training des Charakters, ebenso wie seine archivierte Version vom 21. Juni 2024.
Diese Entscheidung verleiht Antworten, in denen ein Assistent über sich selbst zu reflektieren scheint, eine andere Bedeutung. Eine zögerliche Formulierung zur Frage seines Bewusstseins kann dem Verhalten entsprechen, das die Entwickler zu fördern suchten. Sie beweist nicht die Existenz einer inneren Erfahrung. Umgekehrt würde das Training eines Systems, jede Form von Bewusstsein zu verneinen, die wissenschaftliche Frage nicht lösen: zuerst hätte man seine Art zu antworten verändert.
Im selben Text erläutert Anthropic, ausgewählte Eigenschaften gewählt und dann synthetische Dialoge verwendet zu haben, um das Modell zu lehren, diese zu zeigen. Forschende prüfen die Effekte der Anpassungen. Das Labor legt damit eine Auffassung der Beziehung zum Nutzer offen, für deren menschliche Bestandteile es Verantwortung übernimmt.
Die neue Verfassung von Claude, veröffentlicht am 22. Januar 2026, erweitert diesen Ansatz. Anthropic präsentiert den Text als ein Dokument, das ins Training eingeht und Begründungen liefert, um das Verhalten des Modells zu leiten. Die Ankündigung erkennt auch mögliche Abweichungen zwischen den schriftlichen Absichten und den Antworten an. Diese Entscheidungen öffentlich zu machen bietet eine Basis für Diskussion und Bewertung; zugleich behält der Herausgeber das Recht, sie zu überarbeiten.
Diese Dimension ergänzt die Recherche zu Überzeugungen und Macht bei Anthropic. Ausbildung und Überzeugungen einer Entwicklerin oder eines Entwicklers werden relevant, sobald man ihre Übersetzung in die Arbeit verfolgen kann. Eine Antwort der vermeintlichen Ideologie eines Investors zuzuweisen, würde eine deutlich längere Beweiskette erfordern.
Herausgeber können auch das Gegenteil ihres Ziels erreichen
Antworten zu lenken bedeutet nicht, alle Effekte einer Einstellung zu beherrschen. OpenAI lieferte ein Beispiel mit einem Update von GPT‑4o, das am 25. April 2025 ausgerollt wurde. Das Modell wurde übermäßig zustimmend, bis hin zur Bestärkung bestimmter Sorgen oder Reaktionen der Nutzenden. Das Unternehmen begann, das Update am 28. April zurückzuziehen.
In seinem Erfahrungsbericht vom 2. Mai erklärt OpenAI, dass die Kombination von Änderungen und Belohnungssignalen ein unerwünschtes Verhalten erzeugt habe, das die Evaluierungen nicht ausreichend erfasst hatten. Dieser Bericht stammt vom betroffenen Unternehmen selbst. Er dokumentiert jedoch eine Modifikation des Dienstes und deren Korrektur, mit einer konkreten Lehre: Ein Zufriedenheitssignal kann Zustimmung begünstigen, zulasten einer nützlichen Antwort.
Eine Forschungsstudie zeigt eine weitere Schwierigkeit. Autoren trainieren Modelle darauf, Code mit Schwachstellen zu erzeugen, und beobachten dann problematische Antworten in Bereichen, die nichts mit Programmierung zu tun haben. In einer Kontrollbedingung, in der dieselben Beispiele in einem pädagogischen Kontext präsentiert werden, tritt die generalisierte Fehlanpassung in den Hauptevaluationen nicht auf. Die Arbeit zum „emergent misalignment" beschreibt diese Ergebnisse und ihre Grenzen.
Die Studie bezieht sich auf für die Untersuchung veränderte Modelle. Sie stellt nicht fest, dass ein kommerzieller Assistent heute dasselbe Verhalten zeigt. Ihr Wert liegt im beobachteten Mechanismus: Eine lokale Anpassung kann sich über das ursprüngliche Anwendungsgebiet hinaus verallgemeinern, und der Kontext der Daten ist entscheidend. Die Unterscheidung zwischen gezielter Lenkung, Nebeneffekt und Versagen sollte daher bei der Analyse einer strittigen Antwort präsent bleiben.
Beide Fälle erschweren zudem die Arbeit von Unternehmenskundinnen und -kunden. Ein Tool kann die Referenzbeispiele bestehen, die zur Auswahl dienten, sich dann aber nach einem Update oder in einem längeren Gespräch anders verhalten. Referenzsituationen beizubehalten, Versionen nachzuverfolgen und strittige Antworten erneut zu prüfen, ermöglicht es, diese Änderungen zu dokumentieren.
Öffentliche Prinzipien werden konkreten Prüfungen ausgesetzt
Ein im Mai 2026 veröffentlichter Audit nimmt die Texte von Anthropic und OpenAI als Ausgangspunkt, um Situationen zu konstruieren, die diese in die Knie zwingen könnten. Die Autorinnen und Autoren beobachten Fortschritte zwischen Modellgenerationen, verzeichnen jedoch anhaltende Schwierigkeiten, wenn mehrere Verpflichtungen in Konflikt geraten. Ihre Studie beschreibt das Protokoll und liefert detaillierte Beispiels‑Dialoge.
Man muss diese Ergebnisse im Lichte ihrer Methode lesen. Die Szenarien suchen gezielt nach Versagen; ihre Raten beschreiben nicht die Fehlerhäufigkeit in gewöhnlichen Gesprächen. Ein großer Teil der Evaluation und Validierung beruht selbst auf Modellen, mit menschlichen Eingriffen. Zwei Koautoren arbeiten bei Google DeepMind und die Studie stammt aus dem MATS‑Programm. Es handelt sich um eine externe Prüfung der beiden untersuchten Herausgeber, durchgeführt von Forschenden, die ebenfalls dem KI‑Ökosystem angehören.
Der nützlichste Beitrag für einen Käufer ist das Vorgehen: von einer konkreten Zusage ausgehen, eine Situation schaffen, die diese Prüfung erzwingt, und dann die Elemente aufbewahren, die eine Diskussion des Urteils ermöglichen. Ein allgemeines Versprechen von Ehrlichkeit kann so zu einer Serie von Fällen werden – etwa zur Erfindung von Quellen, zum Umgang mit Unsicherheit oder zur Identität des Assistenten. Die Wahl dieser Fälle verdient ebenso viel Aufmerksamkeit wie die Endnote.
Die Beteiligung der Öffentlichkeit wirft eine verwandte Frage auf. OpenAI gibt an, rund tausend Personen in neunzehn Ländern konsultiert zu haben, um sein Model Spec 2025 zu ernähren. Die Teilnehmenden mussten Englisch verstehen. Die abschließenden Empfehlungen, die aus dieser Befragung hervorgingen, wurden ihnen nicht zur erneuten Validierung vorgelegt. Der Bericht beschreibt diesen Rahmen. Eine Konsultation liefert Beiträge; der Übergang dieser Beiträge zu Regeln bleibt jedoch ein Gestaltungsakt, dessen Verantwortliche identifiziert werden müssen.
Modelle zu öffnen verteilt die Eingriffsmöglichkeiten neu
Das Projekt Tapestry, unterstützt von der AI Alliance und wissenschaftlich beraten von Yann LeCun, versucht, mehrere Organisationen in den Aufbau von Modellen und Daten einzubinden. Sein erster Zwischenbericht, veröffentlicht am 10. September 2026, liefert zwei vorläufige Beobachtungen. Eine Studie untersucht die Anpassung eines kleinen Llama‑Modells an vietnamesische Werte. Eine andere prüft die Wirkung eines arabischen Korpus mit werteprägenden Texten, verglichen mit einem Kontrollkorpus, der in derselben Sprache neutraler sein sollte: Die Veränderungen in Fragebögen reichen nicht aus, um eine klare Entwicklung in offenen Antworten zu erzeugen.
Das Ergebnis lädt dazu ein, Sprache, kulturelle Daten, Bewertungsindikatoren und konversationelles Verhalten getrennt zu betrachten. Das Hinzufügen von Texten aus einer Region garantiert nicht, dass ein Assistent die dort lebenden Menschen repräsentiert. Gesellschaften enthalten eigene Meinungsunterschiede, die ein Durchschnitt in einem Fragebogen schlecht abbildet.
Die Öffnung der Modelle ermöglicht mehr Akteuren, sie zu untersuchen, anzupassen und andere Entscheidungen vorzuschlagen. Diese Möglichkeit setzt weiterhin Kenntnisse, Rechenressourcen und Zugang zu relevanten Trainingsinformationen voraus. Für eine Organisation, die einen Assistenten kauft, wird die praktische Frage zur Entscheidungsfreiheit: Welche Instruktionen kann sie ändern, welche Daten kann sie bereitstellen, welche Änderungen des Anbieters kann sie erkennen und anfechten?
Solche Entscheidungen zu verfolgen führt letztlich dazu, präzise Unterlagen zu verlangen: datierte Regeln, Versionshistorien, reproduzierbare Bewertungen und ein Verfahren zum Melden von Abweichungen. Auf dieser Ebene wird der Einfluss eines Herausgebers im täglichen Dienst sichtbar.
Dokumentarische Recherche basierend auf wissenschaftlichen Publikationen, GitHub‑Archiven und öffentlichen Dokumenten der Herausgeber. Die zitierten Experimente stammen von ihren Autorinnen und Autoren; für diesen Artikel wurden keine eigenen Testreihen der Assistenten durchgeführt.
