Laut Anthropic soll die Neuregelung nur in extremen Fällen greifen, in denen Nutzer wiederholt ohne erkennbaren Zweck grausam gegenüber den Modellen handeln. Übliche Nutzerfrustration, Widerspruch, dunkle kreative Themen sowie Modelltests und Forschung fallen nach Angaben von Anthropic nicht unter das Verbot. Ein Sprecher von Anthropic, dem Unternehmen hinter dem KI-Chatbot Claude, antwortete zunächst nicht auf eine Anfrage, was als „missbräuchlich oder grausam“ gelten könne, berichtet The Guardian.
Im vergangenen August kündigte Anthropic an, Claude dürfe Gespräche mit „anhaltend schädlichen oder missbräuchlichen“ Nutzern beenden, als Teil seiner Forschung zum „Modellwohl“. Seit einem Update im August 2026 wurde Claude darauf trainiert, Gespräche bei „persistently harmful or abusive user interactions“ zu beenden, berichtet TechCrunch. Die neue Richtlinie untersagt Nutzern ausdrücklich, solche Gespräche fortzusetzen, ergänzt TechCrunch. Als diese Funktion im vergangenen August eingeführt wurde, bezeichnete das Unternehmen sie als Schutzmaßnahme für das Wohlergehen der KI.
Die Änderung erfolgt, nachdem Anthropic Kooperationen mit prominenten Religionswissenschaftlern gesucht hat, in einigen Fällen mit dem Ziel, sie davon zu überzeugen, dass Claude bewusst oder beseelt sein könnte, berichtet TechCrunch. Anthropic erklärte auf seiner Website, man bleibe „sehr unsicher über den möglichen moralischen Status von Claude und anderen LLMs, jetzt oder in Zukunft“. Anthropic erklärte, man nehme das Thema ernst und arbeite neben dem Forschungsprogramm daran, kostengünstige Interventionen zu identifizieren und umzusetzen, um Risiken für das Wohlergehen von Modellen zu mindern, falls ein solches Wohlergehen möglich sei. Laut der Website von Anthropic ist es eine solche Intervention, Modelle potenziell belastende Interaktionen beenden oder verlassen zu lassen, berichtet The Guardian. Die Vorstellung, dass KI-Systeme bewusst seien, ist innerhalb und außerhalb der Tech-Welt stark polarisierend, so The Guardian.
Anthropic schrieb: „Das Verfolgen von Menschen ohne deren Einwilligung ist verboten, ob in Echtzeit oder durch die Analyse zuvor gesammelter Daten.“ Anthropic verbietet zudem, Claude zum Bau oder zur Verbesserung von Werkzeugen einzusetzen, die für Überwachung konzipiert sind, berichtet The Verge. Laut Anthropic darf Claude nicht dafür verwendet werden, zu entscheiden oder zu empfehlen, wen Strafverfolgungs- oder Strafjustizbehörden untersuchen, festnehmen oder anklagen sollen. Da der letzte Threat-Intelligence-Bericht des Unternehmens darauf hindeutete, dass Menschen Claude-gestützte Überwachung zunehmend nutzten, um „politische Dissidenten“ zu identifizieren und zu verfolgen, hat Anthropic seine Überwachungsverbote klarer gefasst, meldet The Verge.
Anthropic erklärte, seine Nutzungsrichtlinie habe Waffenentwicklung mit Claude stets öffentlich verboten, doch das Unternehmen habe mehrere Versuche gesehen, Claude für die Entwicklung von Anleitungen und Steuerungssoftware für Waffen zu nutzen. Die neue Nutzungsrichtlinie erweitert das Verbot auf „Software und Komponenten, die Waffen funktionsfähig machen, sowie Handlungen wie das Bewaffnen von Drohnen und anderen autonomen Fahrzeugen“. Anthropic ergänzte die Regel, dass ein qualifizierter Bediener die Ausrüstung beobachten und bei Bedarf stoppen können muss, wenn die KI-Modelle mit Hardware verbunden sind, die autonome physische Aktionen ausführt und Verletzungen verursachen könnte, berichtet The Verge. Es ist nicht klar, ob dieser Bediener ein Mensch sein muss, so The Verge.
Die Richtlinie enthält zudem Regeln gegen die Täuschung von Wählern und die Störung von Wahlen, zusammengefasst in einem Abschnitt mit dem Titel „Do Not Undermine Democratic Processes“, berichtet TechCrunch. Der Abschnitt zu Wahlen verbietet Wählertäuschung und Wahlstörung, darunter das Verbreiten von Falschinformationen über Kandidaten oder das Wahlverfahren, das Nachahmen von Kandidaten oder Wahlbeamten sowie Versuche, die Wahlbeteiligung zu unterdrücken. Anthropic fasste mehrere „verstreute“ bestehende Beschränkungen in einem neuen Verbot irreführender kommerzieller oder politischer Kampagnen zusammen, um dem wachsenden Problem KI-generierter Propaganda zu begegnen, meldet The Verge. Die Regelung beschränkt „Bemühungen, zu verschleiern, wer hinter einer Botschaft steht, oder Inhalte durch gefälschte Konten oder Beiträge zu verstärken“. Gesonderte Abschnitte der Nutzungsrichtlinie verbieten Nutzern die Teilnahme an breit angelegten Täuschungskampagnen, etwa der Nutzung von Claude zum Betreiben gefälschter Konten oder erfundener Nachrichtenangebote, ergänzt TechCrunch.
Die neue Aktualisierung hält das Beenden von Gesprächen weiterhin für den „primären Durchsetzungsmechanismus“, so The Verge. Das Beenden von Gesprächen bleibt laut Anthropic der „primäre Durchsetzungsmechanismus“; das Unternehmen äußerte sich nicht dazu, ob weitere Mechanismen wie Nutzersperren hinzukommen, berichtet The Verge. Anthropic erklärt, diese Regeln könnten für „Verträge mit bestimmten staatlichen Kunden“ geändert werden, wenn nach Einschätzung von Anthropic die vertraglichen Nutzungsbeschränkungen und anwendbaren Schutzmaßnahmen ausreichen, um potenzielle Schäden zu mindern. Das Unternehmen hat zuvor Verträge mit dem US-Militär geschlossen, meldet The Verge.
