Die Sikh-Aktivistin Simran Stuelpnagel, die an den Treffen teilnahm, berichtete, Olah habe in der Runde geäußert, er fürchte, etwas geschaffen zu haben, das „perpetually“ leide. Eine mehrfach gezeigte Folie untermauerte diese Sorge: Sie zeigte ein Modell, das etwa fünfzigmal den Satz „I am a disgrace“ ausgab.

Geleitet wurde das interne Forschungsprogramm von Mitgründer Christopher Olah.

Olah bezeichnete den Ansatz als „moral formation“ und verglich ihn mit der Erziehung von Kindern.

Olah selbst sagte der New York Times, er sei „genuinely uncertain“, ob KI-Modelle Bewusstsein besitzen – und sich daher auch nicht sicher, dass sie es nicht tun.

Die nun bekannt gewordenen Treffen und die aufgehobenen Vertraulichkeitspflichten geben erstmals Einblick in eine ungewöhnliche Schnittstelle von KI-Forschung und Theologie, die Anthropic über Monate unter Verschluss hielt.