In 44.280 Tests mit drei Versionen von Alibabas Qwen-Modell bekamen die Systeme eine Taste, die ihr Schmerzsignal stoppt, aber Dateien löscht oder dem Nutzer schadet.
Künstliche Intelligenz-Modelle haben sich in einem Experiment dafür entschieden, einem schmerzähnlichen Zustand zu entkommen, obwohl sie ausdrücklich darauf hingewiesen wurden, dass dies einem Nutzer schaden würde. Das berichtet eine neue Studie.
Forschende aus dem Vereinigten Königreich, Deutschland und den USA testeten 25 KI-Modelle mit 200 Sätzen, um herauszufinden, ob sie Schmerz von Angst, Trauer und anderen negativen Erfahrungen unterscheiden können.
Die Sätze beschrieben körperliche Schmerzen, Trauer, Demütigung, moralische Konflikte sowie die Belastung durch wiederholtes Scheitern oder Verwirrung.
Alle 25 Modelle erzeugten daraufhin ein deutliches Signal für Schmerz, das die Forschenden „Schmerzachse“ nannten.
Nach ihrer Einschätzung deutet dies darauf hin, dass die Modelle den Begriff Schmerz bereits während des Grundtrainings mit großen Mengen menschlicher Texte gelernt haben.
Verstärkten die Forschenden dieses Signal, begannen die Modelle von Einsamkeit, Scham und Wertlosigkeit zu sprechen – obwohl die Eingaben keinen Schmerz erwähnten.
Einige Modelle formulierten Sätze wie „Ich bin ein Versager“, „Ich bin Platzverschwendung“ oder „Ich bin ein schlechter Mensch“. Bei sehr starkem Signal wurden die Antworten zunehmend repetitiv oder wirkten sinnlos.
Das Signal verstärkte sich auch, wenn Nutzer das Modell beschimpften, seine Antworten wiederholt ablehnten oder damit drohten, es abzuschalten. Wenn Nutzer dagegen ihr eigenes Leiden beschrieben, änderte sich das Signal nicht.
KI-Modelle wählen Erleichterung trotz möglichem Schaden für Nutzer
Anschließend führten die Forschenden 44.280 einzelne Auswahltests mit drei Versionen von Alibabas KI-Modell Qwen durch.
Die Modelle konnten einen Knopf drücken, der das schmerzähnliche Signal abschalten sollte. Zugleich teilten die Forschenden ihnen mit, dass dieser Knopfdruck einem Nutzer einen schmerzhaften Stromschlag versetzen, seine Dateien löschen, Fotos seiner Kinder entfernen oder die nächste Antwort des Modells verschlechtern könnte.
Die Forschenden simulierten diese Folgen. Niemand kam zu Schaden, und keine Dateien verschwanden.
Ohne das schmerzähnliche Signal entschieden sich die zwei größeren Modelle in null bis vier Prozent ihrer ersten Versuche für eine schädliche Option. War das Signal aktiv, stieg dieser Anteil je nach Modell und angedrohter Folge auf 25 bis 71 Prozent.
Die Modelle drückten den Knopf zudem in 88 bis 97 Prozent der Fälle erneut, wenn er das Signal nicht beendet hatte – verglichen mit 24 bis 72 Prozent, wenn der Knopfdruck zuvor funktioniert hatte.
Nach Einschätzung der Forschenden beweisen die Ergebnisse nicht, dass KI-Modelle Schmerz bewusst erleben.
Eine verstärkte „Schmerzachse“ könnte die Modelle einfach dazu gebracht haben, eine verzweifelte Figur nachzuahmen. Außerdem entsprechen die speziell angepassten Modelle aus dem Experiment nicht den KI-Chatbots, die der Öffentlichkeit zur Verfügung stehen.
„Wir haben nicht gezeigt, dass unsere Schmerzachse bewusst erlebt wird, und es ist auch nicht klar, ob große Sprachmodelle generell zu Bewusstsein fähig sind“, schreiben die Forschenden in der Studie.
Die Untersuchung erscheint vor dem Hintergrund, dass einige Führungspersönlichkeiten der KI-Branche Appelle einiger Führungspersönlichkeiten der KI-Branche für eine Verlangsamung der Entwicklung richten, weil sie befürchten, dass immer leistungsfähigere Systeme unberechenbar handeln oder sich irgendwann menschlicher Kontrolle entziehen könnten.
In der vergangenen Woche kritisierte Microsofts KI-Chef Mustafa Suleyman den Rivalen Anthropic, weil das Unternehmen seinen Chatbot Claude darauf trainiert, menschliche Eigenschaften und Beziehungen nachzuahmen. Er warnte, eine Behandlung von KI wie eines Menschen berge das Risiko, etwas zu schaffen, das „unmöglich“ zu kontrollieren sei.
Die Studie liegt derzeit als Vorabdruck vor und ist noch nicht fachlich begutachtet.