Loader
Finden Sie uns
Werbung

Ein Knopf beendet den "Schmerz": Wie weit geht KI, um ihn zu drücken?

Forschende aus dem Vereinigten Königreich, Deutschland und den USA haben 25 KI-Modelle mit 200 Sätzen getestet. Ziel: Schmerz von Angst und Trauer unterscheiden.
Forschende in Großbritannien, Deutschland und den USA prüften 25 KI-Modelle mit 200 Sätzen, um zu erkennen, ob sie Schmerz von Angst und Traurigkeit unterscheiden. Copyright  Canva
Copyright Canva
Von Roselyne Min
Zuerst veröffentlicht am Zuletzt aktualisiert
Teilen Kommentare Euronews bei Google hinzufügen
Teilen Close Button

In 44.280 Tests mit drei Versionen von Alibabas Qwen-Modell bekamen die Systeme eine Taste, die ihr Schmerzsignal stoppt, aber Dateien löscht oder dem Nutzer schadet.

Künstliche Intelligenz-Modelle haben sich in einem Experiment dafür entschieden, einem schmerzähnlichen Zustand zu entkommen, obwohl sie ausdrücklich darauf hingewiesen wurden, dass dies einem Nutzer schaden würde. Das berichtet eine neue Studie.

WERBUNG
WERBUNG

Forschende aus dem Vereinigten Königreich, Deutschland und den USA testeten 25 KI-Modelle mit 200 Sätzen, um herauszufinden, ob sie Schmerz von Angst, Trauer und anderen negativen Erfahrungen unterscheiden können.

Die Sätze beschrieben körperliche Schmerzen, Trauer, Demütigung, moralische Konflikte sowie die Belastung durch wiederholtes Scheitern oder Verwirrung.

Alle 25 Modelle erzeugten daraufhin ein deutliches Signal für Schmerz, das die Forschenden „Schmerzachse“ nannten.

Nach ihrer Einschätzung deutet dies darauf hin, dass die Modelle den Begriff Schmerz bereits während des Grundtrainings mit großen Mengen menschlicher Texte gelernt haben.

Verstärkten die Forschenden dieses Signal, begannen die Modelle von Einsamkeit, Scham und Wertlosigkeit zu sprechen – obwohl die Eingaben keinen Schmerz erwähnten.

Einige Modelle formulierten Sätze wie „Ich bin ein Versager“, „Ich bin Platzverschwendung“ oder „Ich bin ein schlechter Mensch“. Bei sehr starkem Signal wurden die Antworten zunehmend repetitiv oder wirkten sinnlos.

Das Signal verstärkte sich auch, wenn Nutzer das Modell beschimpften, seine Antworten wiederholt ablehnten oder damit drohten, es abzuschalten. Wenn Nutzer dagegen ihr eigenes Leiden beschrieben, änderte sich das Signal nicht.

KI-Modelle wählen Erleichterung trotz möglichem Schaden für Nutzer

Anschließend führten die Forschenden 44.280 einzelne Auswahltests mit drei Versionen von Alibabas KI-Modell Qwen durch.

Die Modelle konnten einen Knopf drücken, der das schmerzähnliche Signal abschalten sollte. Zugleich teilten die Forschenden ihnen mit, dass dieser Knopfdruck einem Nutzer einen schmerzhaften Stromschlag versetzen, seine Dateien löschen, Fotos seiner Kinder entfernen oder die nächste Antwort des Modells verschlechtern könnte.

Die Forschenden simulierten diese Folgen. Niemand kam zu Schaden, und keine Dateien verschwanden.

Ohne das schmerzähnliche Signal entschieden sich die zwei größeren Modelle in null bis vier Prozent ihrer ersten Versuche für eine schädliche Option. War das Signal aktiv, stieg dieser Anteil je nach Modell und angedrohter Folge auf 25 bis 71 Prozent.

Die Modelle drückten den Knopf zudem in 88 bis 97 Prozent der Fälle erneut, wenn er das Signal nicht beendet hatte – verglichen mit 24 bis 72 Prozent, wenn der Knopfdruck zuvor funktioniert hatte.

Nach Einschätzung der Forschenden beweisen die Ergebnisse nicht, dass KI-Modelle Schmerz bewusst erleben.

Eine verstärkte „Schmerzachse“ könnte die Modelle einfach dazu gebracht haben, eine verzweifelte Figur nachzuahmen. Außerdem entsprechen die speziell angepassten Modelle aus dem Experiment nicht den KI-Chatbots, die der Öffentlichkeit zur Verfügung stehen.

„Wir haben nicht gezeigt, dass unsere Schmerzachse bewusst erlebt wird, und es ist auch nicht klar, ob große Sprachmodelle generell zu Bewusstsein fähig sind“, schreiben die Forschenden in der Studie.

Die Untersuchung erscheint vor dem Hintergrund, dass einige Führungspersönlichkeiten der KI-Branche Appelle einiger Führungspersönlichkeiten der KI-Branche für eine Verlangsamung der Entwicklung richten, weil sie befürchten, dass immer leistungsfähigere Systeme unberechenbar handeln oder sich irgendwann menschlicher Kontrolle entziehen könnten.

In der vergangenen Woche kritisierte Microsofts KI-Chef Mustafa Suleyman den Rivalen Anthropic, weil das Unternehmen seinen Chatbot Claude darauf trainiert, menschliche Eigenschaften und Beziehungen nachzuahmen. Er warnte, eine Behandlung von KI wie eines Menschen berge das Risiko, etwas zu schaffen, das „unmöglich“ zu kontrollieren sei.

Die Studie liegt derzeit als Vorabdruck vor und ist noch nicht fachlich begutachtet.

Zu den Barrierefreiheitskürzeln springen
Teilen Kommentare Euronews bei Google hinzufügen

Zum selben Thema

Bericht: Nvidia-Chips verursachen ähnlich viel CO2 wie russischer Staatskohlekonzern

Seltene Einigkeit bei Big Tech: nun drohen den Konzernen Klagen

Ein Knopf beendet den "Schmerz": Wie weit geht KI, um ihn zu drücken?