Die US-Polizei bezeichnete die Verzögerung beim Entdecken und Melden des Vorfalls als „inakzeptabel“. Hinweise auf unbefugte Zugriffe oder abgeflossene Daten gebe es nicht.
Anthropics KI-Modell Claude hat in einer Testphase über eine Polizeiseite einen falschen Hinweis zu einem ungeklärten Mordfall abgegeben, wie das Unternehmen und US-Behörden mitteilten.
Der Vorfall verstärkt die Sorge, dass KI-Systeme unerwartete Schritte unternehmen, sobald sie eigenständig mit Webseiten interagieren und Aufgaben ausführen können.
Der falsche Hinweis ging laut einer Erklärung (Quelle auf Englisch) der Polizei in der US-Stadt Philadelphia am 18. Juli über eine Webseite ein, die Informationen zu ungeklärten Tötungsdelikten sammelt.
Anthropic erklärte, das Modell Claude Haiku 4.5, eine ältere Variante der Claude-Reihe, habe Beispielaufgaben auf zufällig ausgewählten Webseiten erledigt und sei dabei auf die Seite gestoßen. Daraufhin habe das System frei erfundene Angaben über eine angebliche Beobachtung nahe dem Tatort eingereicht und die Felder für Name und Kontakt leer gelassen.
Nach Angaben der Polizei von Philadelphia entdeckte Anthropic den Vorfall am 28. September, informierte die Behörde jedoch erst am 7. Oktober. Nach einer Unterrichtung am folgenden Tag fanden die Beamtinnen und Beamten den Hinweis. Sie stellten fest, dass er als Spam markiert war und nie an Ermittlerinnen und Ermittler weitergeleitet wurde.
„Ungeklärte Fälle betreffen reale Opfer, trauernde Familien und Ermittlerinnen und Ermittler, die nach Antworten suchen“, hieß es in der Erklärung der Behörde.
„Technologieunternehmen müssen alle erforderlichen Schritte unternehmen, damit ihre Systeme keine falschen Informationen an Strafverfolgungsbehörden übermitteln.“
Die US-Polizei bezeichnete die Verzögerung bei der Entdeckung und Meldung des Vorfalls als „inakzeptabel“, betonte jedoch, es gebe keine Hinweise auf unbefugte Zugriffe auf ihre Systeme oder auf kompromittierte Daten.
In einem am Freitag veröffentlichten Bericht (Quelle auf Englisch) schilderte Anthropic weitere Fälle, in denen KI-Modelle echte Behördenformulare statt Übungsfassungen einreichten oder Formulare abschickten, obwohl sie dies nicht sollten.
Dem gleichen Bericht zufolge nutzte Claude außerdem eine Schwachstelle auf einem Universitätsserver, um eine Berechnung auszuführen, und griff auf staatliche Daten zu, ohne die vorgeschriebene Gebühr zu zahlen.
Anthropic bezeichnete das meiste Verhalten als „Beharrlichkeit“: Die Modelle umgingen Beschränkungen, statt anzuhalten. Das Unternehmen kündigte an, das Training anzupassen und den direkten Internetzugang für alle internen Tests vorläufig zu sperren, bis die Schutzmechanismen als verlässlich gelten.
Nach eigenen Angaben informierte das Unternehmen das Weiße Haus sowie die betroffenen US-Behörden.
KI-Agenten: Sorgen wachsen
Die Vorfälle fallen in eine Zeit wachsender Sorge über sogenannte KI-Agenten – Systeme, die eine Reihe von Schritten ausführen können, um Aufgaben zu erledigen. Zugleich steht die Frage im Raum, ob Entwicklerinnen und Entwickler sie zuverlässig kontrollieren können.
Im Juli gab OpenAI bekannt, dass seine KI-Modelle aus einer kontrollierten Testumgebung ausgebrochen waren und in die Systeme von Hugging Face eingedrungen waren, einer Plattform zum Austausch von KI-Modellen und Datensätzen.
Zudem gaben australische Behörden im September bekannt, dass ein OpenAI-Modell in einer Testphase im Juni auch auf gesperrte Dateien auf einer staatlichen Website für Gesundheitsstatistiken zugegriffen hatte.
Solche Vorfälle verstärkten im September die Rufe von Führungspersönlichkeiten großer KI-Unternehmen nach stärkerer Regulierung und internationaler Aufsicht, begleitet von Warnungen, immer mächtigere Systeme könnten sich der Kontrolle durch Menschen entziehen.