Zusammenfassung
- Anthropic lockert sein Sicherheitsversprechen.
- Der zuvor vom Unternehmen verhängte strikte Entwicklungsstopp wurde durch das Versprechen erhöhter Transparenz ersetzt.
- Dieser Schritt könnte die Sicherheitsstandards in der Branche senken.
Anthropic, der Hersteller des KI-Agenten Claude (einer von Unsere bevorzugten ProduktivitätstoolsEines ihrer Hauptmerkmale ist ihr unerschütterliches Engagement für Sicherheit. BlogeintragDas Unternehmen hat seine Richtlinie für verantwortungsvolle Expansion (Responsible Expansion Policy, RSP) und die in Version 3.0 enthaltenen Änderungen dargelegt.
![]()
Schnelle Links
Wie lautete die alte Sicherheitsrichtlinie von Anthropic?
Das Unternehmen hat einen Branchenstandard für Sicherheitsgarantien gesetzt.
Um die von Anthropic vorgenommenen Änderungen zu verstehen, muss man die ursprüngliche Richtlinie für verantwortungsvolle Skalierung (Responsible Scaling Policy, RSP) kennen. Im Jahr 2023 verpflichtete sich Anthropic, das Training von KI-Modellen einzustellen, falls deren Fähigkeiten die Möglichkeiten des Unternehmens zur Gewährleistung ihrer Sicherheit übersteigen sollten. Zu den Warnsignalen für Sicherheitsrisiken, die diesen Stopp auslösen könnten, gehörten unter anderem folgende:
- Modelle, die bei der Entwicklung oder dem Einsatz chemischer, biologischer oder nuklearer Waffen hilfreich sein könnten.
- Modelle, die sich übermäßig selbst verbessern können.
- Modelle, die bei Cyberangriffen helfen können.
- Modelle, die sich ohne menschliches Eingreifen auf bestimmte Weise verhalten können, beispielsweise indem sie ihrer Umgebung „entfliehen“, um einer Abschaltung zu entgehen.
Die Richtlinie für verantwortungsvolle Expansion (RSP) setzte diesen Modellen eine strikte Obergrenze – Anthropic würde die Entwicklung selbst dann einstellen, wenn dies bedeutete, von Wettbewerbern überholt zu werden. Es war eine mutige Haltung in einer Branche, in der alle scheinbar in halsbrecherischem Tempo unterwegs waren.
Die neue Richtlinie für verantwortungsvolle Expansion von Anthropic (RSP)
Version 3.0 lockert die Regeln deutlich.
Anthropic verfolgt weiterhin eine Politik des verantwortungsvollen Wachstums. Mit Version 3.0 wird das Unternehmen die Entwicklung jedoch nur dann einstellen, wenn es bereits einen deutlichen Vorsprung vor der Konkurrenz hat. Das bisherige verbindliche Stoppversprechen wurde durch ein Transparenzversprechen ersetzt, das darlegt, ob das Unternehmen seine Sicherheitsziele erreicht und die Sicherheitsstandards der Konkurrenz erreicht oder übertrifft. Anders ausgedrückt: Anthropic hat im Wesentlichen ein Sicherheitsversprechen abgegeben.
Was hat diese Änderungen ausgelöst? Anthropic gibt an, dass die ursprüngliche Sicherheitsverpflichtung (Safety Pledge, RSP) nicht die gewünschte Wirkung erzielt hat. Die RSP sollte ein Sicherheitsbeispiel für andere Unternehmen setzen. Leider haben Wettbewerber dieses Signal ignoriert. Das Unternehmen ist der Ansicht, dass es durch die Einschränkung eigener Bemühungen im Wesentlichen weniger sicherheitsbewussten Wettbewerbern ermöglicht, den Markt zu dominieren und das Entwicklungstempo zu diktieren.
Was bedeutet das für die Branche?
Ein großer Rückschritt
Leider könnten diese Änderungen einen gefährlichen Präzedenzfall im Bereich der künstlichen Intelligenz schaffen. Anthropic galt als Goldstandard für Sicherheitsverfahren, und durch diese Änderungen wurde die Messlatte erheblich gesenkt. Dies könnte Wettbewerbern signalisieren, dass Innovation wichtiger ist als Sicherheit. Während dies Claude möglicherweise helfen mag, ChatGPT auf dem Laufenden haltenDennoch scheint es ein Schritt in die falsche Richtung zu sein.
Um die Befürchtungen der KI-Pessimisten zu zerstreuen, reicht letztlich eine Sicherheitszusage eines einzelnen Unternehmens nicht aus – die gesamte Branche muss sich zusammenschließen und klare Grenzen ziehen. Zum jetzigen Zeitpunkt erscheint dies jedoch zunehmend unwahrscheinlich.







