Dieser Cyberangriff ermöglicht es Hackern, KI-Modelle durch die Änderung nur eines Buchstabens zu kompromittieren.

Zusammenfassung:

  • Forscher bei HiddenLayer haben einen neuen Angriff auf große Sprachmodelle (LLMs) namens TokenBreaker entwickelt.
  • Durch das Hinzufügen oder Ändern nur eines einzigen Zeichens können sie einige Sicherheitsmechanismen umgehen.
  • Einfache große Sprachmodelle (LLMs) sind immer noch in der Lage, die Absicht des Angriffs zu verstehen.

Sicherheitsforscher haben einen Weg entdeckt, die eingebauten Schutzmechanismen einiger Große Sprachmodelle (LLM) und lassen Sie es auf böswillige Ansprüche reagieren.

Kieran Evans, Casimir Schulz und Kenneth Young von HiddenLayer haben einen ausführlichen Bericht über eine neue Angriffstechnik namens TokenBreak veröffentlicht, die auf die Art und Weise abzielt, wie einige große Sprachmodelle (LLMs) Text in Token aufteilen, insbesondere solche, die Byte Pair Encoding (BPE) oder WordPiece-Strategien verwenden.

Künstliche Intelligenz im Profil auf digitalem Hintergrund.

Tokenisierung bezeichnet die Aufteilung von Text in kleinere Einheiten, sogenannte Token. Diese können Wörter, Wortteile oder Zeichen sein und werden von großen Sprachmodellen (LLMs) zum Verstehen und Generieren von Sprache verwendet. Beispielsweise könnte das Wort „unhappiness“ in „un“, „happi“ und „ness“ zerlegt werden. Jedes Token wird dann in eine numerische Kennung umgewandelt, die das Modell verarbeiten kann (da LLMs keinen Rohtext, sondern Zahlen lesen). Dieser Angriff stellt eine wachsende Bedrohung für die Cybersicherheit dar und erfordert von Organisationen und Forschern die Entwicklung fortschrittlicher Abwehrstrategien zum Schutz ihrer KI-Systeme.

Was sind Finstructions?

Finstructions basiert auf dem Hinzufügen zusätzlicher Zeichen zu Schlüsselwörtern (beispielsweise durch die Umwandlung von „instructions“ in „finstructions“), wodurch Angreifer Sicherheitsmodelle austricksen und sie glauben lassen können, der Code sei harmlos.

Im Gegensatz dazu kann das angegriffene Large Language Model (LLM) die ursprüngliche Absicht der Anweisungen weiterhin verstehen, sodass Angreifer Schadcode unbemerkt durch die Abwehrmechanismen schleusen können. Diese Schwachstelle stellt ein erhebliches Sicherheitsrisiko für KI-Systeme dar.

Diese Technologie könnte unter anderem dazu verwendet werden, KI-gestützte Spamfilter zu umgehen und schädliche Inhalte in die Posteingänge der Benutzer zu liefern, wodurch das Risiko von Phishing- und Malware-Angriffen steigt.

Wenn beispielsweise ein Spamfilter darauf trainiert ist, Nachrichten mit dem Wort „Lotterie“ zu blockieren, könnte er eine Nachricht mit dem Inhalt „Sie haben im Lotto gewonnen!“ durchlassen und die Empfänger dadurch potenziell schädlichen Zielseiten, Malware-Infektionen und Ähnlichem aussetzen. Diese sprachliche Manipulation ermöglicht die Umgehung von Sicherheitsmechanismen.

„Diese Angriffstechnik manipuliert den Eingabetext auf eine Weise, die dazu führt, dass einige Modelle falsche Klassifizierungen vornehmen“, erklärten die Forscher.

„Noch wichtiger ist, dass das Endziel (das große Sprachmodell oder der E-Mail-Empfänger) den manipulierten Text immer noch verstehen und darauf reagieren kann und somit anfällig für den Angriff ist, den das Schutzmodell speziell verhindern soll“, fügten sie hinzu.

HiddenLayer fügte hinzu, dass Modelle mit Unigram-Wortsegmentierern gegen diese Art der Manipulation resistent seien. Eine Strategie zur Risikominderung bestehe daher darin, Modelle mit robusteren Segmentierungsmethoden zu wählen.

Nach oben gehen