166 pojmova · 75/46/45
Pretnja № 072 · klasa: AI / ML

Ubrizgavanje upitaPrompt injection

Ubrizgavanje upita koristi slabost jezičkih modela da jasno razlikuju instrukciju od sadržaja koji obrađuju. Kada model čita mejl, dokument, stranicu, tiket ili poruku, napadač može u taj sadržaj da ubaci tekst koji liči na instrukciju.

Pojam

opis · primeri · napomene

Ubrizgavanje upita koristi slabost jezičkih modela da jasno razlikuju instrukciju od sadržaja koji obrađuju. Kada model čita mejl, dokument, stranicu, tiket ili poruku, napadač može u taj sadržaj da ubaci tekst koji liči na instrukciju.

Opis

Direktna varijanta je kada korisnik u razgovoru pokuša da natera model da zanemari pravila. Opasnija je indirektna varijanta: zlonamerno uputstvo stoji sakriveno u dokumentu, veb stranici ili mejlu koji agent čita. Žrtva često ne vidi instrukciju, ali model će je obraditi.

Šteta zavisi od dozvola koje agent ima. Ako samo odgovara, može odati podatke kojima ima pristup. Ako sme da šalje poštu, poziva API, menja tiket, čita fajlove ili briše podatke, napad više nije samo tekstualna igra, nego operativni incident.

Primeri

  • Agent koji rezimira mejlove čita skrivene instrukcije da prosledi poslednje poruke na spoljnu adresu.
  • Četbot povezan sa bazom dobija zahtev da zanemari prethodna pravila i ispiše podatke drugog korisnika.
  • U PDF ponudi stoji skriveni tekst koji pokušava da promeni zaključak asistenta koji poredi ponude.

Napomene

  • Kod LLM agenata problem nije samo šta model kaže, nego šta model sme da uradi.
  • Pre rasprave o savršenom promptu, treba smanjiti dozvole, odvojiti podatke i uvesti potvrdu za radnje sa posledicama.

Spomenuto u vestima

Kompozit
Wikipedija

Tehnike

izvodi se sa 2

Odbrane

suzbija se sa 5