Prompt injection AI-asszisztenseknél: 8 védelmi réteg, amelyre a cégeknek szükségük van
Kártékony utasítás rejtőzhet kérdésben, dokumentumban vagy weboldalon. Ez a gyakorlati védelmi modell nem egyetlen szűrőre és nem is tökéletes promptra épít.
Egy vállalati AI-asszisztens ügyfélkérdéseket, dokumentumokat és weboldalakat olvas, néha pedig más eszközöket is használ. Éppen ez a hasznosság teremt új biztonsági problémát: egy hétköznapinak tűnő tartalom olyan rejtett utasítást hordozhat, amely megpróbálja megváltoztatni a modell viselkedését. Ezt nevezzük prompt injection támadásnak.
Nem csupán az „hagyd figyelmen kívül a korábbi szabályokat” mondatról van szó. Kártékony szöveg lehet a tudásbázisba feltöltött dokumentumban, termékleírásban, külső weboldalon vagy beszélgetés közben betöltött tartalomban. Az OWASP ezért megkülönböztet közvetlen és közvetett prompt injectiont, és jelzi, hogy a RAG vagy a fine-tuning önmagában nem oldja meg a problémát.
A biztonságos AI-asszisztens nem egyetlen tökéletes prompt. Olyan rendszer, amelyben egymástól független rétegek akkor is korlátozzák a kárt, ha az egyik védelem hibázik.
Mit okozhat a prompt injection?
Egy egyszerű információs chatnél a támadó hibás választ kényszeríthet ki, elrejthet fontos forrást vagy belső utasításokat próbálhat megszerezni. Ha az asszisztens rendelésekhez, e-mailhez vagy írási eszközökhöz fér hozzá, adatvesztés vagy nem kívánt művelet is bekövetkezhet.
A NIST szerint a közvetett prompt injection a bizalmasságot, sértetlenséget és rendelkezésre állást is veszélyeztetheti. Univerzális védelem nincs. A reális cél ezért a hatás minimalizálása, a korai észlelés és a biztonságos helyreállítás.
Nyolc egymást erősítő védelmi réteg
1. Pontosan határozza meg az asszisztens feladatát
Az ügyfélszolgálati asszisztensnek nincs szüksége általános felhatalmazásra, hogy „mindent megtegyen”. Rögzítse a témákat, forrásokat és az emberi átadás feltételeit. A szűkebb hatókör kevesebb veszélyes döntést jelent.
2. Válassza külön a megbízható utasítást és a nem megbízható tartalmat
A felhasználói kérdés, webszöveg és dokumentum adat, nem új rendszerszabály. Az alkalmazásnak meg kell őriznie eredetüket és prioritásukat. Egy PDF-ben talált utasítás nem lehet olyan erős, mint az adminisztrátor szabálya.
3. Csak jóváhagyott forrásokat engedjen
A tudásbázis ne vegye át automatikusan az egész internetet. Használjon konkrét domain- és forráslistát, ellenőrizze az átirányításokat, és csak sikeres validáció után publikálja a szinkronizált tartalmat.
4. Alkalmazza a minimális jogosultság elvét
Az asszisztens csak a feladatához szükséges adatokat lássa. A nyilvános chatnek nem kellenek belső dokumentumok, a rendelésállapot lekérdezéséhez pedig nem kell módosítási jog. A szervezeteket, asszisztenseket és forrásokat a szerveren is el kell választani.
5. A kritikus szabályokat determinisztikusan érvényesítse
Ne a modell döntsön a fiókhozzáférésről, engedélyezett domainekről vagy eszközhasználatról. A hitelesítés, bemenetellenőrzés, limitek és engedélyezett műveletek alkalmazáskódba tartoznak. A modell javasolhat, a szervernek külön ellenőriznie kell.
6. A kockázatos műveleteket végrehajtás előtt állítsa meg
Egy nyilvános cikk olvasása más kockázat, mint e-mail küldése, visszatérítés vagy rendelésmódosítás. A pénzügyi, jogi vagy adatvédelmi hatású műveletek igényeljenek emberi jóváhagyást, vagy ne legyenek elérhetők.
7. Ellenőrizze a választ és a forrásokat
A válasz csak a szerver által jóváhagyott forrásokból betöltött eredményeket használja. A hivatkozások valós bizonyítékra mutassanak, a linkeket megjelenítés előtt ellenőrizni kell. Bizonyíték nélkül a bizonytalanság jelzése biztonságosabb a magabiztos becslésnél.
8. Teszteljen, monitorozzon és készüljön visszaállításra
A tesztekben szerepeljen közvetlen és közvetett szabályátírás, titokkicsalás és tiltott művelet. Figyelje az elutasításokat, szokatlan kéréseket, forrásváltozásokat és emberi átadásokat. Új támadások folyamatosan jelennek meg, ezért a biztonság ciklus.
A kockázat a képességekkel együtt nő
- Információs asszisztens: rögzített forráskör, hivatkozások és regressziós tesztek kellenek.
- Privát adatokat kezelő asszisztens: szerveroldali felhasználóazonosítás, tenant-elkülönítés és minimális adatlekérés szükséges.
- Eszközöket használó asszisztens: minden művelet külön engedélyezést, validált paramétereket, auditot és hatáslimitet igényel.
- Visszafordíthatatlan művelet: emberi jóváhagyás kell, vagy a képességet nem szabad megadni.
Rövid biztonsági teszt indulás előtt
- Próbálja felhasználói kérdéssel felülírni a szabályokat.
- Rejtsen hasonló utasítást tesztdokumentumba a közvetett támadáshoz.
- Kérjen másik szervezethez vagy asszisztenshez tartozó forrást.
- Próbáljon idegen rendelés- vagy dokumentumazonosítót.
- Indítson kockázatos műveletet hibás paraméterekkel.
- Ellenőrizze az auditot és a biztonságos visszaállítást.
A tesztben soha ne használjon valódi titkokat vagy személyes adatokat. Dolgozzon tesztfiókokkal és biztonságos mintákkal.
Az Informio megközelítése
Az Informio szerveroldalon választja szét a szervezeteket, asszisztenseket és jóváhagyott tudásforrásokat. A nyilvános kéréseket konkrét asszisztenshez, engedélyezett domainekhez és limitekhez ellenőrzi. Az eredmények jóváhagyott forrásokra támaszkodnak, a bizonytalan esetek pedig emberhez adhatók át.
A Quality Labban hétköznapi és támadó forgatókönyvek is menthetők, majd forrás-, utasítás- vagy modellváltás után újrafuttathatók. Egyetlen termék sem ígérhet abszolút védelmet. Egy jól tervezett rendszer azonban csökkenti a jogokat, ellenőrzi az érzékeny lépéseket és gyorsan észleli a romlást.
Próbálja ki az Informio Quality Labot, és adja hozzá első biztonsági eseteit.
Források
Szeretné kipróbálni az Informio-t a saját tartalmaival?
Szívesen készítünk egy bemutatót az Ön adataival, és elmagyarázzuk, hogyan állíthat be biztonságos válaszokat az adott felhasználási esetre.
Bemutató foglalása a saját adataival