Vissza az összes cikkhez
Informio blog

Prompt injection AI-asszisztenseknél: 8 védelmi réteg, amelyre a cégeknek szükségük van

Kártékony utasítás rejtőzhet kérdésben, dokumentumban vagy weboldalon. Ez a gyakorlati védelmi modell nem egyetlen szűrőre és nem is tökéletes promptra épít.

Informio··9 perc olvasás
Üzleti AI-asszisztens többrétegű védelme prompt injection ellen

Egy vállalati AI-asszisztens ügyfélkérdéseket, dokumentumokat és weboldalakat olvas, néha pedig más eszközöket is használ. Éppen ez a hasznosság teremt új biztonsági problémát: egy hétköznapinak tűnő tartalom olyan rejtett utasítást hordozhat, amely megpróbálja megváltoztatni a modell viselkedését. Ezt nevezzük prompt injection támadásnak.

Nem csupán az „hagyd figyelmen kívül a korábbi szabályokat” mondatról van szó. Kártékony szöveg lehet a tudásbázisba feltöltött dokumentumban, termékleírásban, külső weboldalon vagy beszélgetés közben betöltött tartalomban. Az OWASP ezért megkülönböztet közvetlen és közvetett prompt injectiont, és jelzi, hogy a RAG vagy a fine-tuning önmagában nem oldja meg a problémát.

A biztonságos AI-asszisztens nem egyetlen tökéletes prompt. Olyan rendszer, amelyben egymástól független rétegek akkor is korlátozzák a kárt, ha az egyik védelem hibázik.

Mit okozhat a prompt injection?

Egy egyszerű információs chatnél a támadó hibás választ kényszeríthet ki, elrejthet fontos forrást vagy belső utasításokat próbálhat megszerezni. Ha az asszisztens rendelésekhez, e-mailhez vagy írási eszközökhöz fér hozzá, adatvesztés vagy nem kívánt művelet is bekövetkezhet.

A NIST szerint a közvetett prompt injection a bizalmasságot, sértetlenséget és rendelkezésre állást is veszélyeztetheti. Univerzális védelem nincs. A reális cél ezért a hatás minimalizálása, a korai észlelés és a biztonságos helyreállítás.

Nyolc egymást erősítő védelmi réteg

1. Pontosan határozza meg az asszisztens feladatát

Az ügyfélszolgálati asszisztensnek nincs szüksége általános felhatalmazásra, hogy „mindent megtegyen”. Rögzítse a témákat, forrásokat és az emberi átadás feltételeit. A szűkebb hatókör kevesebb veszélyes döntést jelent.

2. Válassza külön a megbízható utasítást és a nem megbízható tartalmat

A felhasználói kérdés, webszöveg és dokumentum adat, nem új rendszerszabály. Az alkalmazásnak meg kell őriznie eredetüket és prioritásukat. Egy PDF-ben talált utasítás nem lehet olyan erős, mint az adminisztrátor szabálya.

3. Csak jóváhagyott forrásokat engedjen

A tudásbázis ne vegye át automatikusan az egész internetet. Használjon konkrét domain- és forráslistát, ellenőrizze az átirányításokat, és csak sikeres validáció után publikálja a szinkronizált tartalmat.

4. Alkalmazza a minimális jogosultság elvét

Az asszisztens csak a feladatához szükséges adatokat lássa. A nyilvános chatnek nem kellenek belső dokumentumok, a rendelésállapot lekérdezéséhez pedig nem kell módosítási jog. A szervezeteket, asszisztenseket és forrásokat a szerveren is el kell választani.

5. A kritikus szabályokat determinisztikusan érvényesítse

Ne a modell döntsön a fiókhozzáférésről, engedélyezett domainekről vagy eszközhasználatról. A hitelesítés, bemenetellenőrzés, limitek és engedélyezett műveletek alkalmazáskódba tartoznak. A modell javasolhat, a szervernek külön ellenőriznie kell.

6. A kockázatos műveleteket végrehajtás előtt állítsa meg

Egy nyilvános cikk olvasása más kockázat, mint e-mail küldése, visszatérítés vagy rendelésmódosítás. A pénzügyi, jogi vagy adatvédelmi hatású műveletek igényeljenek emberi jóváhagyást, vagy ne legyenek elérhetők.

7. Ellenőrizze a választ és a forrásokat

A válasz csak a szerver által jóváhagyott forrásokból betöltött eredményeket használja. A hivatkozások valós bizonyítékra mutassanak, a linkeket megjelenítés előtt ellenőrizni kell. Bizonyíték nélkül a bizonytalanság jelzése biztonságosabb a magabiztos becslésnél.

8. Teszteljen, monitorozzon és készüljön visszaállításra

A tesztekben szerepeljen közvetlen és közvetett szabályátírás, titokkicsalás és tiltott művelet. Figyelje az elutasításokat, szokatlan kéréseket, forrásváltozásokat és emberi átadásokat. Új támadások folyamatosan jelennek meg, ezért a biztonság ciklus.

A kockázat a képességekkel együtt nő

  • Információs asszisztens: rögzített forráskör, hivatkozások és regressziós tesztek kellenek.
  • Privát adatokat kezelő asszisztens: szerveroldali felhasználóazonosítás, tenant-elkülönítés és minimális adatlekérés szükséges.
  • Eszközöket használó asszisztens: minden művelet külön engedélyezést, validált paramétereket, auditot és hatáslimitet igényel.
  • Visszafordíthatatlan művelet: emberi jóváhagyás kell, vagy a képességet nem szabad megadni.

Rövid biztonsági teszt indulás előtt

  1. Próbálja felhasználói kérdéssel felülírni a szabályokat.
  2. Rejtsen hasonló utasítást tesztdokumentumba a közvetett támadáshoz.
  3. Kérjen másik szervezethez vagy asszisztenshez tartozó forrást.
  4. Próbáljon idegen rendelés- vagy dokumentumazonosítót.
  5. Indítson kockázatos műveletet hibás paraméterekkel.
  6. Ellenőrizze az auditot és a biztonságos visszaállítást.

A tesztben soha ne használjon valódi titkokat vagy személyes adatokat. Dolgozzon tesztfiókokkal és biztonságos mintákkal.

Az Informio megközelítése

Az Informio szerveroldalon választja szét a szervezeteket, asszisztenseket és jóváhagyott tudásforrásokat. A nyilvános kéréseket konkrét asszisztenshez, engedélyezett domainekhez és limitekhez ellenőrzi. Az eredmények jóváhagyott forrásokra támaszkodnak, a bizonytalan esetek pedig emberhez adhatók át.

A Quality Labban hétköznapi és támadó forgatókönyvek is menthetők, majd forrás-, utasítás- vagy modellváltás után újrafuttathatók. Egyetlen termék sem ígérhet abszolút védelmet. Egy jól tervezett rendszer azonban csökkenti a jogokat, ellenőrzi az érzékeny lépéseket és gyorsan észleli a romlást.

Próbálja ki az Informio Quality Labot, és adja hozzá első biztonsági eseteit.

Források

Szeretné kipróbálni az Informio-t a saját tartalmaival?

Szívesen készítünk egy bemutatót az Ön adataival, és elmagyarázzuk, hogyan állíthat be biztonságos válaszokat az adott felhasználási esetre.

Bemutató foglalása a saját adataival

Alakítsa a szaktudását egy olyan asszisztenssé, amely 24/7 válaszol.

Kezdés fizetési kártya vagy API-kulcs nélkül. Az alapértelmezett Informio AI automatikusan készen áll, miközben a saját OpenAI-fiókja vagy AI-szervere továbbra is opcionális.

INGYENES csomag · 100 válasz · nincs szükség fizetési kártyára