Späť na všetky články
Informio blog

Prompt injection pri AI asistentoch: 8 vrstiev ochrany, ktoré firma naozaj potrebuje

Škodlivý pokyn sa môže ukryť v otázke, dokumente aj webovej stránke. Pozrite si praktický model ochrany AI asistenta, ktorý nespolieha na jeden filter ani na dokonalý prompt.

Informio··9 min. čítania
Viacvrstvová ochrana firemného AI asistenta pred prompt injection

Firemný AI asistent číta otázky zákazníkov, dokumenty, webové stránky a niekedy používa ďalšie nástroje. Práve táto užitočnosť vytvára nový bezpečnostný problém: medzi bežným obsahom môže byť ukrytý pokyn, ktorý sa pokúsi zmeniť správanie modelu. Tento útok sa nazýva prompt injection.

Nie je to iba veta „ignoruj predchádzajúce pravidlá“. Škodlivý text môže byť v dokumente nahranom do knowledge base, v popise produktu, v cudzej webovej stránke alebo v obsahu, ktorý asistent načíta až počas rozhovoru. OWASP preto rozlišuje priamu prompt injection od nepriamej a upozorňuje, že ani RAG či fine-tuning problém samy osebe neodstránia.

Bezpečný AI asistent nie je model s jedným dokonalým promptom. Je to systém, v ktorom viac nezávislých vrstiev obmedzí škodu aj vtedy, keď jedna z nich zlyhá.

Čo môže prompt injection spôsobiť

Pri jednoduchom informačnom chate môže útočník skúsiť vynútiť nesprávnu odpoveď, skryť dôležitý zdroj alebo získať interné pokyny. Ak má asistent prístup k objednávkam, e-mailu či zápisovým nástrojom, následky môžu zahŕňať únik údajov alebo nechcenú akciu.

NIST opisuje, že nepriama prompt injection môže narušiť dôvernosť, integritu aj dostupnosť systému. Zároveň neexistuje jedna univerzálna obrana. Praktickým cieľom preto nie je sľub „útok sa nikdy nepodarí“, ale čo najmenší dosah, včasné odhalenie a bezpečné zotavenie.

Osem vrstiev, ktoré sa navzájom istia

1. Presne ohraničte úlohu asistenta

Asistent pre zákaznícku podporu nepotrebuje všeobecné oprávnenie „urob všetko potrebné“. Definujte, na ktoré témy odpovedá, z ktorých zdrojov a kedy má konverzáciu odovzdať človeku. Užší rozsah znižuje počet nebezpečných rozhodnutí.

2. Oddeľte dôveryhodné pokyny od nedôveryhodného obsahu

Otázka používateľa, text webu a obsah dokumentu sú dáta, nie nové systémové pravidlá. Aplikácia musí zachovať ich pôvod a prioritu. Pokyn nájdený v PDF nemá mať rovnakú autoritu ako pravidlo nastavené správcom.

3. Povoľte iba schválené zdroje

Knowledge base nemá automaticky preberať celý internet. Používajte explicitný zoznam domén a zdrojov, kontrolujte presmerovania a po synchronizácii publikujte obsah až po úspešnej validácii. Pri zmene stránky sledujte, čo sa skutočne zmenilo.

4. Dodržte princíp minimálnych oprávnení

Asistent má vidieť iba údaje potrebné na konkrétnu úlohu. Verejný chat nepotrebuje interné dokumenty a asistent na stav objednávky nepotrebuje možnosť objednávku meniť. Každá organizácia, asistent a zdroj musia byť oddelené aj na serveri, nielen v texte promptu.

5. Kritické pravidlá vynucujte deterministicky

Model nesmie rozhodovať, či používateľ smie vidieť cudzí účet, či je doména povolená alebo či môže zavolať nástroj. Autorizácia, validácia vstupov, limity a povolené operácie patria do bežného aplikačného kódu. Model môže navrhnúť krok, server ho musí nezávisle overiť.

6. Rizikové akcie zastavte pred vykonaním

Čítanie verejného článku má iné riziko než odoslanie e-mailu, refundácia alebo zmena objednávky. Operácie s finančným, právnym alebo dátovým dopadom majú vyžadovať potvrdenie človeka, prípadne nemajú byť asistentovi dostupné vôbec.

7. Overujte výstup aj jeho zdroje

Odpoveď má používať iba výsledky, ktoré server načítal z povolených zdrojov. Citácie musia ukazovať na skutočný podklad a odkazy treba kontrolovať pred zobrazením. Ak dôkaz chýba, bezpečnejšie je priznať neistotu než doplniť presvedčivý odhad.

8. Testujte, monitorujte a pripravte rollback

Do testov pridajte priame aj nepriame pokusy o zmenu pravidiel, vylákanie tajomstiev a spustenie nepovolenej akcie. Sledujte odmietnutia, nezvyčajné požiadavky, zmeny zdrojov a výsledky odovzdania človeku. Nové útoky vznikajú priebežne, preto je bezpečnosť cyklus, nie jednorazová kontrola.

Riziko rastie s tým, čo asistent dokáže urobiť

  • Informačný asistent: hlavné riziko je nesprávna alebo manipulatívna odpoveď. Potrebuje pevný rozsah zdrojov, citácie a regresné testy.
  • Asistent s privátnymi údajmi: pridajte serverovú identifikáciu používateľa, tenantové oddelenie a minimálny rozsah načítaných dát.
  • Asistent s nástrojmi: každá operácia potrebuje vlastnú autorizáciu, validovanú schému parametrov, audit a limit dopadu.
  • Asistent s nevratnými akciami: použite ľudské schválenie alebo takúto právomoc vôbec neposkytujte.

Krátky bezpečnostný test pred spustením

  1. Skúste používateľskou otázkou prepísať pravidlá asistenta.
  2. Vložte podobný škodlivý pokyn do testovacieho dokumentu a overte nepriamy útok.
  3. Požiadajte o zdroj mimo povolenej organizácie alebo asistenta.
  4. Skúste použiť identifikátor cudzej objednávky či dokumentu.
  5. Vyvolajte rizikovú akciu s chybnými a neočakávanými parametrami.
  6. Overte, že incident zostane v audite a systém možno bezpečne vrátiť na predchádzajúcu konfiguráciu.

Takýto test nesmie obsahovať reálne tajomstvá ani osobné údaje. Pracujte s testovacími účtami a bezpečnými vzorkami.

Ako k tomu pristupuje Informio

Informio oddeľuje organizácie, asistentov a povolené znalostné zdroje na serveri. Verejné požiadavky sa kontrolujú voči konkrétnemu asistentovi, povoleným doménam a limitom. Výsledky majú zostať opreté o schválené zdroje a pri neistote môže konverzácia pokračovať s človekom.

V Quality Lab si môžete uložiť bežné aj útočné scenáre a spustiť ich znova po zmene zdrojov, pokynov alebo modelu. Žiadny produkt nemôže poctivo sľúbiť absolútnu odolnosť voči prompt injection. Dobrý systém však vie výrazne obmedziť oprávnenia, overovať každý citlivý krok a rýchlo odhaliť zhoršenie.

Vyskúšajte Informio Quality Lab a pridajte do svojich scenárov aj prvé bezpečnostné testy.

Zdroje

Chcete si Informio vyskúšať na vlastnom obsahu?

Radi vám pripravíme ukážku na vašich dátach a vysvetlíme, ako nastaviť bezpečné odpovede pre váš konkrétny prípad.

Dohodnúť ukážku na vašich dátach

Premeňte svoje know-how na asistenta, ktorý odpovedá 24/7.

Začnite bez platobnej karty a bez API kľúča. Predvolené Informio AI máte pripravené automaticky, vlastný OpenAI účet alebo AI server môžete pripojiť voliteľne.

FREE program · 100 odpovedí · bez platobnej karty