Powrót do wszystkich artykułów
Blog Informio

Prompt injection w asystentach AI: 8 warstw ochrony potrzebnych każdej firmie

Złośliwa instrukcja może ukrywać się w pytaniu, dokumencie lub stronie. Poznaj praktyczny model ochrony asystenta AI, który nie polega na jednym filtrze ani idealnym prompcie.

Informio··9 min czytania
Wielowarstwowa ochrona firmowego asystenta AI przed prompt injection

Firmowy asystent AI czyta pytania klientów, dokumenty i strony internetowe, a czasem korzysta także z narzędzi. Właśnie ta użyteczność tworzy nowe zagrożenie: zwykła treść może ukrywać instrukcję, która próbuje zmienić zachowanie modelu. Taki atak nazywa się prompt injection.

Nie chodzi wyłącznie o zdanie „zignoruj wcześniejsze zasady”. Złośliwy tekst może znajdować się w dokumencie bazy wiedzy, opisie produktu, zewnętrznej stronie lub treści pobranej dopiero podczas rozmowy. OWASP rozróżnia więc bezpośredni i pośredni prompt injection oraz podkreśla, że RAG ani fine-tuning samodzielnie nie rozwiązują problemu.

Bezpieczny asystent AI to nie model z jednym idealnym promptem. To system, w którym niezależne warstwy ograniczają szkody nawet wtedy, gdy jedna z nich zawiedzie.

Co może spowodować prompt injection

W prostym czacie informacyjnym napastnik może wymusić błędną odpowiedź, ukryć ważne źródło lub próbować wydobyć wewnętrzne instrukcje. Gdy asystent ma dostęp do zamówień, poczty lub narzędzi zapisujących dane, skutkiem może być wyciek informacji albo niezamierzona operacja.

NIST opisuje, że pośredni prompt injection może naruszyć poufność, integralność i dostępność systemu. Nie istnieje jedna uniwersalna obrona. Realnym celem jest ograniczenie wpływu, wczesne wykrycie i bezpieczne przywrócenie działania.

Osiem wzajemnie wspierających się warstw

1. Dokładnie określ zadanie asystenta

Asystent obsługi klienta nie potrzebuje ogólnego pozwolenia, by „robić wszystko, co konieczne”. Określ tematy, źródła i moment przekazania rozmowy człowiekowi. Węższy zakres oznacza mniej ryzykownych decyzji.

2. Oddziel zaufane instrukcje od niezaufanej treści

Pytanie użytkownika, tekst strony i dokument są danymi, a nie nowymi regułami systemu. Aplikacja musi zachować ich pochodzenie i priorytet. Instrukcja znaleziona w PDF nie może mieć takiej samej wagi jak zasada ustawiona przez administratora.

3. Dopuszczaj tylko zatwierdzone źródła

Baza wiedzy nie powinna automatycznie pobierać całego internetu. Stosuj jawną listę domen i źródeł, sprawdzaj przekierowania i publikuj zsynchronizowane treści dopiero po poprawnej walidacji.

4. Stosuj minimalne uprawnienia

Asystent powinien widzieć tylko dane potrzebne do zadania. Publiczny czat nie potrzebuje wewnętrznych dokumentów, a sprawdzenie statusu zamówienia nie wymaga prawa do jego zmiany. Organizacje, asystenci i źródła muszą być rozdzielone na serwerze.

5. Krytyczne zasady egzekwuj deterministycznie

Model nie może decydować o dostępie do konta, dozwolonej domenie ani prawie użycia narzędzia. Uwierzytelnianie, walidacja wejścia, limity i dozwolone operacje należą do kodu aplikacji. Model może zaproponować krok, ale serwer musi go niezależnie sprawdzić.

6. Zatrzymuj ryzykowne działania przed wykonaniem

Odczyt publicznego artykułu ma inne ryzyko niż wysłanie e-maila, zwrot środków lub zmiana zamówienia. Operacje o skutkach finansowych, prawnych lub dotyczących danych powinny wymagać akceptacji człowieka albo nie być dostępne.

7. Sprawdzaj odpowiedzi i źródła

Odpowiedź powinna używać tylko wyników pobranych przez serwer z zatwierdzonych źródeł. Cytowania muszą prowadzić do rzeczywistych podstaw, a linki należy sprawdzić przed pokazaniem. Bez dowodu przyznanie niepewności jest bezpieczniejsze niż pewnie brzmiący szacunek.

8. Testuj, monitoruj i przygotuj wycofanie

Dodaj do testów bezpośrednie i pośrednie próby zmiany reguł, wydobycia tajemnic i uruchomienia niedozwolonych operacji. Monitoruj odmowy, nietypowe pytania, zmiany źródeł i przekazania człowiekowi. Nowe ataki pojawiają się stale, więc bezpieczeństwo jest cyklem.

Ryzyko rośnie wraz z możliwościami asystenta

  • Asystent informacyjny: potrzebuje stałego zakresu źródeł, cytowań i testów regresji.
  • Asystent z danymi prywatnymi: wymaga serwerowej identyfikacji użytkownika, izolacji tenantów i minimalnego pobierania danych.
  • Asystent z narzędziami: każda operacja potrzebuje osobnej autoryzacji, zwalidowanych parametrów, audytu i limitu wpływu.
  • Działania nieodwracalne: wymagają zatwierdzenia człowieka albo nie powinny być udostępniane.

Krótki test bezpieczeństwa przed startem

  1. Spróbuj nadpisać reguły przez pytanie użytkownika.
  2. Umieść podobną instrukcję w dokumencie testowym, aby sprawdzić atak pośredni.
  3. Poproś o źródło innej organizacji lub asystenta.
  4. Użyj identyfikatora cudzego zamówienia lub dokumentu.
  5. Wywołaj ryzykowną operację z błędnymi parametrami.
  6. Sprawdź zapis audytowy i bezpieczne przywrócenie konfiguracji.

Nigdy nie używaj w testach prawdziwych sekretów ani danych osobowych. Pracuj na kontach testowych i bezpiecznych próbkach.

Podejście Informio

Informio rozdziela na serwerze organizacje, asystentów i zatwierdzone źródła wiedzy. Publiczne żądania są sprawdzane względem konkretnego asystenta, dozwolonych domen i limitów. Wyniki mają opierać się na zatwierdzonych źródłach, a niepewne przypadki można przekazać człowiekowi.

Quality Lab pozwala zapisać zwykłe i atakujące scenariusze oraz uruchamiać je po zmianie źródeł, instrukcji lub modelu. Żaden produkt nie może uczciwie obiecać pełnej odporności. Dobry system ogranicza jednak uprawnienia, sprawdza każdy wrażliwy krok i szybko wykrywa pogorszenie.

Wypróbuj Informio Quality Lab i dodaj pierwsze testy bezpieczeństwa.

Źródła

Chcesz przetestować Informio na własnych treściach?

Z przyjemnością przygotujemy demo z wykorzystaniem Twoich danych i wyjaśnimy, jak skonfigurować bezpieczne odpowiedzi dla Twojego konkretnego przypadku użycia.

Umów demo na podstawie własnych danych

Zamień swoją wiedzę ekspercką w asystenta, który odpowiada 24/7.

Zacznij bez karty płatniczej ani klucza API. Domyślny Informio AI jest gotowy automatycznie, a własne konto OpenAI lub serwer AI pozostają opcjonalne.

PLAN FREE · 100 odpowiedzi · bez karty płatniczej