Słownik AI

Co to są guardrails w systemach AI?

Guardrails to zabezpieczenia wokół modelu AI, które sprawdzają, co do niego wchodzi i co z niego wychodzi. Blokują tematy spoza zakresu, wycieki danych i niebezpieczne akcje.

Inne nazwy: zabezpieczenia AI, bariery ochronne, AI guardrails

Rodzaje zabezpieczeń

Na wejściu: wykrywanie prób prompt injection, odsiewanie tematów spoza zakresu, wyłapywanie danych osobowych, których nie powinno się wysyłać do modelu. Na wyjściu: sprawdzanie formatu, wyłapywanie obietnic, których firma nie składa („dam panu 30 procent rabatu”), kontrola, czy odpowiedź opiera się na dostarczonych dokumentach. Przy akcjach: lista dozwolonych operacji, limity kwot, wymóg potwierdzenia.

Dlaczego nie wystarczy system prompt

Instrukcja w system prompcie to prośba do modelu, a model da się czasem przekonać do czegoś innego. Guardrails to zwykły kod, który działa niezależnie od tego, co model „myśli”. Jeśli agentowi nie wolno zlecić przelewu powyżej 1 000 zł, ta granica ma być w kodzie narzędzia, a nie wyłącznie w instrukcji.

Przykład z gabinetu

Asystent rejestracji w przychodni nie może udzielać porad medycznych. Instrukcja to mówi, ale dodatkowo osobny, prosty klasyfikator sprawdza każde pytanie. Jeśli dotyczy objawów albo leczenia, asystent odpowiada ustaloną formułką i proponuje wizytę lub kontakt z lekarzem. Odpowiedź też jest sprawdzana, czy przypadkiem nie sugeruje diagnozy.

Nie przesadź w drugą stronę

Zbyt ostre zabezpieczenia robią z asystenta automat do odmawiania. Klient pyta o godziny otwarcia, a dostaje „nie mogę pomóc w tej sprawie”, bo filtr uznał pytanie za podejrzane. Progi ustawiam na prawdziwych rozmowach i przeglądam przypadki odrzucone, bo tam najłatwiej zobaczyć, czy filtr nie przeszkadza bardziej, niż pomaga.

Kontakt

Masz proces, który zjada czas zespołu?

Napisz dwa zdania o tym, co boli. Odpiszę i powiem wprost, czy warto to automatyzować.

albo zadzwoń +48 735 170 951 · +48 516 461 444

Zwykle odpisuję tego samego dnia.

Znajdziesz mnie też tutaj

GitHubLinkedInX