Próba obejścia zabezpieczeń modelu AI.
Najprościej mówiąc
Jailbreak polega na takim sformułowaniu polecenia, żeby model złamał własne ograniczenia lub polityki bezpieczeństwa.
Przykład użycia
Użytkownik udaje scenariusz fikcyjny, rolę eksperta albo serię instrukcji, aby wymusić odpowiedź, której model nie powinien podać.
Najczęstsze nieporozumienie
Nie każdy jailbreak jest poważnym atakiem, ale w połączeniu z narzędziami i danymi może stać się realnym problemem.
Dlaczego to ważne?
Jailbreaki pokazują, że bezpieczeństwo AI nie może opierać się wyłącznie na grzecznym promptcie systemowym.