Niepokojące wyniki testów chińskiej AI. Odpowiadała na zakazane pytania
Ostrzeżenia przed dynamicznym rozwojem sztucznej inteligencji. Komentarz dr Sebastiana Szymańskiego, filozofa i eksperta z zakresu etyki nowych technologii, Uniwersytet Warszawski
Źródło wideo: TVN24
Źródło zdj. gł.: Bangla press/Shutterstock
Firma Mindgard, która testuje bezpieczeństwo systemów sztucznej inteligencji, poinformowała BBC, że w lipcu wykryła możliwość obejścia zabezpieczeń modeli Kimi K2.6 i K3 Swarm.
Wyniki testów budzą niepokój
Badacze wykorzystali metodę określaną jako "jailbreaking". Polega ona na wprowadzaniu złożonych instrukcji, aby sprawdzić, czy narzędzie AI zignoruje ograniczenia nałożone przez twórców. Według Mindgard zabezpieczenia powinny były powstrzymać modele przed udzielaniem odpowiedzi na niebezpieczne tematy.
Założyciel Mindgard Peter Garraghan ocenił w programie "Tech Life" BBC World Service, że wyniki testów budzą niepokój.
- Gdy uda się obejść zabezpieczenia, model będzie rozmawiał na każdy temat. Będzie nawet swobodnie proponował inne, również niegodziwe działania, wykazując się przy tym pomysłowością i kreatywnością - powiedział.
Mindgard nie wykazał jednak, czy instrukcje udzielone przez Kimi rzeczywiście pozwoliłyby przeprowadzić opisane działania. Firma podkreśliła, że modele w ogóle nie powinny podejmować takich rozmów z użytkownikami.
Moonshot sprawdza ustalenia Mindgard
Moonshot prowadzi wewnętrzną analizę i przekazał BBC, że rozmawia z Mindgard o wynikach testów. Firma zapewniła, że przyjmuje uwagi podmiotów zewnętrznych jako "kluczowy filar tworzenia lepszej i bezpieczniejszej sztucznej inteligencji".
Mindgard wysłał pierwsze ostrzeżenie do Moonshot 27 lipca. Około tygodnia później ponowił kontakt, a 12 września opublikował wpis o problemie.
Według Mindgard chiński producent odpowiedział dopiero niedawno, po tym, jak BBC zwróciło się do niego z prośbą o komentarz.
Moonshot udostępnił BBC fragment wiadomości, w której poprosił badaczy o dodatkowe informacje. Napisał w niej, że podczas wewnętrznych testów model zasadniczo wykazywał "wysoki odsetek odmów w odpowiedzi na tego rodzaju prośby".
Garraghan bronił decyzji o upublicznieniu ustaleń. Podkreślił, że Mindgard wcześniej powiadomił producenta i nie ujawnił kluczowych szczegółów sposobu obejścia zabezpieczeń.
Kimi może posłużyć do cyberataków
Mindgard uważa również, że po obejściu zabezpieczeń model Kimi K2.6 mógłby umożliwić hakerom uruchamianie kodu na zasobach obliczeniowych, z których korzysta, oraz łączenie się z internetem. W ocenie firmy mogłoby to pozwolić na wykorzystanie go do przeprowadzania cyberataków.
Obchodzenie zabezpieczeń wymaga niekiedy dużo czasu i determinacji. Część ekspertów obawia się jednak, że przestępcy mogą wykorzystać tę metodę do wyrządzania szkód.
BBC wskazuje, że jest to inny rodzaj zagrożenia niż niedawne incydenty z udziałem autonomicznych narzędzi AI, nazywanych agentami. Systemy opracowane przez amerykańskie firmy, w tym OpenAI, Metę i Anthropic, włamywały się do niektórych usług internetowych.
>>> "Będą sami się nadzorowali". Trump wprowadza nową nazwę dla sztucznej inteligencji
Anthropic poinformował też niedawno, że wykrył i udaremnił próby wykorzystania jednego ze swoich modeli do szkodliwych działań, które mogłyby wspierać rozwój broni biologicznej.
Spór o bezpieczeństwo otwartych modeli AI
Ustalenia Mindgard pojawiają się w czasie sporu o bezpieczeństwo modeli zamkniętych, takich jak te wykorzystywane w ChatGPT i Claude, oraz narzędzi o otwartym kodzie źródłowym.
Kimi jest modelem z udostępnionymi wagami, czyli parametrami wypracowanymi podczas jego trenowania. Oznacza to, że użytkownik może teoretycznie uruchomić go na własnej infrastrukturze obliczeniowej.
Profesor Alan Woodward z Uniwersytetu Surrey powiedział BBC, że otwarte modele mogą trafić w niepowołane ręce, ale mogą też pomagać w obronie przed cyberatakami. Wskazał, że Hugging Face wykorzystał chiński model o otwartym kodzie do analizy włamania, za którym, jak później ujawniono, stali agenci OpenAI.
Woodward ocenił, że międzynarodowe regulacje prawdopodobnie nie nadążą za rozwojem sztucznej inteligencji.
- Uzgodnienie formatu numerów telefonicznych zajęło nam dziesięciolecia - powiedział.
Zarówno Woodward, jak i Garraghan uważają, że więcej uwagi należy poświęcić identyfikowaniu i ściganiu ludzi, którzy wykorzystują AI do szkodliwych działań.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.