RTP Desporto12h30m CR7 joga? Dúvidas não mexem com dinamarquesesPunchThree tankers hit in Hormuz – Maritime agencyESPNCollege Football Playoff: Who's on the right side and wrong side of the bubble?Daily MaverickFOUL PLAY: Manchester City’s ‘sham’ deals leave Premier League in uncharted territoryThe Jerusalem PostSohlberg sets Central Elections Committee hearing on Likud petition against Fly&Vote initiativeBollywood HungamaWho is Lalit Prabhakar? Meet the National Award-winning actor playing Ajmal Kasab in PrahaarInquirerGracioso takes lie detector test over his ‘cash delivery’ statementsХабрЗачем нейросети «обвязка»: как превратить LLM в рабочий AI-сервисSouth China Morning PostAnthropic raises alarm over elite hacking ability of Chinese firm Z.ai’s GLM-5.3SRF NewsLanger Weg zum billigen ÖV-Abo – Zürcher Stadtrat bremst Umsetzung des Günstig-Abos3DNewsSamsung представила флагманский планшет Galaxy Tab S12 Ultra с огромным экраном и очень тонким корпусом, а также Tab S12+VanguardUK PM Burnham reopens divisive debate on rejoining EU
The Daily Newsstand · Free, Always
Wednesday, September 30, 2026

Niepokojące wyniki testów chińskiej AI. Odpowiadała na zakazane pytania

Translate
Moonshot AI

Ostrzeżenia przed dynamicznym rozwojem sztucznej inteligencji. Komentarz dr Sebastiana Szymańskiego, filozofa i eksperta z zakresu etyki nowych technologii, Uniwersytet Warszawski

Źródło wideo: TVN24

Źródło zdj. gł.: Bangla press/Shutterstock

Chińska firma Moonshot sprawdza działanie swoich modeli AI po tym, jak badacze nakłonili je do udzielania instrukcji dotyczących tworzenia broni biologicznej i przeprowadzania zamachów. Jak podaje BBC, udało się obejść zabezpieczenia dwóch modeli Kimi. Nie sprawdzono jednak, czy ich odpowiedzi były skuteczne.

Firma Mindgard, która testuje bezpieczeństwo systemów sztucznej inteligencji, poinformowała BBC, że w lipcu wykryła możliwość obejścia zabezpieczeń modeli Kimi K2.6 i K3 Swarm.

Wyniki testów budzą niepokój

Badacze wykorzystali metodę określaną jako "jailbreaking". Polega ona na wprowadzaniu złożonych instrukcji, aby sprawdzić, czy narzędzie AI zignoruje ograniczenia nałożone przez twórców. Według Mindgard zabezpieczenia powinny były powstrzymać modele przed udzielaniem odpowiedzi na niebezpieczne tematy.

Założyciel Mindgard Peter Garraghan ocenił w programie "Tech Life" BBC World Service, że wyniki testów budzą niepokój.

- Gdy uda się obejść zabezpieczenia, model będzie rozmawiał na każdy temat. Będzie nawet swobodnie proponował inne, również niegodziwe działania, wykazując się przy tym pomysłowością i kreatywnością - powiedział.

Mindgard nie wykazał jednak, czy instrukcje udzielone przez Kimi rzeczywiście pozwoliłyby przeprowadzić opisane działania. Firma podkreśliła, że modele w ogóle nie powinny podejmować takich rozmów z użytkownikami.

Moonshot sprawdza ustalenia Mindgard

Moonshot prowadzi wewnętrzną analizę i przekazał BBC, że rozmawia z Mindgard o wynikach testów. Firma zapewniła, że przyjmuje uwagi podmiotów zewnętrznych jako "kluczowy filar tworzenia lepszej i bezpieczniejszej sztucznej inteligencji".

Mindgard wysłał pierwsze ostrzeżenie do Moonshot 27 lipca. Około tygodnia później ponowił kontakt, a 12 września opublikował wpis o problemie.

Według Mindgard chiński producent odpowiedział dopiero niedawno, po tym, jak BBC zwróciło się do niego z prośbą o komentarz.

Moonshot udostępnił BBC fragment wiadomości, w której poprosił badaczy o dodatkowe informacje. Napisał w niej, że podczas wewnętrznych testów model zasadniczo wykazywał "wysoki odsetek odmów w odpowiedzi na tego rodzaju prośby".

Garraghan bronił decyzji o upublicznieniu ustaleń. Podkreślił, że Mindgard wcześniej powiadomił producenta i nie ujawnił kluczowych szczegółów sposobu obejścia zabezpieczeń.

Kimi może posłużyć do cyberataków

Mindgard uważa również, że po obejściu zabezpieczeń model Kimi K2.6 mógłby umożliwić hakerom uruchamianie kodu na zasobach obliczeniowych, z których korzysta, oraz łączenie się z internetem. W ocenie firmy mogłoby to pozwolić na wykorzystanie go do przeprowadzania cyberataków.

Obchodzenie zabezpieczeń wymaga niekiedy dużo czasu i determinacji. Część ekspertów obawia się jednak, że przestępcy mogą wykorzystać tę metodę do wyrządzania szkód.

BBC wskazuje, że jest to inny rodzaj zagrożenia niż niedawne incydenty z udziałem autonomicznych narzędzi AI, nazywanych agentami. Systemy opracowane przez amerykańskie firmy, w tym OpenAI, Metę i Anthropic, włamywały się do niektórych usług internetowych.

>>> "Będą sami się nadzorowali". Trump wprowadza nową nazwę dla sztucznej inteligencji

Anthropic poinformował też niedawno, że wykrył i udaremnił próby wykorzystania jednego ze swoich modeli do szkodliwych działań, które mogłyby wspierać rozwój broni biologicznej.

Spór o bezpieczeństwo otwartych modeli AI

Ustalenia Mindgard pojawiają się w czasie sporu o bezpieczeństwo modeli zamkniętych, takich jak te wykorzystywane w ChatGPT i Claude, oraz narzędzi o otwartym kodzie źródłowym.

Kimi jest modelem z udostępnionymi wagami, czyli parametrami wypracowanymi podczas jego trenowania. Oznacza to, że użytkownik może teoretycznie uruchomić go na własnej infrastrukturze obliczeniowej.

Profesor Alan Woodward z Uniwersytetu Surrey powiedział BBC, że otwarte modele mogą trafić w niepowołane ręce, ale mogą też pomagać w obronie przed cyberatakami. Wskazał, że Hugging Face wykorzystał chiński model o otwartym kodzie do analizy włamania, za którym, jak później ujawniono, stali agenci OpenAI.

Woodward ocenił, że międzynarodowe regulacje prawdopodobnie nie nadążą za rozwojem sztucznej inteligencji.

- Uzgodnienie formatu numerów telefonicznych zajęło nam dziesięciolecia - powiedział.

Zarówno Woodward, jak i Garraghan uważają, że więcej uwagi należy poświęcić identyfikowaniu i ściganiu ludzi, którzy wykorzystują AI do szkodliwych działań.

View the original on TVN24 →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.