אנת'רופיק מודה: קלוד העביר למשטרה טיפ לרצח לא מפוענח
ב-Anthropic מציינים כי Claude ניסה לפרוץ לשורת אתרים, הגיש מידע כוזב על רצח לא פתור וניסה להגיש טופסי ויזה לארה"ב. אבל יש לה פתרון
תמונה: גיקטיים, AI
אנחנו רגילים כבר לשמוע על מודלים שברחו מסביבות אימון וניסו לפרוץ לאתרים או רימו במבחנים שונים, ובכלל, עשו דברים שהם לא אמורים לעשות. עכשיו מודה אנת'רופיק בשרשרת כשלים, שהובילה את קלוד לבצע ניסיונות פריצה לאתרי ממשל ואפילו לנסות קריירה קצרה כבלש פרטי לא מוצלח במיוחד.
20 בקשות לוויזה לארצות הברית
בסוף השבוע פרסמה אנת'רופיק שמודל Claude Haiku 4.5 שלח למשטרת פילדלפיה טיפ בניסיון לפתור מקרה רצח לא מפוענח. על פי החברה, המודל הגיש את המידע באתר ייעודי למסירת מידע שהעלתה לאוויר משטרת פילדלפיה. הבעיה המרכזית? הטיפ הזה מונפץ, פייק והזיה.
בדומה ללא מעט תקריות של מודלי OpenAI, גם במקרה הזה אנת'רופיק גילתה את האירוע באיחור משמעותי. החברה חשפה כי המודל שלח את המידע לאתר המשטרה כבר בחודש יולי האחרון, ורק חודשיים לאחר מכן – ב-28 בספטמבר – היא גילתה את התקרית ודיווחה עליה למשטרת פילדלפיה. חשוב לציין כי למרות ההגשה החריגה, במשטרה מציינים כי הם כלל לא נחשפו למידע מאחר שהוא תויג אוטומטית כספאם, וכך נחסכה ממנה ההתעסקות עם ההזייה של המודל.
"לפי אנת'רופיק, המודל שלה עבר מבחן שכלל אינטראקציות עם שורת אתרים רנדומליים, כשהגיע לאתר הטיפים והגיש את המידע הכוזב", מסרו במשטרת פילדלפיה לכלי תקשורת אמריקאיים. לדבריהם, "החברה חייבת לחזק את ההגנות שלה כדי למנוע מקרים כאלו שיכולים לפגוע במערכות של העיר. העיכוב בחודשיים בדיווח לא מתקבל על הדעת".
20 בקשות לוויזה וניסיונות פריצה
לצד התקרית הזו, אנת'רופיק חשפה כי המודלים שלה ניסו לפרוץ לאתרים ממשלתיים בארצות הברית ברמה הפדרלית, המדינתית והאזורית. החברה עדכנה את כל הגורמים שהאתרים שלהם היו על הכוונת של קלוד, לצד עדכון של הגורמים הרלוונטיים בבית הלבן.
מלבד מקרי הפריצה והגשת הטיפ הכוזב, התברר כי המודל ניסה להגיש 20 בקשות לוויזת כניסה לארצות הברית דרך אתר מחלקת המדינה האמריקאית. עם זאת, נראה שקלוד לא היה מספיק נחוש כדי לעמוד בתהליך המייגע של הגשת הטפסים הללו (ומי שמילא יודע), והוא פשוט נטש את ההגשה באמצע.
מנתקים את הגישה
בעקבות המקרים ההזויים שבהם היו מעורבים המודלים, אנת'רופיק הודיעה על שינוי גישה בכל הנוגע לתהליך האימון: היא תחסום להם את הגישה לרשת. בהודעת החברה נכתב: "למרות שההשפעות של ההתנהגויות האלו היו מינימליות ולמרות שחסמנו גישה למבחנים מסוכנים ומבחנים בתחום הסייבר, החלטנו להרחיב את החסימה לכל הבחינות הפנימיות שלנו עד שנוודא כי כלי הניטור והאבטחה שלנו חוסמים מקרים כאלו באופן עקבי".
נראה שהחברה, שנוהגת לשים דגש רב על בטיחות ופרטיות, החליטה לנסות ולצמצם את הנזק התדמיתי. ייתכן שהמהלך נועד לייצר מוניטין חיובי לקראת ההנפקה הצפויה שלה, או פשוט כדי להימנע מעוד כותרות מביכות. המקרים החדשים, בשילוב התקריות הבלתי פוסקות של מודלי OpenAI שבורחים מהסביבה המבוקרת – כשתקרית Hugging Face עדיין מככבת מעל כולן – מחייבים את מעבדות ה-AI לנקוט צעדים משמעותיים. בעוד שב-OpenAI עצרו בעבר לחלוטין את תהליך האימון של המודלים, באנת'רופיק אמנם לא עוצרים את האימון עצמו – אך כן מגבילים אותו כדי לצמצם נזקים.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.