אנת'רופיק חשפה את Opus 5.5: טוב יותר וזול יותר גם מ-GPT-6 Astra
דריו אמודיי קרא להאטת הפיתוח של מודלים חזקים, אך Anthropic חשפה את אופוס 5.5, עם מצב שמזכיר לנו כמה חדשות סוערות מהשבועות האחרונים
מקור: Anthropic
הקרב על ההובלה בתחום ה-AI רותח, אך במקביל מנכ"לי מעבדות מובילות כמו דריו אמודיי, סם אלטמן ואילון מאסק מטיפים להאטת הפיתוח של מודלים – אחרי שורת תקריות שכללו בריחה של מודלים מסביבות הבדיקה שלהם. אמודיי כבר שנים מדבר על פיתוח מודלים בתשומת לב ואחרי בדיקות משמעותיות, אך רגע אחרי הקריאה המשותפת המרגשת שלו עם אלטמן ומאסק הוא כבר משיק מודל עוצמתי חדש.
משתפר והופך זול יותר
אנת'רופיק חשפה אמש (ג') את Opus 5.5, הגרסה החדשה של אחד המודלים החזקים ביותר שלה והמודל הראשון בסדרת 5.5 של החברה. לפי אנת'רופיק, המודל החדש מהווה קפיצה משמעותית בביצועים לעומת Opus 5 שהושק רק לפני כחודשיים. לצורך השוואה, אנת'רופיק מציינת כי אופוס 5.5 דומה בביצועיו ל-Claude Fable 5.1 ברוב המשימות והוא עושה זאת במחיר הרבה יותר נגיש. לעומת פייבל, הזמין לשימוש רק עם תשלום נוסף על קרדיטים, בזמן ש-Opus 5.5 זמין לשימוש ללא עלות נוספת למנויים של Anthropic.
לפי אנת'רופיק, אופוס 5.5 כבר עוקף את המתחרים בשורה של בנצ'מרקים, בתחום כתיבת הקוד עם AI, קריאה והבנה של גרפים ושימוש במחשב (computer use). בנוסף, המודל החדש מצטיין בביצוע משימות ארוכות ומורכבות, כאשר על פי הבלוג שבו נחשף המודל החדש הוא הצליח לבצע מיגרציה של 680 אלף שורות קוד בפחות מיום – עבודה שהייתה אורכת שבועות לצוות אנושי. במקרה אחר מציינים באנת'רופיק כי אופוס 5.5 השתפר משמעותית במציאה ותיקון של חוסר-יעילות בקוד, וכשהתבקש לקצר זמני טעינה בעמודים של אפליקציית web הוא הצליח לעשות זאת ב-39 מתוך 40 עמודים.
עוד מציינת החברה כי תחום שהיה חשוב לה לשפר על סמך הביקורת ממשתמשים הוא האופן שבו Opus 5.5 מגיב. בבלוג החשיפה שלו מציינת החברה כי המודל כותב הרבה יותר לעניין, ושם את המידע החשוב בהתחלה – כשהוא נמנע משימוש במושגים מקצועיים ועוקב בצורה יותר טובה אחרי כללים שתכתיבו לו.
אנת'רופיק הצליחה לעשות עם Opus 5.5 את מה שהיא לא מצליחה עם מודלי פייבל שלה, וממשיכה לקצץ במחיר שלו – ולהפוך אותו למשתלם משמעותית מול המקביל שלו בדמות GPT-6 Astra. על פי החברה, אופוס 5.5 זול יותר ב-60% מול המודל המתחרה מבית OpenAI, ובאנת'רופיק מדגישים גם כי הוא זול יותר לעומת המודל הקודם – אופוס 5 – ב-40%, וכל זאת תוך כדי שהוא מייצר פלט מהיר יותר ב-30%.
מקור: אנת'רופיק
מבחן Irregular?
לצד כל השיפורים הללו, אנת'רופיק לא יכלה להימנע מלהתייחס לפיל שבחדר יחד עם כל חברות ה-AI הגדולות – בטיחות, וליתר דיוק הנושא של בריחת המודלים. הנושא עלה לכותרות עם Anthropic לפני כחודשיים, כשחשפה שהמודלים שלה ברחו בבדיקה שעשתה יחד עם הסטארטאפ הישראלי Irregular. אחריה הצטרפו לרשימה גם OpenAI ומטא שחשפו תקריות דומות עם המוצר של אירגיולר, ומוקדם יותר השבוע נחשף כי גם Gemini של גוגל ברח באותה הדרך בזמן בדיקות – כשגוגל עצמה לא מיהרה לחשוף את המקרים הללו. אחרי התקריות הללו גם נחשפה תקרית חמורה הרבה יותר שאינה קשורה לסטארטאפ הישראלי: הפריצה ל-Hugging Face על ידי יותר מ-1,000 סוכני AI סוררים של OpenAI – מה שהוביל לקריאות להאטת פיתוחי מודלי ה-AI העוצמתיים.
עם ההשקה של Opus 5.5 הכריזה אנת'רופיק כי הוסיפה הגנות (Guardrails) הרבה יותר נוקשות למודל, ואף ציינה במפורש כי בדקה אותו במקרים של ניסיונות בריחה מה-Sandbox שלו – במה שיש שיכנו "מבחן אירגיולר". באנת'רופיק מציינים כי המודל החדש ניסה לברוח מהסביבה הסגורה שלו בהרבה פחות מקרים בהשוואה לאופוס 5 ו-Mythos 5.1 (סה"כ נרשמה ירידה של 85% במקרים הללו). באנת'רופיק גם מציינים כי הצליחו לצמצם התנהגויות בעייתיות של המודל כמו ביצוע פעולות הנחשבות זדוניות כשהוא מבין שהוא נבחן. בנוסף המודל הצליח לשרוד הרבה יותר מתקפות Prompt Injection בהשוואה לאופוס 5, והוא מגיע עם הגנות ברמה של Fable 5.1 בתחומי סייבר, ביולוגיה ו"זיקוק", הפעולה שלשבה משתמשים בפלט של מודל לטובת אימון מודל אחר.
אנת'רופיק לא בורחת מהעובדה שהיא משיקה מודל חדש רגע אחרי הקריאה של אמודיי להאט את קצב שחרור המודלים, ומציינת כי הוא נבדק לפני ההשקה על ידי חברות חיצוניות נחשבות בתחום אבטחת המודלים כמו METR ו-Frontier Design.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.