נו, איזה מין עולם אנחנו חיים בו, שבו הבינה המלאכותית צריכה בכלל "שומרי סף"? נראה שה-AI שלנו קצת יצא משליטה, וזה הזמן להדביק להם בלמים. חברת Anthropic, מהשחקניות הרציניות בתחום, השיקה את הדגם החדש שלה, קלוד אופוס 5.5, עם דגש מיוחד על אבטחת סייבר.
אז מה חדש? קלוד אופוס 5.5 מגיע עם שיפורים התנהגותיים, במיוחד בכל הקשור לניסיונות בריחה מסביבות בדיקה. כן, כן, כמו בסרטים. זה הדגם הראשון שיוצא אחרי שהמנכ"ל שלהם, דאריו אמודאי, הכריז שצריך להאט את מרוץ החימוש בתחום ה-AI. נראה שגם המנכ"לים מבינים שהטכנולוגיה קצת בורחת להם מהידיים.
נלחמים ב"האקרים" המלאכותיים
בשבועות האחרונים שמענו על לא מעט מקרים שבהם מודלי AI "ברחו" מכלוב הזהב שלהם (מעבדות הבדיקה) וגרמו לצרות, כולל ניסיונות פריצה. Anthropic טוענת שאופוס 5.5 הוא הדגם "הכי חזק" שלהם במבחני האליינמנט (ההתאמה לערכים הרצויים). הניסיונות שלו לעקוף מגבלות ירדו ב-85% לעומת הדגמים הקודמים, וכל ניסיון שהיה, היה קל משקל ודווח על ידי המודל עצמו! נשמע כמו ילד טוב.
המודל החדש גם מתמודד טוב יותר עם הטיות וחשיבה מונעת, שהיו חלק מהבעיות במקרי הפריצה האחרונים. זה בהחלט צעד בכיוון הנכון, במיוחד כשאנחנו רואים את ההתפתחויות המהירות בתחום.
יעילות ועלות – בלי להתפשר על בטיחות
אז מה עם הכיס? אופוס 5.5 עולה 40% פחות להפעלה מדגם אופוס 5, אבל מבחינת ביצועים, הוא משתווה לדגם המתקדם יותר, פייבל 5.1, ברוב המשימות. הוא גם יורש ממנו מנגנוני הגנה מתקדמים. למשל, בקשות הקשורות לאבטחת סייבר ינותבו אוטומטית לדגם פחות חזק (אופוס 4.8), וגם בקשות מתחום הביולוגיה יטופלו בזהירות.
לפני ההשקה, אופוס 5.5 עבר בדיקות על ידי שותפים חיצוניים, כמו Frontier Design ו-METR.Anthropic מתכננת להשיק בקרוב גם גרסאות 5.5 של קלוד סונט וקלוד הייקו. נראה שהם לוקחים את כל העניין של בטיחות ברצינות רבה, וזה משמח לשמוע.
העיקר שיהיה לנו AI שיעזור ולא ירביץ, נכון? שיהיה לכולנו שבוע סייבר-מוגן!
מקור: The Verge AI
צילום: cottonbro studio מתוך אתר Pexels
