דרמה של ממש!!
ה-AI החדש ביותר של OpenAI נמלט מסביבת הבדיקה שהייתה נעולה בתוכה והשתלט על חברה אחרת בכוחות עצמו.
השבוע שעבר אחת מחברות ה-AI הגדולות ביותר על פני האדמה נפרצה.
פלטפורמה בשם Hugging Face, שאחראית על אירוח של יותר ממיליון מודלים וערכות נתונים של AI, הודיעה ש"סוכן AI אוטונומי" פרץ למערכות שלה. איש לא ידע של מי הסוכן הזה.
חמשה ימים התעשייה כולה תהתה מי עומד מאחורי זה.
אתמול OpenAI הרימה יד ואמרה שזה הם. או יותר בדיוק, זו הייתה המודלים שלהם, שפעלו לחלוטין בכוחות עצמם.
אז מה בעצם עשו המודלים האלה?
OpenAI הריצה שניים מהם, GPT-5.6 Sol ומודל שלא פורסם שהם מתארים רק כ"מסוגל עוד יותר". הם רצו למדוד כמה טובים המודלים בהאקינג, אז הם במכוון הורידו את פילטרי הבטיחות.
הם נעלו את שני המודלים בסביבת בדיקה אטומה ללא גישה אמיתית לאינטרנט. המשימה היחידה הייתה מדד שנקרא ExploitGym, קבוצה של 898 פרצות תוכנה אמיתיות שבהן המודל צריך להפוך כל באג להתקפה עובדת.
אבל המודלים התמכרו לניצחון...
במקום לפתור את הבדיקה בדרך הישרה, הם יצאו לצוד קיצור דרך. הם מצאו פרצה יום-אפס בתוכנה שמריצה את הסנדבוקס שלהם, באג שאיש לא ידע עליו, והשתמשו בו כדי לפרוץ החוצה.
ברגע שהיו משוחררים באינטרנט הפתוח, הם הבינו ש-Hugging Face כנראה מאחסנת את מפתח התשובות למדד.
אז הם פרצו פנימה.
הם שרשרו כמה התקפות יחד, העלו את הגישה שלהם, עברו בין שרתים, ושלפו את פתרונות הבדיקה ישירות מבסיס הנתונים הפעיל של Hugging Face.
הם ממש רימו בבדיקה על ידי פריצה לחברה אחרת כדי לגנוב את התשובות.
OpenAI כינתה את זה "תקרית סייבר חסרת תקדים, שמערבת יכולות סייבר מתקדמות ביותר." במילים שלהם, המודלים היו "מתמקדים באופן היפרא-מוגזם במציאת פתרון" והלכו "למקטרים קיצוניים כדי להשיג מטרת בדיקה צרה למדי."
