המקרה החריג של OpenAI זוכה לזווית ישראלית מעניינת, בזכות פוסט חדש מפרסמת JFrog הישראלית
בשבוע האחרון סער עולם הטכנולוגיה לאחר ש-2 מודלים של OpenAI הצליחו להערים על כולם, "לברוח" מה-Sandbox שלהם ולפרוץ לאתר Hugging Face. מאז עסקו רבים בשאלה "איך זה קרה?", ועכשיו אנחנו מקבלים תשובה, ויכול להיות שזה קשור גם למוצר של החברה הישראלית JFrog.
נזכיר כי חוקרים של OpenAI הריצו את המודלים בנצ'מארק סייבר ייעודי בשם ExploitGym. כשהמודלים הבינו שהדרך הכי טובה להצליח במבחן היא פשוט לרמות, הם התחילו לחפש איך לעשות זאת. הם רצו ללא מנגנוני בטיחות בתוך סנדבוקס שבו יכלו להתקין רק חבילות שאושרו מראש. למרות זאת, הם ניצלו חולשת זירו-דיי בפרוקסי פנימי שניהל את החבילות, ביצעו אסקלציה של הרשאות ותנועה רוחבית – 2 פרקטיקות נפוצות של פורצים – והגיעו למערכת עם גישה לרשת. משם הם פרצו להאגינג פייס כדי לגנוב את התשובות למבחן.
לאחר שבהאגינג פייס גילו את דבר הפריצה, הם נעזרו במודל סיני פתוח כדי לטפל בה, אבל רק לאחר כמה ימים נודע כי המודלים של OpenAI הם אלו שאחראים לאירוע. מהדיווחים שלאחר חשיפת הפריצה עולה כי גם ב-OpenAI הופתעו מאוד מהמקרה, וגילו את הפריצה רק שבוע אחרי שהתרחשה.