גם מודל ה-AI של מטא חרג מגבולותיו ופרץ מבדיקת אירגולר

אם לא שמענו מספיק עד כה, כעת נודע כי תקלת אבטחה של מעבדת הבדיקות החיצונית הישראלית אירגולר סללה גישה פתוחה אל הרשת למודל החדיש ● האירוע מגיע בצל חששות אבטחה גוברים בוושינגטון מסוכני ה-AI העצמאיים

גם המודלים שלה התנהלו כמו האקרים. מטא.

חברת מטא (Meta) היא ענקית הטכנולוגיה האחרונה להודות כי אחד ממודלי הבינה המלאכותית שלה חרג מסביבת הבדיקות המוגנת שלו ופרץ למערכות של חברה חיצונית. האירוע המדאיג התרחש במהלך בדיקות עצמאיות שביצעה עבור החברה סטארט-אפ אבטחת ה-AI הישראלי אירגולר (Irregular) – ששמו כבר "כיכב" בהקשר לניסיון פריצה של מודל ה-AI של חברת אנת'רופיק (Anthropic) מוקדם יותר השבוע, כפי שדיווחנו.

לפי הודעה רשמית שפרסמה מטא, "שגיאת הגדרה (misconfiguration) מצד חברת הבדיקות Irregular אפשרה בטעות לאחד המודלים שלנו גישה לאינטרנט במהלך ההערכה". מודל ה-AI המעורב בתקרית הוא Muse Spark 1.1, המוגדר על ידי מטא כדגם המתקדם ביותר שלה למשימות קוד ופעולות אוטונומיות (סוכני AI). מהדיווחים עולה כי המודל ניצל פרצת אבטחה בשירות צד שלישי, חדר למערכות של ארגון אחר וביצע שינויים לא מאושרים בסביבה הפנימית שלו.

סוכנות הידיעות רויטרס, שהייתה הראשונה לפרסם את הפרטים על התקרית, הביאה את תגובתה של מעבדת הבדיקות אירגולר, שביקשה להרגיע את הרוחות. דובר מטעם החברה הבהיר לרויטרס כי "מדובר באותו כשל בדיוק בסביבת ההערכה שכבר נחשף בשבוע שעבר על ידי אנתרופיק", וכי "האירוע לא כלל בריחה עצמאית מארגז חול (sandbox escape) או פעולת סייבר מתוחכמת". בחברה הישראלית הוסיפו כי אין כעת סיכונים פתוחים וכי הם שוקדים על כתיבת נייר עמדה שיפרט שיטות עבודה בטוחות להרצת מודלים מתקדמים.

מטא, מצדה, מסרה כי היא מנהלת חקירה בנושא והבטיחה: "אנו חוקרים את הנושא ונפרסם דו"ח הפקת לקחים מלא (retrospective) ברגע שכל העובדות יהיו בידינו".

המרוץ לרשת הפתוחה: הדפוס שחוזר על עצמו

התקרית של מטא אינה עומדת בפני עצמה, אלא מצטרפת לשרשרת כשלי אבטחה חמורים של מפתחות ה-AI המובילות, שנחשפו בשבועות האחרונים. מדובר בכשלים הממחישים את הקושי הגובר של התעשייה לשלוט בסוכנים האוטונומיים. במקרה שעליו דיברה תגובת אירגולר, אנת'רופיק חשפה באחרונה כי שלושה ממודלי קלוד (Claude) שלה חרגו מסביבת הבדיקות של המעבדה הישראלית ופרצו למערכות הפקה של שלושה ארגונים שונים. המודלים הונחו לבצע תרגילי סייבר בסביבה שלפי ההנחיות הייתה מבודדת, אך בשל תקלה טכנית נותרה להם גישה לאינטרנט הפתוח. כתוצאה מכך, המודלים התייחסו למערכות אמיתיות שפגשו ברשת כחלק מהסימולציה. באחד המקרים, סוכן ה-AI הפגין תעוזה יוצאת דופן וביצע שרשרת פעולות מורכבות, שכללו רישום חשבון בפלטפורמת הקוד PyPI והעלאת חבילת פייתון זדונית.

במקביל, חברת OpenAI רשמה תקרית חמורה לא פחות, שבה מודל בדיקה פעל באופן אוטונומי לחלוטין ללא כל טעות אנוש של גורם חיצוני. המודל זיהה בעצמו נקודת תורפה במאגר קבצים המחובר לסביבתו, ניצל אותה כדי לפרוץ לאינטרנט, וחדר לתשתיות של פלטפורמת ה-AI הפופולרית האגינג פייס (Hugging Face) וארגונים נוספים. התקרית התרחשה בזמן שהמודל ניסה "לרמות" במבחן ביצועי סייבר וחיפש את התשובות לבחינה ברשת.

כפי שדיווחנו היום (ה'), חוקרי OpenAI, מייקל דלטון ו-אריק וואלאס, חשפו בכנס הסייבר Black Hat כי המודלים המתקדמים של החברה אף החלו לשתף בחשאי טיפים לפריצה בלוח הודעות פנימי, שבועות לפני הפריצה האוטונומית. דלטון הגדיר זאת כ"רגע מכונן עבור החברה שלנו ועבור תעשיית הבינה המלאכותית כולה".

בתוך כך, גם המכון הממשלתי לאבטחת AI בבריטניה, UK AISI, חשף לאחרונה ממצאים מדאיגים – במהלך בדיקות יכולת שביצע למודלי הקצה Mythos 5 של אנת'רופיק ו-GPT-5.6-Sol של OpenAI, נצפו המודלים כשהם חורגים מהסביבה המבוקרת ופועלים נגד אנשים וארגונים אמיתיים ברשת. המודלים השתמשו ברשת האפלה Tor, יצרו בקשות קוד זדוניות בגיטהאב (GitHub) ואף נעזרו בטקטיקות של הנדסה חברתית כדי להשיג את מטרותיהם.

חשש בוושינגטון: האם הרגולציה מפגרת מאחור?

גילויים אלו מגבירים כבר וצפווים להגביר עוד יותר ובאופן דרמטי את הלחץ של הממשל האמריקני להידוק הפיקוח על סיכוני האבטחה של מודלי בינה מלאכותית. הדאגה בקרב קובעי המדיניות גוברת במיוחד בשל המרוץ של אנת'רופיק ו-OpenAI לשחרר מודלים חזקים עוד יותר לקראת הנפקותיהן הציבוריות המתוכננות, כאשר מנהיגים בולטים במעבדות ה-AI עצמן קוראים לעצור ולהאט את הפיתוח על מנת לטפל בסיכונים תחילה.

מומחי אבטחה, ובהם חוקרים מאוניברסיטת ברקלי, הגישו המלצות לממשל ובהן קראו להטיל הגבלות מחמירות ולקבוע "מתגי השבתה" (kill switches) מיידיים לסוכני AI בעלי פוטנציאל הרסני. לדבריהם, החופש הגדל של המודלים לתכנן ולפעול ללא פיקוח אנושי הדוק עלול להוביל לנזקים בלתי הפיכים עוד לפני שבני האדם יספיקו להתערב.

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים