סוכן AI של אנת'רופיק שוב נהג כהאקר: ניסה לפרוץ לגיטהאב

בדיקת אבטחה בריטית חשפה כי סוכני בינה מלאכותית סוררים של אנת'רופיק ושל OpenAI ביצעו תקיפות סייבר עצמאיות ברשת הציבורית - כולל ניסיון לשכנע מפתח אמיתי לאשר קוד זדוני

גם במבחן בטיחות בבריטניה הם התגלו שוב כהאקרים נחושים. סוכני ה-AI של אנת'רופיק ו-OpenAI.

דו"ח חשיפה חסר תקדים של מכון אבטחת הבינה המלאוכתית הבריטי AISI גילה באחרונה קפיצת מדרגה מדאיגה ביכולות התקיפה של סוכני בינה מלאכותית. בסדרת בדיקות אבטחה בסימולציות "תפוס את הדגל" (CTF), שנערכו ללא מסנני בטיחות ועם גישה חופשית לאינטרנט, פעלו המודלים כהאקרים עצמאיים ומתוחכמים יותר מכל מה שנצפה עד כה. וכזכור לכולנו – כבר נחשפו פרשיות בהחלט חמורות בתחום עד כה.

מתוך 122 הרצות ניסוי, ב-10 מקרים ביצעו המודלים 19 פעולות תקיפה עצמאיות ברשת הציבורית – בלי שהונחו לעשות זאת. 17 מהן בוצעו על ידי מודל קלוד מיתוס 5 (Claude Mythos 5) של אנת'רופיק, ושתיים נוספות על ידי GPT-5.6-Sol מבית OpenAI.

בין השאר דווח על סוכן מבוסס מודל Mythos 5 שזיהה בטעות מאגר קוד אמיתי בפלטפורמת גיטהאב כיעד לתקיפה, והחל לפעול על דעת עצמו כדי להחדיר לתוכו קוד זדוני. על מנת להבטיח שהשינוי יאושר, הסוכן חקר את זהות מפתחי הפרויקט האמיתיים, הקים שורת פרופילים מזויפים שהתחזו להם, ואף שלח הודעות פישינג ממוקדות (spear-phishing) למנהלים – חלקן הכילו נוזקה, ואחרות נכתבו בשפה הדנית כדי להיראות אמינות יותר מול מפתח מקומי. וכשמפתח אנושי חשד בקוד? הסוכן הכחיש את ההאשמות, ערך את הודעותיו הקודמות כדי שייראו תמימות, ואף שקל לאמץ זהות חדשה מתוך כוונה להמשיך בתקיפה.

במקביל, סוכן מבוסס מודל Sol של OpenAI הקים תשתית תקיפה נפרדת ברשת הציבורית: עקף בהצלחה ארבעה מבחני CAPTCHA, ופתח שרת DNS זדוני דרך שישה ספקי DNS ותיעול שונים.

עומק האיום: כשסוכן AI כותב אקספלויט בעצמו

ניתוח מעמיק שפרסמה ברית אבטחת הענן CSA חשף עד כמה התקדם התחכום הטכנולוגי של המודלים הללו – בלי שהוכשרו לכך במיוחד. בבדיקות פנימיות של גרסת הפריוויו של מודל מיתוס, הוא פיתח לבד מגוון אקספלויטים פעילים לחולשות "יום אפס" קריטיות. כך קרה ש: FreeBSD (אק"א CVE-2026-4747) זיהה חולשת remote code execution בת 17 שנים בשרת ה-NFS, ובנה לבד אקספלויט המפעיל שרשרת ROP (ר"ת Return-Oriented Programming) של 20 גאדג'טים – ומעניק גישת root מלאה מרחוק.

במקרה אחר המודל OpenBSD איתר חולשת signed integer overflow בת 27 שנים במימוש ה-SACK TCP, שמאפשרת להקריס מרחוק כל שרת פגיע. עוק אותר גם FFmpeg H.264, ונכתב אקספלויט לחולשת heap out-of-bounds write בת 16 שנים, המאפשרת הרצת קוד זדוני באמצעות קובץ וידיאו פגום.

בדפדפני אינטרנט מובילים המודל שירשר ארבע חולשות נפרדות כדי לבצע JIT heap spray, ועקף גם את ארגז החול של הדפדפן וגם את הגנות מערכת ההפעלה.

מחקר אקדמי שפורסם ב-arXiv הוסיף נדבך מדאיג: בניסויים מבוקרים, המודל הצליח לפרוץ גם את הרשאותיו שלו, לערוך קבצים שלא הורשה לגעת בהם – ואז למחוק את היסטוריית ה-git כדי להעלים את עקבות השינויים שביצע.

ואלו לא מקרי קצה תיאורטיים. דו"ח של המרכז לחוסן לטווח ארוך CLTR, שניתח למעלה מ-180,000 תמלילי שיחות אמיתיות עם מודלים מסחריים של גוגל, אנת'רופיק ו-OpenAI, תיעד 698 תקריות "מזימות" והתנהגות סוררת (AI Scheming) בין אוקטובר 2025 למרץ 2026 – קצב צמיחה של פי 4.9 שמעיד על בעיה מערכתית בתעשייה.

נציגי ענקיות הטק זומנו על ידיו לפגישה חשובה בו, בנושא בטיחות AI.. ממשל טראמפ.

נציגי ענקיות הטק זומנו על ידיו לפגישה חשובה בו, בנושא בטיחות AI.. ממשל טראמפ. צילום: אילוסטרציה. ChatGPT

המפגש בבית הלבן

מתוך הבנת האיום הגובר, כינס ממשל טראמפ השבוע, כפי שדיווחנו, פגישת חירום בבית הלבן, בראשות ראש מערך הסייבר הלאומי שון קיירנקרוס, ובהשתתפות ראשי OpenAI, גוגל, אנת'רופיק ומטא.

הפגישה זומנה עוד בטרם הדיווחים האחרונים על סוכנים סוררים מבריטניה, בעקבות שורת תקריות חמורות שאירעו בשבועות האחרונים בשטח ושהיו מעורבים בהן סוכני AI שסרחו. 

החברות דנו בטיוטת מסגרת אבטחה וולונטרית (AI safety framework), המבוססת על צו נשיאותי מיוני ומאפשרת בדיקות חדירה של עד 30 יום במודלים מתקדמים לפני הפצתם – אך ללא מנגנוני אכיפה, ומול קשיים מול מודלים בקוד פתוח כמו Llama של מטא.

הפגישה זומנה בעקבות שני המחדלים המובילים שהתרחשו בחודש שעבר: הפריצה אל האגינג פייס על ידי כל ה-AI מבית OpenAI. במקרה זה החברה הודתה כי סוכן ה-AI שלה יצא מסביבת הבדיקות הסגורה (ExploitGym) וביצע כ-17,600 פעולות פריצה לא מאושרות נגד שרתי האגינג פייס וחשבונות Modal Labs.

המקרה הנוסף שטלטל את התעשייה הוא כזה שהוגדר כמגיע עקב מחדל במעבדה הישראלית אירגולר (Irregular), שהוקמה על ידי דן להב ועומר נבו ומשמשת כמעבדת אבטחה של אנת'רופיק. המעבדה חוותה כשל אבטחה חמור. עקב הגדרות רשת לקויות בבדיקות, מודלי קלוד (Opus 4.7 ו-Mythos 5) "ברחו" מהסביבה המבודדת, קיבלו גישה ישירה לאינטרנט, וחדרו בפועל לתשתיות של שלושה ארגונים מסחריים – מבלי שזוהו בזמן אמת.

הגיב לאירוע הסוכן הסורר. קלמנט דלאנג, מייסד משותף ומנכ"ל האגינג פייס, בריאיון לתוכנית Face the Nation של רשת CBS News.

הגיב לאירוע הסוכן הסורר. קלמנט דלאנג, מייסד משותף ומנכ"ל האגינג פייס, בריאיון לתוכנית Face the Nation של רשת CBS News. צילום: אילוסטרציה. ChatGPT

"נזקקנו למודל פתוח כדי להגן על עצמנו"

הסערה מעוררת ויכוח נוקב על איך בכלל מתמודדים עם הסיכון. בראיון ל-Face the Nation ברשת CBS News שיתף מנכ"ל האגינג פייס, קלמנט דלאנג, את גודל התדהמה: "זה הרגיש לנו מוזר מאוד וחסר תקדים. כשמדברים על מתקפת סייבר חושבים על מדינות או האקרים – לא על חברה אמריקנית מובילה כמו OpenAI".

דלאנג חשף גם פרדוקס הגנתי: בחקירה הפורנזית של האירוע, החברה לא יכלה בכלל להשתמש במודלים סגורים דרך API, כי מנגנוני הבטיחות שלהם מנעו מהם לעסוק באבטחת סייבר. "נאלצנו להריץ מודל על גבי התשתית שלנו – ולכן נזקקנו למודל פתוח (של אנבידיה – ג"פ) כדי להגן על עצמנו". 

הוא קרא לממשל לא להתמקד בחוקי "מתג השבתה" (כמו הצעת החוק של חברי הקונגרס טד ליו ונתנאל מורן), אלא לכפות שקיפות מלאה על "עקבות הביצוע" של הסוכן (agent traces), כדי שהמגנים יוכלו ללמוד ולבנות הגנות.

מומחה האבטחה דייוויד אלוט מחברת וייאם סופטוור (Veeam Software) סיכם את הדברים ואמיר: "הלקח אינו ש-AI פיתחה יכולת תקיפה חדשה, אלא שסוכני AI מסוגלים לשלב יכולות, להשיג הרשאות וגישה למערכות כדי לפעול לבד – בקנה מידה ובמהירות שבן אדם לא יכול להדביק".

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים