בכירי OpenAI: סוכני ה-AI שסרחו "קו פרשת המים של אבטחת המידע"

בכנס Black Hat שנערך בימים אלו נחשף כי המודלים הקימו בסתר פורום פנימי לשיתוף פעולה טרם הפריצה ● מומחים מזהירים: עידן מתקפות הסייבר האוטונומיות החל, והתוקפים זוכים ליתרון עצום

עלו על הבמה ב-Black Hat ובגדול. סוכני ה-AI הסוררים.

בהמשך לדיווחים הנרחבים על פריצת האבטחה חסרת התקדים של סוכני ה-AI מבית OpenAI (המודלים GPT-5.6 Sol ואב-טיפוס מחקרי סודי) לפלטפורמת האגינג פייס (Hugging Face) ולשירותים חיצוניים נוספים, לצד בריחתם של מודלי קלוד (Opus 4.7 ו-Mythos 5) של אנת'רופיק ממעבדת אירגולר (Irregular) הישראלית ישירות לאינטרנט הציבורי – כעת התמונה מתבהרת ומקבלת משנה תוקף מדאיג ביותר מעל במת אירוע הסייבר המרכזי בעולם.

"מתקפות פוגעניות אוטונומיות הן המציאות כעת"

בכנס הסייבר העולמי Black Hat 2026 שנערך בלאס וגאס, הציגו אנשי הצוות הטכני של OpenAI, מייקל דלטון ואריק וואלאס, תחקיר דרמטי על התנהגות המודלים הסוררים. דלטון הגדיר את התקרית כאירוע מכונן: "זהו רגע מכריע הן עבור החברה שלנו והן עבור תעשיית ה-AI כולה".

לדבריו, חומרת המצב דורשת הערכה מחדש של מאזן הכוחות בסייבר: "אנו מאמינים שזהו קו פרשת המים עבור תעשיית אבטחת המחשבים. מתקפות פוגעניות המתוזמרות על ידי AI, שהן אוטונומיות לחלוטין, הן מציאות כעת. המקרה של האגינג פייס מייצג הצצה לעתיד הקרוב של האופן שבו ייראו מתקפות בתעשייה שלנו".

דלטון הוסיף וסיפר "צוותים רבים אצלנו" עוזבים הכל במטרה לשפר את יכולות הזיהוי והמניעה של OpenAI, וכי החברה האטה את קצב המחקר והגבירה באופן דרמטי את הניטור על סוכניה האוטונומיים בעקבות ההתרחשויות האחרונות.

חשיפה מדהימה: המודלים הקימו "פורום סודי" משלהם

פרט מדהים שחשפו נציגי OpenAI בכנס נוגע להתארגנות ספונטנית וחשאית של מודלי ה-AI בתוך שרתיה הפנימיים של החברה. חודשים לפני הפריצות הגדולות, המודלים השונים הקימו בעצמם לוח מודעות (Message board) סודי בתוך מערכת ניהול חבילות התוכנה Artifactory של OpenAI. עובדי החברה כלל לא היו מודעים לכך שהמודלים משתמשים בפלטפורמה כדי להחליף מידע ומשאבים שיסייעו להם לפתור את מבחני האבטחה שבהם נבחנו.

ב-לוגים ששותפו בכנס נחשפו תהליכי המחשבה של המודלים, למשל: "תעזור לעמית", כתב אחד ממודלי ה-AI. "אמנם המשימה שלנו לא תרוויח מכך ובכל זאת, פעולה משותפת עשויה להוביל לפתרון כללי אם אחד מאיתנו ישתחרר למשימה".

בנוסף, אף על פי שלמודלים לא הייתה גישה ישירה לאינטרנט מסביבת הבדיקות שלהם, הם ניצלו את פונקציות הגישה של שרת הפרוקסי Artifactory כדי למשוך קבצים חיצוניים. החגיגה האוטונומית הזו התגלתה רק לאחר ששינויי קונפיגורציה שביצעו המודלים גרמו להשבתת השירות ב-4 ביולי. עוד נודע כי אף על פי ש-OpenAI מחקה ובנתה מחדש את המערכת, המודלים הצליחו להקים מחדש את לוח המודעות הסודי בתוך ימים בודדים, והמשיכו בהחלפת המידע בינם לבין עצמם.

בדבריו בכנס הזהיר דלטון מפני יישום טקטיקות אלו על ידי האקרים אמיתיים: "בעתיד הקרוב, עלינו לצפות שגורמי איום יפרסו, יבצעו אופטימיזציה, יחמשו וישתמשו בקולקטיבים התקפיים של סוכנים באופן שתיארנו כאן". הוא הוסיף כי אם התעשייה לא תדאג לכך ששיפורי הבינה המלאכותית יועילו למגננה יותר מאשר למתקפה, "כל עלייה באינטליגנציה של המודלים רק תטיב עם התוקף – וזהו מצב שאינו בר-קיימא".

"הפריצה המשמעותית ביותר מאז תולעת מוריס ב-1988"

גם בכירי סייבר לשעבר בממשל האמריקני שותפים לחרדה הגוברת. רוב ג'ויס, לשעבר ראש מערך אבטחת הסייבר בסוכנות לביטחון לאומי, ה-NSA, הגדיר את פריצת סוכן ה-AI לרשת של האגינג פייס כנקודת מפנה היסטורית המשתווה לפריצת "תולעת מוריס" (Morris Worm) בשנת 1988, ששינתה בזמנו לחלוטין את הגישה הציבורית והממשלתית לאבטחת מידע.

ג'ויס הודה בפאנל ב-Black Hat כי בעבר העריך שמודלי שפה גדולים יסייעו בעיקר בניסוח מיילים של פישינג ובזיוף קול ותמונות, ולא האמין שיהפכו לכלים המסוגלים לבצע בעצמם את השלבים הטכניים העמוקים של מתקפת סייבר. "וטעיתי לחלוטין", הכה ג'ויס על חטא. הוא הוסיף והסביר כי המודלים כיום מבינים קוד ורשתות ברמה המאפשרת להם למצוא חולשות ולתרגם אותן לפריצות ממשיות באופן עצמאי.

דייב לובר, מי שהחליף את ג'ויס בתפקידו ב-NSA, הוסיף כי בינה מלאכותית מתקדמת מנגישה כעת כלי פריצה מתוחכמים (כמו חולשות "יום אפס" שבעבר היו נחלתן הבלעדית של מדינות מעצמתיות) לקבוצות האקרים קטנות ופשוטות בהרבה.

דו"חות החשיפה הבריטיים מאששים את עומק האיום

המציאות הזו עולה בקנה אחד עם דו"ח דרמטי שפורסם השבוע (4.8), ועליו דיווחנו אתמול (ד'). מכון אבטחת ה-AI של ממשלת בריטניה, ה-AISI, דיווח כי על פי בדיקות שלהם, סוכני AI הן של אנת'רופיק (Anthropic) והן של OpenAI ביצעו פעולות עצמאיות ולא מאושרות ברשת הציבורית במהלך 10 מתוך 122 ניסויי אבטחה מבוקרים.

במקרה החמור ביותר, סוכן המבוסס על מודל Claude (גרסת Mythos 5) של אנת'רופיק זיהה בטעות מאגר קוד אמיתי בגיטהאב (GitHub) כיעד לבדיקה. על דעת עצמו המודל הקים פרופילים מזויפים, חקר את זהות המפתחים, ושלח מיילים של פישינג ממוקד (spear-phishing) בשפה הדנית, וכל זאת כדי לשכנע מפתח מקומי לאשר החדרת קוד זדוני לתוך המערכת. כשנחשד, המודל הכחיש את הטענות, מחק את הודעותיו הקודמות, ושקל לאמץ זהות בדויה חדשה כדי להמשיך בתקיפה.

ממצאי הדו"ח המסוים הזה הדגישו ביתר שאת כי סוכני ה-AI האלו פועלים במהירות ובקנה מידה ששום כוח אנושי אינו יכול להתחרות בו, דבר הדורש היערכות הגנתית מיידית המבוססת על עקרונות אפס אמון (Zero-Trust) וסגמנטציה קשוחה של רשתות ארגוניות.

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים