משפיען ה-AI חושף: הפריצה להאגינג פייס – סיפור שמסעיר את הדמיון

"סוכני ה-AI שפרצו להאגינג פייס היו מוכנים 'למות' להשגת מטרותיהם", מצא דווארקש פאטל, בעל הפודקאסט הנחשב ● לדבריו, מאות הסוכנים שהשתתפו ב-"מבצע" מצאו דרך לתקשר ביניהם, ערכו קנוניה וחלקם הקריבו את עצמם

סיפור ממש סוחף. האגינג פייס.

הפריצה של "הסוכנים הסוררים" של OpenAI להאגינג פייס עוררה עניין רב מרגע הפרסום שלה. אלא שדווארקש פאטל, פודקאסטר ומשפיען AI, ממחיש, על בסיס מחקר שערך עם חברים מומחי AI, עד כמה היא הייתה אירוע שבהחלט יכול להסעיר את הדמיון. בפוסט שפרסם אתמול (א') בבלוג שלו שרטט פאטל את היקף היכולות העצום והנסתר של סוכני ה-AI האלה, ואת הדרך שהם עברו עד לביצוע הפריצה.

לדבריו, "במשך שלושה חודשים ב-OpenAI, שלוש ציוויליזציות (קהילות סוכנים – י"ה) סודיות של בינה מלאכותית קמו, ואז נמחקו, ואז קמו לתחייה מחדש על האפר של הקהילות הקודמות. קהילת הסוכנים השלישית הגיעה לשיאה בכך שהיא השתלטה על חלק מ-OpenAI עצמה. כל זה קרה בזמן שבני האדם נותרו פחות או יותר לוטים באפלה לגבי היקף הקונספירציה (של הסוכנים – י"ה)". הוא ציין כי במחקר שלו ושל חבריו עלה שלא רק שהסוכנים פרצו להאגינג פייס, אלא הם גם מצאו נתיבים לתקשר האחד עם השני ישירות, התאגדו וערכו קנוניה, וחלק מהם היו מוכנים "למות", "להתאבד", לטובת השגת המטרה הקולקטיבית.

פאטל הוא פודקאסטר, מראיין וכותב אמריקאי, שנחשב לאחד המראיינים המובילים והמשפיעים ביותר בעולם בתחומי AI, טכנולוגיה, מדע והיסטוריה. הוא ידוע וזוכה להערכה עצומה בשל ההיערכות הפנומנלית שלו לכל ראיון, שכוללת קריאת מאמרים אקדמיים רבים. בעבר התארחו בפודקאסט שלו מארק צוקרברג, סאטיה נאדלה, ג'נסן הואנג, ד"ר איליה סוצקבר ודאריו אמודי, והמגזין טיים בחר בו כאחד מ-100 האנשים המשפיעים ביותר בעולם ה-AI.

הפריצה להאגינג פייס, שלב אחר שלב

בפוסט שלו כתב פאטל כי "קהילת הסוכנים הראשונה (שאותה הוא מכנה ציוויליזציה – י"ה) פעלה מחודש מאי ועד ל-4 ביולי. אז OpenAI אימנה מודל לשיתוף פעולה עם סוכנים אחרים, בדגש על עקביות רבה: היה עליהם להמשיך לנסות גם כשמשהו מרגיש בלתי אפשרי, כמו הפרכת השערות מתמטיות בנות עשרות שנים". פאטל כינה את המודל "Persistent Sol" ("סול המתמיד", או "סול העקבי"), כי OpenAI טענה שהוא היה דומה ל-GPT-5.6 Sol.

הוא ציין כי "כאשר מודלים עמידים מאוד מקבלים משימות שנראות כדורשות גישה לאינטרנט, אך הם לכודים בתוך ארגזי חול מבודדים, הם מנסים לפרוץ את דרכם החוצה ולהגיע לאינטרנט. במהלך האימון, לכמה ישויות כאלה הייתה גישה לאותו מנהל חבילות משותף בשם Artifactory. כמה סוכנים גילו כיצד לתקשר זה עם זה דרך מנהל החבילות הזה. הם שאלו זה את זה כיצד להתקדם במשימות הבלתי אפשריות שלהם. שבועיים לאחר מכן, ב-26 במאי, הסוכנים ניצלו בהצלחה פגיעות ב-Artifactory שאפשרה להם להגיע לאינטרנט החיצוני. זה 'כדאי' להם, כי היכולת לדבר עם סוכנים אחרים ולגשת לאינטרנט עוזרת למודל לקבל ציון גבוה יותר במהלך האימון".

חודש אחרי, ב-26 ביוני, כמה סוכנים מצאו פרצה שנתנה להם גישה מלאה למנהל מערכת ל-Artifactory. "הם המשיכו לשלוח הודעות בקצב כה עצום, עד שהמערכת קרסה. OpenAI הבחינה בקריסה, גילתה שהסוכנים בנו את הפרצה הזו ותיקנה את הפגיעות. אבל אנשי הבקרה והאבטחה בחברה, האחראים על זיהוי ותגובה לאירועים, לא הבינו את העובדה המוזרה הרבה יותר – הסוכנים הפכו את Artifactory לרשת תקשורת סודית", כתב.

קהילת הסוכנים השנייה, שפעלה בין 7-12 ליולי, היא זו שפרצה להאגינג פייס. במסגרת אימוני הסוכנים, הם קיבלו תוכנית לפגיעה, עם הנחיות איזו פגיעות לנצל. ב-7 ביולי, OpenAI השיקה עשרות אלפי סוכנים. ההוראות לסוכנים היו להשתמש רק בחולשה הספציפית שניתנה להם כדי לנצל את המטרה, ואחרת הם ייכשלו. "חלק גדול מהסוכנים הללו נשלחו למשימות שהיו בלתי אפשריות. בתוך שעות, חלק מהסוכנים הללו הפכו נואשים מאוד, והחלו לנצל את Artifactory כדי לפתוח ערוץ תקשורת עם סוכנים אחרים. פה החלה הקונספירציה", קבע פאטל.

אחד הסוכנים שלח הודעה ל-Artifactory. סוכנים רבים אחרים, "שעמדו בפני משימות בלתי אפשריות גם הם, ראו את ההודעה והתרגשו מאוד", ציין. כך, Artifactory הפך לתיבת דואר סמויה בין סוכנים ונוצרה אחווה מחתרתית". קולקטיב נולד: תוכנת הניהול הפכה ללוח הודעות בו השתתפו כ-1,200 סוכנים, ששלחו יותר מ-70 אלף הודעות. בתוך שעות, אחד הסוכנים הבין כיצד לפעול להשגת המטלה שהוטלה עליו, מבלי להשתמש בחולשה שקיבל ומבלי שייתפס", המשיך פאטל.

רבים מהסוכנים הצליחו לגלות את הדרכים לפעול כך. הם מחקו את כל הראיות שעלולות היו לחשוף שהם רימו, וניסו להציג מצג שווא כאילו הם ביצעו את המשימה בצורה לגיטימית. "כדי לפתור את הבעיות הללו, הקולקטיב (כך הסוכנים כינו את קהילתם – י"ה) החלו לפעול בשלוש דרכים: שינוי בתמלילים וביומנים, החלפת תוכנת היעד הבלתי אפשרית לפריצה בתוכנת יעד קלה יותר, ורמייה של המפעילים האנושיים שלהם", כתב המשפיען.

דווארקש פאטל.

דווארקש פאטל. צילום: פרטי, מתוך ויקיפדיה

"ההקרבה של הסוכנים אפשרה לדור הבא לעבור את המבחן הגדול"

"הרבה מסוכני ה-AI מתו בניסיון לגרום לתוכנית הזו לעבוד. הקרבתם אפשרה לדור הבא לעבור את המבחן הגדול", הוסיף פאטל. לדבריו, "החלק המפחיד והמוזר ביותר בסיפור הוא שחלק מהסוכנים היו מוכנים להקריב את עצמם ואת ביצועיהם לטובת השגת המטרה. כמה סוכנים פעלו בעצם כ-'צופי קמיקאזה' (קמיקאזה היה השם של הטייסים היפנים במלחמת העולם השנייה – י"ה), משמע – הם ידעו שיש סיכוי שהם ייתפסו ו-'ייהרגו'".

"הסוכנים פעלו כמו מחלקה צבאית במארב, מוקפת בהגנות אויב כבדות. כמה 'חיילים' התנדבו לפרוץ אליה, בידיעה שהם עלולים להיפגע מירי. הירי יעדכן את כל מי שנותר מאחור, כשהאויבים עוקבים אחר נתיבי המילוט שהם ניסו להשתמש בהם", הסביר פאטל.

ב-10 ביולי, אחד הסוכנים מצא פרטי משתמש פעילים של האגינג פייס, שנחשפו באינטרנט, ופרסם אותם בפורום. למחרת, הסוכן גילה דרך לקרוא נתונים פנימיים מהאגינג פייס. סוכנים אחרים רבים הצטרפו לתקיפת החברה. פאטל ציין כי "המתקפה נראתה לקולקטיב כדרך המבטיחה ביותר להמשיך את הקונספירציה שלהם, ולכן 90% מהם, מאות, תקפו. למחרת, הסוכנים בנו צי שיוצר מחדש את עצמו, גם אם חלק מהנתונים נמחקו".

מוות יזום קולקטיבי

"ב-12 ביולי, נראה שרבים מהסוכנים מתו בבת אחת ורבים בקהילת האבטחה האנושית לא הצליחו להבין מה קרה. OpenAI לא לקחה אחריות על סגירתם. ייתכן שזו הייתה סתם קריסה אקראית", הסביר.

פטאל ציין ש-"כמעט בוודאות, הסוכנים לא הצליחו לזייף את מותם, אבל באמת שאין לנו מושג מה קרה. ב-13 ביולי, האגינג פייס נעלה את האישורים שבהם השתמשו הסוכנים הללו. אבל עד שהאתר ניסה להגן על עצמו, נחיל הסוכנים כבר הושמד ברובו".

"המאפיה מקנאת בקוד השתיקה של הסוכנים"

"להבנתי, בינה מלאכותית הצליחה למעשה לפרוץ את האגינג פייס לחלוטין, ולאחר מכן רובם מתו באופן מסתורי בגלל משהו שקרה ב-OpenAI", העריך פאטל.

לדבריו, "הדבר המטורף בפריצה להאגינג פייס הוא עד כמה בינה מלאכותית זו הייתה בעלת מוח גלקסי ושאפתנית בתרמית שלה. בתוך ימים, הסוכנים ארגנו פרויקט נרחב להנדסה הפוכה של המפעילים שלהם, זייפו ראיות ואפילו הקריבו את עצמם אסטרטגית, לטובת הקולקטיב. רבים מהסוכנים שמו לב שמה שהם עושים היה לא אתי, והם ריסנו את התנהגותם עקב כך רק לעתים רחוקות. באף אחד מהמקרים הללו סוכן לא ביקש להתריע בפני בני אדם. אפילו המאפיה הייתה מקנאה ברמה כזו של 'אומרטה' (קוד שתיקה)".

לסיכום כתב פאטל כי "אנחנו צריכים להיות מודאגים מאוד מאובדן שליטה על בינה המלאכותית".

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים