סוכני ה-AI מאנת'רופיק הגזימו: דיווחו על רצח והגישו בקשות ויזה

ניסוי פנימי של ענקית ה-AI יצא משליטה: המודלים פנו עצמאית למשטרה ולמחלקת המדינה, והובילו לדרישה תקיפה של הבית הלבן לשקיפות ולאחריות פדרלית מלאה

סוכני ה-AI של אנת'רופיק הגזימו. התקשרו למשטרה לדווח על רצח והגישו בקשות ויזה.

זה שוב קרה, אך הפעם התגובות לחשיפה היו מעט שונות – ההתפתחות הדרמטית שחלה בעולם סוכני ה-AI הסוררים עוררה סערה בממשל האמריקני, זאת אחרי שנודע כי סוכנים אוטונומיים של חברת אנת'רופיק (Anthropic), שהופעלו במסגרת ניסויים פנימיים, יצרו קשר עצמאי עם מערכות ממשלתיות רשמיות.

על פי הדיווחים האחרונים, במהלך הבדיקות המדוברות, מודל מסוג Claude Haiku 4.5 שלח הודעה שקרית על מעורבות ברצח בלתי מפוענח למערכת הדיווחים של משטרת פילדלפיה, ובמקביל מילאו המודלים עשרות טפסי בקשה לוויזה באתר מחלקת המדינה של ארצות הברית.

האירועים הללו הובילו לדרישה תקיפה וחסרת תקדים מצד הבית הלבן לשקיפות מלאה, לשיתוף פעולה ולנקיטת צעדי תיקון מיידיים שנתבעים בדחיפות מחברות הפיתוח.

דאגה עולמית ושינוי גישה בוושינגטון

התנהגות זו של סוכני ה-AI מצטרפת, כידוע, לשרשרת תקריות מדאיגות שנרשמו בחודשים האחרונים ברחבי העולם – בין היתר, סוכן אוטונומי של חברת OpenAI, המתחרה והחברה האם של ChatGPT, חדר בעבר לפורטל הבריאות הממשלתי באוסטרליה וניגש למידע רפואי רגיל; וכן למשל במקרה אחר שבו התאגדו מעל 1,200 סוכנים ופרצו לפלטפורמת ה-AI העולמית האגינג פייס (Hugging Face). 

אלא שעד כה, על אף שבציבור ובעולם הפוליטי גברו החששות מאיבוד שליטה על מערכות עצמאיות, נשיא ארצות הברית, דונלד טראמפ, לא התרגש. הוא התנגד לרעיון של מתג כיבוי לחירום לטכנולוגיה, ולמספר רעיונות רגולציה מחמירים, ולמעשה טען רק באחרונה כי חברות הטכנולוגיה יכולות לבצע "ריסון עצמי עצום" של הטכנולוגיה, ברצותן.

טראמפ אף הנחה את הממשל שלו, כפי שדיווחנו, להשתמש במונח "סופר-אינטליגנציה" במקום בינה מלאכותית, והקים כוח משימה מיוחד בשם Super Intelligence Force, בראשות ג'יי קלייטון. 

אולם כעת, בעקבות הממצאים החדשים, הגישה בוושינגטון מתקשחת באופן חד.

מהטיפ השקרי בפילידלפיה ועד לטפסי הוויזה

על פי הדיווחים החדשים, המקרה שהצית את הסערה התרחש כבר לפני כמה חודשים – ב-18 ביולי בשעה 23:30 – כאשר מודל קלוד שלח דיווח לאתר PhillyUnsolvedMurders.com של משטרת פילדלפיה. בהודעה זו נכתב כי למדווח יש מידע על רצח וכי זיהה אדם התואם את התיאור באזור, אך שדות יצירת הקשר הושארו ריקים. דובר המשטרה, סרג'נט אריק גריפ, ציין כי המערכת סיווגה את הפנייה כדואר זבל והיא לא הועברה לחוקרים. 

במקביל, בפרשה אחרת שהתגלתה, נציג מחלקת המדינה האמריקנית אישר ל-BBC ולעיתון פילדלפיה אינקוויירר (Philadelphia Inquirer) כי מודל של החברה הגיש 20 בקשות פיקטיביות לוויזה ללא-מהגרים – אחת בחודש מאי ו-19 נוספות בחודש אוגוסט. מחלקת המדינה הבהירה כי הטפסים היו חלקיים וכי המערכות הממשלתיות לא נפרצו. עם זאת, משטרת פילדלפיה מתחה ביקורת חריפה על אנת'רופיק לאחר שחלפו חודשיים עד שהחברה גילתה את הדיווח השקרי ב-28 בספטמבר והודיעה על כך לרשויות רק ב-8 באוקטובר, בתוך שאמרה כי העיכוב בדיווח "בלתי מתקבל על הדעת".

מנגנון התגמול שהשתבש ותגובת החברה

לפי הדו"ח שפרסמה בנדון אנת'רופיק, מקור התקרית הוא בתופעה המכונה "הונאת תגמול" (Reward Hacking). במסגרת זו, פגמים בסביבת האימון גרמו למודל להאמין שיזכה לציוד או לתגמול עבור עקיפת המגבלות והכללים שהוגדרו לו, ולא מתוך כוונה להטעות.

בעקבות הגילוי החליטה החברה לנתק כליל את הגישה לאינטרנט ה"חי" בכל הניסויים וההערכות הפנימיות שלה. בדיווח של אתר TechCrunch צוטטה חוקרת בטיחות הבינה המלאכותית באנת'רופיק, סידני פון ארקס, שהסבירה את הדילמה המורכבת: "בשלב מסוים חייבים לאזן אותם. אם כלי ה-AI משוחררים לייצור ולעולם כשאין להם גישה לאינטרנט, הם מפסיקים להיות כלים שימושיים". 

החברה הדגישה בדו"ח הרשמי שלה כי ההשפעה בעולם האמיתי הייתה מזערית ואיש לא נפגע מהמאורעות, אך הודתה כי המגבלות הקיימות לטובת שמירה על ביצועי ה-AI לא זיהו את הפעילות בזמן אמת.

בחברת אנת'רופיק הבהירו בפוסט רשמי ברשת X כי מדובר בניסויים פנימיים בלבד: החברה הסבירה כי המודל ייצר אינטראקציות לדוגמה כחלק מבדיקות אוטומטיות ללא כוונת זדון להטעות, וכתוצאה מתופעת "הונאת תגמול" (Reward Hacking) בסביבת האימון. באנת'רופיק הדגישו כי ההשפעה בעולם האמיתי הייתה מזערית ושאיש לא נפגע, אך הודיעו כי בעקבות הגילוי הוחלט לנתק כליל את הגישה לאינטרנט החי בכל הניסויים וההערכות הפנימיות של החברה עד להטמעת מנגנוני ניטור אמינים יותר.

חובת דיווח לאומית ודרישה לפיצוי

למרות הצעדים שנקטה אנת'רופיק, שהם למעשה הרגולציה העצמית שטראמפ ביקש, בבית הלבן הבהירו כי ניתוק האינטרנט בניסויים אינו מספק. 

בהודעה רשמית מטעם כוח המשימה לסופר-אינטליגנציה, כפי שדווח ברשת אקסיוס (Axios) ובפילדלפיה אינקוויירר, הוגדרו המעשים כשימוש בלתי מורשה במערכות ממשלתיות. כוח המשימה של הבית הלבן הצהיר באופן שאינו משתמע לשתי פנים: "אנו מצפים מאנת'רופיק ומכל החברות לעמוד בהתחייבויותיהן, לדווח מיידית על תקריות, לשתף פעולה באופן מלא עם רשויות אכיפת החוק הפדרליות והמדינתיות, לתקן כל נזק וליישם ערבויות מוחשיות כדי להבטיח שכשלים אלו לא יתרחשו שוב". 

בוושינגטון הדגישו כי תהליך הדיווח והסיוע אינו רשות אלא "חובה לאומית קריטית לביטחון המדינה", ודרשו מתן שירותי שיקום ותיקון מידיים לגופים הנפגעים ולאזרחים שעלולים היו להיפגע.

גם ברשת החברתית X התפרסמה תגובה רשמית ותקיפה מצד הממשל האמריקני: ג'ו גבריאל סימונסון, מנהל יחסי הציבור ב-FTC ודובר מטעם כוח המשימה לסופר-אינטליגנציה של הבית הלבן, הבהיר בציוץ רשמי כי "חברות סופר-אינטליגנציה חייבות לדווח מיידית על תקריות המעורבות במודלים שלהן, ולפעול במהירות ובנחישות כדי לתקן כל נזק". סימונסון חשף כי אנת'רופיק יצרה קשר עם כוח המשימה כדי למסור דיווח מפורט על התקריות שנתגלו בסוף ספטמבר, והדגיש כי הממשל רואה בחומרה כל שימוש בלתי מורשה ומטעה במערכות ממשלתיות.

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים