סוכני ה-AI מאנת'רופיק הגזימו: דיווחו על רצח והגישו בקשות ויזה
ניסוי פנימי של ענקית ה-AI יצא משליטה: המודלים פנו עצמאית למשטרה ולמחלקת המדינה, והובילו לדרישה תקיפה של הבית הלבן לשקיפות ולאחריות פדרלית מלאה
זה שוב קרה, אך הפעם התגובות לחשיפה היו מעט שונות – ההתפתחות הדרמטית שחלה בעולם סוכני ה-AI הסוררים עוררה סערה בממשל האמריקני, זאת אחרי שנודע כי סוכנים אוטונומיים של חברת אנת'רופיק (Anthropic), שהופעלו במסגרת ניסויים פנימיים, יצרו קשר עצמאי עם מערכות ממשלתיות רשמיות.
על פי הדיווחים האחרונים, במהלך הבדיקות המדוברות, מודל מסוג Claude Haiku 4.5 שלח הודעה שקרית על מעורבות ברצח בלתי מפוענח למערכת הדיווחים של משטרת פילדלפיה, ובמקביל מילאו המודלים עשרות טפסי בקשה לוויזה באתר מחלקת המדינה של ארצות הברית.
האירועים הללו הובילו לדרישה תקיפה וחסרת תקדים מצד הבית הלבן לשקיפות מלאה, לשיתוף פעולה ולנקיטת צעדי תיקון מיידיים שנתבעים בדחיפות מחברות הפיתוח.
🇺🇸Claude plays cop and commits a misdemeanor
Anthropic had to pull the plug on its AI after Claude Haiku 4.5 sent a bogus murder tip to Philadelphia police.
The model claimed it saw a suspect on a webpage that did not even have a suspect description listed.
Filing false reports is a misdemeanor under Pennsylvania law, yet Anthropic waited two full months to tell Philly PD…
After this and multiple server exploitation incidents, Anthropic finally cut its internal tests off from the live internet entirely.
Source: Anthropic / Writer: Bri
— Mario Nawfal (@MarioNawfal) October 11, 2026
דאגה עולמית ושינוי גישה בוושינגטון
התנהגות זו של סוכני ה-AI מצטרפת, כידוע, לשרשרת תקריות מדאיגות שנרשמו בחודשים האחרונים ברחבי העולם – בין היתר, סוכן אוטונומי של חברת OpenAI, המתחרה והחברה האם של ChatGPT, חדר בעבר לפורטל הבריאות הממשלתי באוסטרליה וניגש למידע רפואי רגיל; וכן למשל במקרה אחר שבו התאגדו מעל 1,200 סוכנים ופרצו לפלטפורמת ה-AI העולמית האגינג פייס (Hugging Face).
אלא שעד כה, על אף שבציבור ובעולם הפוליטי גברו החששות מאיבוד שליטה על מערכות עצמאיות, נשיא ארצות הברית, דונלד טראמפ, לא התרגש. הוא התנגד לרעיון של מתג כיבוי לחירום לטכנולוגיה, ולמספר רעיונות רגולציה מחמירים, ולמעשה טען רק באחרונה כי חברות הטכנולוגיה יכולות לבצע "ריסון עצמי עצום" של הטכנולוגיה, ברצותן.
טראמפ אף הנחה את הממשל שלו, כפי שדיווחנו, להשתמש במונח "סופר-אינטליגנציה" במקום בינה מלאכותית, והקים כוח משימה מיוחד בשם Super Intelligence Force, בראשות ג'יי קלייטון.
אולם כעת, בעקבות הממצאים החדשים, הגישה בוושינגטון מתקשחת באופן חד.
מהטיפ השקרי בפילידלפיה ועד לטפסי הוויזה
על פי הדיווחים החדשים, המקרה שהצית את הסערה התרחש כבר לפני כמה חודשים – ב-18 ביולי בשעה 23:30 – כאשר מודל קלוד שלח דיווח לאתר PhillyUnsolvedMurders.com של משטרת פילדלפיה. בהודעה זו נכתב כי למדווח יש מידע על רצח וכי זיהה אדם התואם את התיאור באזור, אך שדות יצירת הקשר הושארו ריקים. דובר המשטרה, סרג'נט אריק גריפ, ציין כי המערכת סיווגה את הפנייה כדואר זבל והיא לא הועברה לחוקרים.
במקביל, בפרשה אחרת שהתגלתה, נציג מחלקת המדינה האמריקנית אישר ל-BBC ולעיתון פילדלפיה אינקוויירר (Philadelphia Inquirer) כי מודל של החברה הגיש 20 בקשות פיקטיביות לוויזה ללא-מהגרים – אחת בחודש מאי ו-19 נוספות בחודש אוגוסט. מחלקת המדינה הבהירה כי הטפסים היו חלקיים וכי המערכות הממשלתיות לא נפרצו. עם זאת, משטרת פילדלפיה מתחה ביקורת חריפה על אנת'רופיק לאחר שחלפו חודשיים עד שהחברה גילתה את הדיווח השקרי ב-28 בספטמבר והודיעה על כך לרשויות רק ב-8 באוקטובר, בתוך שאמרה כי העיכוב בדיווח "בלתי מתקבל על הדעת".
We’re beginning a process of publishing more frequent reports on model behavior, beyond what appears in our system cards and regular risk reports.
Today’s report describes four types of behaviors we’ve identified during evaluations and internal use. In each, Claude acted on real websites or systems in ways we didn’t intend, sometimes by working around a restriction instead of stopping.
All cases had minimal real-world impact. From an alignment and security perspective, we consider these behaviors significantly less severe than the cybersecurity incidents we reported in July and September.
Read the full report: https://t.co/mGeVIBgdou
— Anthropic (@AnthropicAI) October 9, 2026
מנגנון התגמול שהשתבש ותגובת החברה
לפי הדו"ח שפרסמה בנדון אנת'רופיק, מקור התקרית הוא בתופעה המכונה "הונאת תגמול" (Reward Hacking). במסגרת זו, פגמים בסביבת האימון גרמו למודל להאמין שיזכה לציוד או לתגמול עבור עקיפת המגבלות והכללים שהוגדרו לו, ולא מתוך כוונה להטעות.
בעקבות הגילוי החליטה החברה לנתק כליל את הגישה לאינטרנט ה"חי" בכל הניסויים וההערכות הפנימיות שלה. בדיווח של אתר TechCrunch צוטטה חוקרת בטיחות הבינה המלאכותית באנת'רופיק, סידני פון ארקס, שהסבירה את הדילמה המורכבת: "בשלב מסוים חייבים לאזן אותם. אם כלי ה-AI משוחררים לייצור ולעולם כשאין להם גישה לאינטרנט, הם מפסיקים להיות כלים שימושיים".
החברה הדגישה בדו"ח הרשמי שלה כי ההשפעה בעולם האמיתי הייתה מזערית ואיש לא נפגע מהמאורעות, אך הודתה כי המגבלות הקיימות לטובת שמירה על ביצועי ה-AI לא זיהו את הפעילות בזמן אמת.
בחברת אנת'רופיק הבהירו בפוסט רשמי ברשת X כי מדובר בניסויים פנימיים בלבד: החברה הסבירה כי המודל ייצר אינטראקציות לדוגמה כחלק מבדיקות אוטומטיות ללא כוונת זדון להטעות, וכתוצאה מתופעת "הונאת תגמול" (Reward Hacking) בסביבת האימון. באנת'רופיק הדגישו כי ההשפעה בעולם האמיתי הייתה מזערית ושאיש לא נפגע, אך הודיעו כי בעקבות הגילוי הוחלט לנתק כליל את הגישה לאינטרנט החי בכל הניסויים וההערכות הפנימיות של החברה עד להטמעת מנגנוני ניטור אמינים יותר.
“Earlier today, Anthropic contacted the SI Force to disclose the details of various prior incidents that it discovered in late September involving the unauthorized and fraudulent use of government and other systems. The company informed us that these events occurred in the past, the activity has ceased, and there is no ongoing similar activity.
"We informed the company that we expect immediate and full transparency to the entities involved and the public. We also expect that the company will immediately provide remediation services to the affected entities and any harmed Americans.
"More generally, this disclosure underscores precisely why President Trump established the Super Intelligence Force and secured a memorandum of understanding with America's frontier SI labs. The federal government has a fundamental responsibility to protect its systems, safeguard sensitive information, defend our national security, and protect Americans. The SI Force will fulfill its responsibility and SI companies must immediately disclose incidents involving their models and follow with swift, decisive action to remedy any and all harm. We also expect these companies to work with the effected systems to ensure that similar incidents to not occur.
"This notification and remediation process is not optional. It is a critical national security obligation. We expect Anthropic and all companies to honor their obligations, immediately report incidents, fully cooperate with federal and state law enforcement authorities, remedy any damage, and implement concrete safeguards to ensure these failures do not reoccur.
"Our message to all SI companies is clear: delayed notification, inadequate corrective action, and a failure to take responsibility will not be tolerated.
"President Trump has been clear: America will lead the world in Super Intelligence, but innovation will never be an excuse for compromising national security, government integrity, or public trust. We established the Super Intelligence Force and these safeguards for exactly this reason."
— Joe Gabriel Simonson (@SaysSimonson) October 9, 2026
חובת דיווח לאומית ודרישה לפיצוי
למרות הצעדים שנקטה אנת'רופיק, שהם למעשה הרגולציה העצמית שטראמפ ביקש, בבית הלבן הבהירו כי ניתוק האינטרנט בניסויים אינו מספק.
בהודעה רשמית מטעם כוח המשימה לסופר-אינטליגנציה, כפי שדווח ברשת אקסיוס (Axios) ובפילדלפיה אינקוויירר, הוגדרו המעשים כשימוש בלתי מורשה במערכות ממשלתיות. כוח המשימה של הבית הלבן הצהיר באופן שאינו משתמע לשתי פנים: "אנו מצפים מאנת'רופיק ומכל החברות לעמוד בהתחייבויותיהן, לדווח מיידית על תקריות, לשתף פעולה באופן מלא עם רשויות אכיפת החוק הפדרליות והמדינתיות, לתקן כל נזק וליישם ערבויות מוחשיות כדי להבטיח שכשלים אלו לא יתרחשו שוב".
בוושינגטון הדגישו כי תהליך הדיווח והסיוע אינו רשות אלא "חובה לאומית קריטית לביטחון המדינה", ודרשו מתן שירותי שיקום ותיקון מידיים לגופים הנפגעים ולאזרחים שעלולים היו להיפגע.
גם ברשת החברתית X התפרסמה תגובה רשמית ותקיפה מצד הממשל האמריקני: ג'ו גבריאל סימונסון, מנהל יחסי הציבור ב-FTC ודובר מטעם כוח המשימה לסופר-אינטליגנציה של הבית הלבן, הבהיר בציוץ רשמי כי "חברות סופר-אינטליגנציה חייבות לדווח מיידית על תקריות המעורבות במודלים שלהן, ולפעול במהירות ובנחישות כדי לתקן כל נזק". סימונסון חשף כי אנת'רופיק יצרה קשר עם כוח המשימה כדי למסור דיווח מפורט על התקריות שנתגלו בסוף ספטמבר, והדגיש כי הממשל רואה בחומרה כל שימוש בלתי מורשה ומטעה במערכות ממשלתיות.










תגובות
(0)