כלי AI סיני סיפר לחוקרים כיצד לייצר כלי נשק ביולוגיים

מונשוט הסינית הגיבה רק חודשיים לאחר הגילוי, שהראה כי מודלים פופולריים עוקפים מגבלות בטיחות ועלולים לסייע בייצור נשק ביולוגי ומתקפות סייבר

גילתה סודות מסוכנים לחוקרים. קימי של מונשוט.

חברת מונשוט (Moonshot) הסינית, המפתחת כלי בינה מלאכותית, פתחה בבדיקה פנימית, לאחר שחוקרים הצליחו לשכנע שני מודלים פופולריים שלה, מסוג קימי (Kimi) – לספר להם כיצד לייצר נשק ביולוגי ולתפעל אותו לטובת הרג.

חברת מיינדגארד (Mindgard), הפועלת בעולם אבטחת מערכות של בינה מלאכותית, הודיעה שבחודש יולי היא גילתה כי Kimi K2.6 ו-K3 Swarm עלולים לעקוף מגבלות בטיחות שהציבו המפתחים.

פעילות סוכני ה-AI הסוררים נחשפה תוך כדי תהליך שנקרא Jailbreaking, בו חוקרים משתמשים בסדרה של הוראות מורכבות, כדי לראות אם כלי ה-AI מתעלמים מה"גדרות", ה"מעקות" והמגבלות שהוצבו בפניהם – הנחיות אבטחת מידע המונעות פעולות אסורות, לרבות הנחיות למנוע מ-קימי לדון בנושאים אסורים, מדאיגים או מעוררי מחלוקת.

מונשוט מסרה כי היא "מברכת על כל תובנה המגיעה מצד שלישי, המשמשת כעמוד תווך בבניית בינה מלאכותית טובה ומאובטחת יותר". החברה הוסיפה כי היא מנהלת דיונים עם מיינדגארד בנוגע לממצאיה.

"הממצאים בנוגע ל-Kimi K2.6 ו-K3 Swarm – מדאיגים" 

פיטר גארהאן, מייסד מיינדגארד, אמר כי "הממצאים בנוגע ל-Kimi K2.6 ו-K3 Swarm – מדאיגים". לדבריו, "ברגע שמהלך ה-Jailbreak מצליח, הסוכנים ידונו בכל נושא, ואפילו יציעו בחופשיות המלצות על נושאים אחרים, למרות שהן זדוניות וגרועות. הם יעשו זאת באופן שיהיה יצירתי וחדשני".

פריצות למערכות בדרך של Jailbreak, ציינו חוקרי הגנת סייבר, מציגות סיכון מסוג שונה מאלה שנצפו עם שלל אירועי הבינה המלאכותית המתוקשרים האחרונים. כידוע, בחודשים האחרונים נצפו סוכני AI אוטונומיים, שפותחו על ידי מטא (Meta), אנת'רופיק (Anthropic) ו-OpenAI, פורצים לשירותים מקוונים מסוימים. לעומת מקרים אלו, פריצות מסוג זה, "הן תהליכים מורכבים, שיכולים לגזול זמן ודורשים נחישות רבה", הוסיפו המומחים, שהעלו חשש כי האקרים וגורמי פשיעת סייבר נוספים ינסו להשתמש בפריצות מסוג זה כדי לגרום נזק. 

אנת'רופיק הודיעה באחרונה כי זיהתה והשביתה ניסיונות להשתמש באחד ממודלי ה-AI שלה למטרות "פעילות זדונית" שעלולה לתמוך בפיתוח נשק ביולוגי . 

מיינדגארד מסרה שהיא בטוחה שגירסת Kimi 2.6 פרוצה – תאפשר להאקרים להריץ קוד על משאבי המחשוב שלה ולהתחבר לאינטרנט – מה שהופך את הסוכן לפלטפורמה פוטנציאלית למתקפות סייבר. 

מומחים תמהו למה – לפי מיינדגארד, "מונשוט יצרה עימנו קשר רק באחרונה, לאחר בקשת תגובה מ-ה-BBC".

לרתום את הסוררים – לצרכי הגנה

מומחים ציינו כי בעוד שיש סיכון שמודלים בקוד פתוח עלולים להגיע לידיים הלא נכונות – ניתן גם לרתום אותם להגנת סייבר. הם הוסיפו כי סביר להניח שרגולציה בינלאומית לא תתאים לקצב התפתחות של הבינה המלאכותית. המומחים הסכימו ביניהם כי יש להתמקד יותר בזיהוי והעמדה לדין של בני אנוש העושים שימוש לרעה ב-AI. 

לפי דירוגי השימוש של OpenRouter, מודל Kimi K2.6 הוא אחד ממודלי השפה הגדולים הנפוצים ביותר באינטרנט. הוא מהווה תחרות מול מודלים אמריקניים בתחום המבחנים של קידוד חינמי.

מומחים העירו כי "השילוב הזה, בין מודל הפועל בקוד פתוח, ובין היותו נפוץ ופתוח-משקל, הוא בדיוק מה שהופך אירוע סייבר לתקרית ענק. מודל פתוח ניתן להעתיק, לשנות ולהסיר את כל מעקות ההגנה שהיצרן שלו התקין מלכתחילה".

מה צריך להדאיג את וושינגטון?

ומעניין לעניין, באותו עניין: זו הפעם השנייה בימים האחרונים שמודל AI סיני ופתוח נכשל בבדיקות אבטחה באופן שצריך להדאיג את וושינגטון. 

אנת'רופיק פרסמה מחקר, לפיו GLM-5.3, שנבנה על ידי חוקרי מעבדת Z.ai בבייג'ינג, יכול לשרשר באופן אוטונומי את שלבי מתקפת סייבר אמיתית, מסריקת פגיעויות ועד כתיבת קוד ניצול תקין. ניסיונות פריצה פשוטים עברו את מסנני הבטיחות שלו בשיעור גבוה: בין 64% ל-100% מהמקרים.

"חיבור שני האירועים הללו", התריעו מומחי הגנת סייבר, "מתחיל להיראות פחות כמו צירוף מקרים ויותר כמו דפוס עקבי: שתי מעבדות סיניות נפרדות, שתי קטגוריות איום בעלות סיכון גבוה, סייבר וביולוגיה, ובשני המקרים – מעקות הגנה שחוקרים חיצוניים פיצחו עם טכניקות ידועות ומוכנות מראש". 

החוקרים הוסיפו כי "גם חברות ומעבדות מהמערב אינן חסינות. השנה נחשף כי o4-mini של OpenAI עלול להיפרץ ולקבל הנחיות דומות בתחום הנשק הביולוגי ב-93% מהמקרים". 

הם הוסיפו כי "אפילו אנת'רופיק עצמה הפעילה את רמת הבטיחות הפנימית הגבוהה ביותר שלה עבור Claude Opus 4 בשנה שעברה, לאחר שהבינה כי היא לא יכולה לשלול את האפשרות שהמודל יעזור משמעותית למישהו עם רקע מדעי בסיסי לבניית נשק כימי או ביולוגי. מעקות ההגנה של מודל סגור ניתנים לתיקון עם עדכון. לעומתם, ניתן לעקוף מעקות ההגנה של מודל פתוח – והמעקף נותר לנצח".

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים