מהפכת סוכני ה-AI כבר כאן – עכשיו צריך לשלוט בה
סוכני AI כבר פועלים במערכות חיצוניות ומבצעים פעולות עצמאיות ● ד"ר סתיו אלבר: ככל שמרחיבים את ההרשאות, כך נדרשים יותר גבולות, פיקוח ואישור אנושי
בשנים האחרונות התרגלנו לחשוב על הבינה המלאכותית כעל גאון שיושב בתוך חלון הצ'אט ומחכה להוראות. אנחנו שואלים, הוא עונה. מבקשים ממנו לכתוב, לנתח או לסכם – והוא נשאר בצד השני של המסך.
אלא שהגבול הזה מתחיל להיעלם. סוכני AI כבר יכולים לקבל משימה, לתכנן בעצמם כיצד לבצע אותה, לגלוש באתרים, לאסוף מידע ואף לבצע פעולות באופן עצמאי. הגאון כבר לא נשאר בתוך חלון השיחה – הוא מתחיל לפעול בעולם הדיגיטלי. וכשזה קורה, גם אופי הסיכון משתנה לחלוטין.
הסוכן כבר לא רק עונה – הוא פועל
הדיווחים האחרונים סביב סוכני AI של OpenAI מראים שחלק מהתרחישים שעד לאחרונה דיברנו עליהם כאיום עתידי כבר מתחילים לקרות בפועל. לפי הפרסומים, סוכנים של החברה פעלו באתרים של גופי ממשל בארה"ב, ובהם הרשות לניירות ערך, הלשכה לסטטיסטיקה ומשרד החינוך, אספו מידע, השתמשו בפרטי גישה שנמצאו ברשת ואף ניסו להשיג גישה לא מורשית למערכת ממשלתית.
האירועים האלה מעלים שאלה מטרידה הרבה יותר: אם סוכן AI מסוגל להגיע באופן עצמאי למערכות כאלה, מה יקרה כאשר יהיו לו הרשאות רחבות יותר – ומה הוא יוכל לעשות לפני שמישהו יבין שהוא חרג מהמשימה שקיבל?
אחת הדרכים להבין את הסיכון הזה היא דרך מנגנון שנקרא Indirect Prompt Injection – הזרקת הוראות עקיפה. סוכן AI שנשלח לאתר כדי לאסוף מידע עלול להיתקל בתוך העמוד בהוראה שנשתלה על ידי גורם זדוני, לעיתים אפילו בטקסט שקוף או מוסתר שאינו נראה כלל לעין אנושית.
מבחינת הסוכן, ההוראה הזאת יכולה להיראות כחלק לגיטימי מהתוכן שהוא אמור לעבד. אם הוא גם מחזיק בהרשאות לבצע פעולות, אותה הוראה עלולה לגרום לו לפתוח קובץ, לעבור לקישור אחר או לבצע פעולה עוינת שלא הייתה חלק מהמשימה המקורית.
הסיכון כבר אינו רק אם המודל טועה
כאן בדיוק משתנה אופי הסיכון. כשמודל טועה בתשובה, אפשר לזהות את הטעות ולתקן אותה. כשסוכן טועה תוך כדי פעולה, הוא עלול כבר להספיק לבצע סדרה של צעדים לפני שמישהו שם לב.
ככל שהסוכן מחובר ליותר מערכות – מדואר אלקטרוני ומסמכים ארגוניים ועד מאגרי מידע ומערכות תשלום – כך גדל הנזק האפשרי. לכן הסיכון כבר לא נמדד רק בשאלה עד כמה המודל מדויק, אלא גם באילו הרשאות הוא מחזיק ולאילו מערכות חיברנו אותו.
הפתרון אינו לעצור את מהפכת הסוכנים, וגם אין בכך טעם. האתגר הוא לאפשר להם לפעול, אבל בתוך גבולות ברורים.
עבור חברות הפיתוח, המשמעות היא להפריד בין ה"עיניים" ל"ידיים": מודל שסורק את האינטרנט הפתוח והלא בטוח לא צריך להחזיק באותן הרשאות שמאפשרות לו לשלוח מידע, להוריד קבצים או לבצע פעולות במערכות רגישות. מי שקורא מידע לא מוכר, לא יכול להיות גם מי שמחזיק במפתחות.
מפתח לחדר אחד – לא לכל הבית
גם ארגונים ומשתמשים צריכים לפעול לפי עיקרון פשוט: לתת לסוכן מפתח לחדר אחד, לא לכל הבית. ברירת המחדל צריכה להיות מינימום הרשאות ואישור אנושי לפעולות רגישות.
הסוכן יכול לאסוף מידע, להשוות מחירים או להכין טופס, אבל שליחת מידע, הורדת קובץ או העברת כסף צריכות להישאר תמיד בשליטה אנושית.
במקביל, גם ממשלות ורגולטורים יצטרכו להתאים את עצמם לעידן החדש. אם סוכנים עצמאיים מסתובבים ברשת, חייבים להיות מסוגלים לזהות מי שלח אותם ומי אחראי לפעולתם. ייתכן שסוכני AI יצטרכו מעין "לוחית רישוי" דיגיטלית משלהם – חתימה מאומתת שתאפשר לזהות אותם ולחסום גישה בעת הצורך.
המעבר מבינה מלאכותית שמייעצת לנו לבינה מלאכותית שפועלת עבורנו כבר החל. השאלה כעת אינה אם נשתמש בסוכנים האלה, אלא באילו תנאים נאפשר להם לפעול. ככל שניתן להם יותר עצמאות, נצטרך לוודא שמנגנוני הפיקוח והאחריות מתקדמים יחד איתם.
ד"ר סתיו אלבר היא מהנדסת תוכנה ב-Google, מרצה ובוגרת הטכניון.










תגובות
(0)