מהפכת ה-AI: פתרונות להגדלת ניצולת תשתיות הזיכרון הקיימות

ביקוש העתק לשבבי זיכרון מציב אתגר ● עדי כ"ץ ממארוול ישראל מסביר כיצד פרוטוקול CXL וטכנולוגיות דחיסה מתקדמות בחומרה יאפשרו ניצול חכם של התשתית הקיימת ויפתרו את עומסי ה-AI

עדי כ"ץ, Distinguished Engineer ב-מארוול ישראל.

כשמדברים על מהפכת הבינה המלאכותית, באופן טבעי לרוב מדברים על המודלים הגדולים, על המאיצים הגרפיים ועל כוח החישוב הרב שנדרש כדי לאמן ולהריץ מערכות AI. אבל ככל שמערכות ה-AI גדלות, מתברר שאחד האתגרים המרכזיים כבר לא נמצא רק בשאלה מהירות החישוב, אלא גם בשאלה פשוטה יותר: איפה נמצא המידע, כמה מהר אפשר לגשת אליו, ומה עלות אחסונו בזיכרון. 

אתגר זה הפך להיות אחד הנושאים הלוהטים היום בתעשיית השבבים, כששוק הזיכרונות נמצא תחת לחץ כבד. לאחרונה סמסונג הכריזה שהיא צופה שהביקוש בשוק שבבי הזיכרון ימשיך לגבור על ההיצע עד לשנת 2028. הסיבה לביקוש הגובר היא שמערכות AI מודרניות לא רק צריכות לחשב מהר – הן צריכות לגשת לכמויות עצומות של מידע, לשמור אותו קרוב למעבדים, להעביר אותו במהירות, ולעשות את כל זה בעלות סבירה ובצריכת חשמל שניתן לעמוד בה. זה נכון באימון מודלים גדולים, אבל גם יותר ויותר בשלב ההסקה (inference), שבו המודל כבר פועל בפועל ומשרת משתמשים, ארגונים ואפליקציות בזמן אמת. ככל שכמות המידע הולכת וגדלה בצורה מהירה, כך החברות מבקשות להגדיל את כמות הזיכרון שבו הן יכולות לעשות שימוש בחוות השרתים.

במציאות כיום, שבה הלקוחות הגדולים שמקימים ומפעילים דאטה סנטרים לא תמיד יכולים פשוט "לקנות עוד זיכרון", הערך של טכנולוגיה שמאפשרת להפיק יותר מהזיכרון שכבר נמצא במערכת על ידי הוספת שכבת סיליקון חכמה גדל משמעותית

חלק מהזיכרון הזה מצוי בתוך המעבד עצמו; הוא קטן מאוד ומהיר מאוד. לצידו יש זיכרון חיצוני, בדרך כלל מסוג DDR, שהוא גדול הרבה יותר, אבל גם איטי יותר ביחס לזיכרון שמצוי בתוך המעבד. הזיכרונות החיצוניים האלה משתפרים כל הזמן, בכל דור הם גדלים בנפח, והקצב שבו המעבד יכול לגשת אליהם משתפר. אבל יש להם מגבלה בסיסית: הם מחוברים בדרך כלל למעבד מסוים דרך ממשקים יקרים, גדולים ומורכבים.

המשמעות היא שבמערכת גדולה, זיכרון יכול להפוך למשאב "כלוא". אם מעבד מסוים לא מנצל את כל הזיכרון שמחובר אליו, מעבד אחר לא בהכרח יכול להשתמש בזיכרון הזה. המשאב קיים, הוא כבר נרכש, הוא נמצא בתוך המערכת, אבל בפועל הוא לא תמיד מנוצל. בעולם שבו AI דורשת עוד ועוד זיכרון, זו בעיה כלכלית ותפעולית משמעותית.

CXL – הפרוטוקול שיסייע לבעיית הזיכרון בעידן ה-AI

לפיכך נדרשת דרך יעילה לחבר בין המעבדים לבין מאגרי הזיכרון. כאן נכנס לתמונה CXL (ר"ת Compute Express Link). בפשטות, CXL הוא פרוטוקול שנבנה על בסיס PCI-Express, פרוטוקול ותיק שקיים במחשבים ובשרתים כבר שנים רבות. פרוטוקול ה-CXL מאפשר את השימוש בתפיAה שנקראת Memory Pooling או איגום זיכרון. במקום שכל מעבד יהיה מוגבל רק לזיכרון שמחובר אליו ישירות, יוצרים מאגר זיכרון רחב יותר, שאליו יכולים לגשת כמה מעבדים. אם מעבד אחד מריץ אפליקציה שצריכה פחות זיכרון, ומעבד אחר מריץ עומס עבודה שדורש יותר, המערכת יכולה לנצל את הזיכרון בצורה גמישה וחכמה יותר. 

ברגע שמכניסים רכיב ייעודי שיושב קרוב לזיכרון, אפשר לעשות יותר מאשר רק להנגיש את הזיכרון למעבדים. הרכיב הזה כבר נמצא בדרך שבין המעבד לבין הזיכרון, ולכן הוא יכול לבצע בצורה יעילה עיבוד נוסף על הנתונים עצמם. אחד מהעיבודים החשובים האפשריים הוא דחיסת זיכרון.

דחיסה היא רעיון מוכר כמעט לכל משתמש מחשב. כולנו מכירים את האפשרות לדחוס קבצים כדי שיתפסו פחות מקום. אבל בעולם של שרתים, AI וזיכרון מהיר, דחיסה היא עניין מורכב הרבה יותר. אם הדחיסה נעשית בתוכנה, היא דורשת משאבי מעבד, מוסיפה שכבת עבודה נוספת, ועלולה לגרום לעיכוב. במערכות AI, שבהן כל עיכוב בגישה לזיכרון יכול להשפיע על הביצועים, זה מחיר לא פשוט. לכן הדחיסה צריכה להתבצע בדרך שונה. 

במוצרי Structera CXL של מארוול, בנוסף לדרגת ניהול הזיכרון, מוטמע בלוק חומרה ייעודי, הדואג לכך שהנתונים נדחסים תוך כדי כתיבה לזיכרון ונפרסים בדרך חזרה למעבד. מבחינת המעבד, מערכת ההפעלה והאפליקציה, הפעולה הזו כמעט שקופה. הם לא צריכים לנהל את הדחיסה, לא צריכים להשתנות, ולא צריכים "לבזבז" כוח חישוב יקר על פעולה שאפשר לבצע קרוב יותר לזיכרון.

המשמעות היא שאותו זיכרון פיזי יכול להכיל יותר מידע שימושי, זאת בזמן שהוא ממשיך לעבוד כרגיל. אם הדחיסה מאפשרת יחס של 2:1, ניתן למעשה לקבל פי שניים קיבולת שימושית מאותו נפח DRAM. במקרים מסוימים היחס יכול להיות גבוה יותר, ובסוגי מידע אחרים נמוך יותר, אבל גם שיפור מתון יחסית הופך למשמעותי מאוד כשמדובר במאגרי זיכרון של טרה-בייטים רבים. 

זו אינה רק שאלה טכנולוגית – זו שאלה כלכלית 

במציאות כיום, שבה הלקוחות הגדולים שמקימים ומפעילים דאטה סנטרים לא תמיד יכולים פשוט "לקנות עוד זיכרון", הערך של טכנולוגיה שמאפשרת להפיק יותר מהזיכרון שכבר נמצא במערכת על ידי הוספת שכבת סיליקון חכמה גדל משמעותית.

יש כאן גם היבט סביבתי חשוב. אם ניתן להאריך את החיים של זיכרון קיים, להשתמש בו ביעילות גדולה יותר ולדחות את הצורך להחליף אותו בדור חדש, חוסכים לא רק כסף, אלא מפחיתים גם ייצור נוסף, פסולת אלקטרונית, צריכת אנרגיה ושימוש בחומרי גלם. בעולם שבו דאטה סנטרים הופכים לתשתית מרכזית של הכלכלה הדיגיטלית, גם היעילות הזו הופכת לחלק מהדיון הרחב על קיימות. 

כל אלה מצביעים על שינוי רחב יותר בתשתיות AI, ככל שהעומסים גדלים, מתברר שהאתגר הוא מערכתי יותר. צריך לחשוב על התנועה של המידע, על המקום שבו הוא נשמר, על הגישה אליו, על העלות שלו, על צריכת החשמל שלו ועל הדרך שבה כל הרכיבים בדאטה סנטר עובדים יחד. 

השלב הבא של תשתיות AI לא יהיה רק לבנות יותר דאטה סנטרים או לרכוש עוד זיכרון, אלא לבנות מערכות שיודעות לנצל טוב יותר את המשאבים שכבר קיימים.

בסוף, מהפכת ה-AI תתקדם לא רק בזכות מודלים גדולים יותר, אלא בזכות תשתיות חכמות יותר. דחיסת זיכרון בחומרה, CXL ואיגום זיכרון הם דוגמאות לאותו שינוי: מעבר מתפישה של “להוסיף עוד” לתפישה של “לנצל יותר”. בעולם שבו הזיכרון הופך לאחד המשאבים היקרים והמבוקשים ביותר, זו עשויה להיות אחת השאלות המרכזיות שיקבעו עד כמה רחוק ומהר תוכל תשתית ה-AI להמשיך לגדול. 

כותב המאמר הוא Distinguished Engineer ב-מארוול ישראל

תגובות

(0)

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

אין לשלוח תגובות הכוללות דברי הסתה, דיבה, וסגנון החורג מהטעם הטוב

אירועים קרובים