באירוע Windows ו־Surface שנערך בסן פרנסיסקו ב־7 באוקטובר 2026, הציגה מיקרוסופט את הכיוון שהיא מייעדת ל־Windows בעידן הבינה המלאכותית: שילוב בין עיבוד מקומי במחשב לבין שירותי ענן. ראש חטיבת Windows, פבאן דאוולורי, כינה את הגישה «אינטליגנציה היברידית» — סוכני AI יפעלו מקומית כשזה מתאים, יפנו לענן כשיזדקקו לו, ויפעלו תחת כלי האבטחה והניהול של Windows.
19
המשמעות אינה שכל משימות ה־AI עוברות מהענן למחשב הנייד. החזון של מיקרוסופט הוא ש־Windows יתאם בין מודלים מקומיים לשירותי ענן כחלק ממערכת אחת.
מודלים מקומיים, לצד הענן
מודל מקומי יכול לבצע משימות מסוימות ישירות במחשב, בעוד שהענן נשאר אפשרות למשימות אחרות. מיקרוסופט הציגה את השילוב הזה כתשתית לתכונות AI ולסוכנים ב־Windows — לא כתחליף לשירותי הענן.
19
כדי להקל על מפתחים להריץ מודלים מקומיים, החברה הודיעה על הוספת תמיכה ב־llama.cpp ל־Windows ML, סביבת הריצה שלה למודלים. התמיכה עשויה לאפשר להריץ מגוון רחב יותר של מודלים בקוד פתוח דרך שכבת החומרה הנתמכת של Windows.
39
43
DeepSeek, Nemotron ומודל הקוד של מיקרוסופט
מיקרוסופט הציגה כמה מודלים המיועדים להרצה מקומית, ובהם DeepSeek V4 Flash, מודל Nemotron עתידי של Nvidia, ו־MAI Code 1.1 Flash — מודל הקוד של מיקרוסופט.
33
לפי הפרטים שדווחו, ל־DeepSeek V4 Flash יש 284 מיליארד פרמטרים בסך הכול, והוא משתמש בקוונטיזציה של 1.6 ביט כדי להיכנס לזיכרון של כ־60 ג׳יגה־בייט. מיקרוסופט תיארה את יכולותיו כ«קרובות לחזית הטכנולוגיה» (near-frontier), אך מדובר בטענת ביצועים — לא בתוצאה שאומתה באופן עצמאי במבחני השוואה לפי המקורות הזמינים כאן.
26
מודל Nemotron העתידי של Nvidia תואר כמודל עם יותר מ־70 מיליארד פרמטרים, המשתמש בקוונטיזציה של 2 ביט כדי להסתפק במעט יותר מ־20 ג׳יגה־בייט של זיכרון. בדיווחים על האירוע צוין 15 באוקטובר כתאריך יעד; יש להתייחס אליו כמועד מתוכנן, ולא כאישור שהמודל כבר הושק.
26
33
המספרים ממחישים גם מדוע דחיסה חשובה. אחסון המשקולות של מודל בן 284 מיליארד פרמטרים בארבעה ביטים לפרמטר היה דורש כ־142 ג׳יגה־בייט — עוד לפני תוספת הזיכרון הדרושה להפעלה. התצורה שדווח כי תיכנס לכ־60 ג׳יגה־בייט נשענת על קוונטיזציה אגרסיבית בהרבה. המקורות הזמינים כאן אינם מראים כיצד הגרסה הדחוסה הזו מתפקדת במבחנים עצמאיים, ולכן יש להתייחס בזהירות לטענות של מיקרוסופט על איכותה.
26
בחירת מודל למשימה — והגבלת הגישה של סוכנים
מיקרוסופט הציגה גם כלים שנועדו לחבר בין מודלים למשימות. גישת HydraFusion של GitHub יכולה לנתב משימה למודל מתאים, כולל מודלים שרצים מקומית.
39
לסוכני AI שיכולים לפעול במחשב, הכריזה מיקרוסופט על Execution Containers — שכבת בידוד שנועדה להגביל למה הסוכן יכול לגשת ומה הוא יכול לעשות. לצד הרחבת היכולות המקומיות, הגבולות האלה חשובים כדי להגדיר לאילו מידע ופעולות הסוכן מורשה להגיע.
34
מחשבי RTX Spark — במחיר לא קטן
מיקרוסופט פתחה להזמנות מוקדמות את Surface Laptop Ultra, מחשב נייד המבוסס על חומרת Nvidia RTX Spark. מחירו ההתחלתי הוא 2,599 דולר, והחברה מציעה תצורות עם עד 128 ג׳יגה־בייט של זיכרון מאוחד.
18
31
החומרה נועדה לאפשר להריץ מודלים מקומיים גדולים יותר, אבל המחיר ודרישות הזיכרון מדגישים מגבלה מעשית: הפעלת מודלים משמעותיים במחשב אישי עשויה לדרוש מערכת יקרה עם הרבה זיכרון. גם מחירון ה־DGX Spark של Nvidia ממחיש את העלות: לפי דיווחים, דגם ה־128 ג׳יגה־בייט נמכר ב־6,950 דולר, והגרסה החדשה עם 64 ג׳יגה־בייט תומחרה ב־4,999 דולר.
3
מה ההכרזה מלמדת — ומה עדיין לא
הכיוון של מיקרוסופט ברור: Windows אמור לתאם בין AI מקומי לענן, להקל על שימוש במודלים פתוחים ולהוסיף אמצעי בקרה לסוכנים. אבל ההכרזה אינה מוכיחה שמודלים מקומיים ישתוו לשירותי ענן בכל משימה, שטענות הביצועים כבר אומתו באופן עצמאי, או ש־AI במכשיר ייתר את הצורך בענן. התשובות תלויות בבדיקות בעולם האמיתי, בזמינות התוכנה ובחומרה שיש למשתמשים.
לעת עתה, כדאי להבין את «האינטליגנציה ההיברידית» כאסטרטגיית פלטפורמה: Windows ינסה להעביר למחשב משימות AI שמתאימות לכך — בלי לוותר על המודלים והשירותים בענן.