לפי NVIDIA, אפשר להריץ מקומית על Jetson AGX Orin ו AGX Thor את Nemotron 3.5 Lightning ואת Qwen3.8 27B באמצעות vLLM; ב Thor, השילוב של NVFP4 ופענוח ספקולטיבי השיג עד פי 6.28 תפוקת פענוח לעומת BF16 בתרחיש שנבדק. Nemotron 3.5 Lightning הוא מודל MoE עם 30 מיליארד פרמטרים, אך רק 3 מיליארד פעילים לכל טוקן; Qwen3.8 27B הוא...
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
הרצת מודלי AI שמבצעים הסקה רב-שלבית על חומרה משובצת חייבה בעבר ויתור משמעותי: או יכולות מודל מצומצמות, או תגובה איטית מדי. במדריך מ-4 בספטמבר, NVIDIA טוענת שהאיזון הזה משתנה. שילוב של מודלים פתוחים מותאמים, הסקה בדיוק נמוך יותר ופענוח מהיר מאפשר להפעיל בינת הסקה וסוכני AI ישירות על מודולי Jetson AGX Orin ו-Jetson AGX Thor. 1
הנתון הבולט ביותר הוא שיפור של עד פי 6.28 בתפוקת הפענוח לעומת BF16 על Jetson AGX Thor, בעת שילוב קוונטיזציית NVFP4 עם פענוח ספקולטיבי. זהו נתון מדידה שתלוי במודל ובעומס העבודה — לא הבטחה כללית למספר טוקנים לשנייה — אך הוא ממחיש מדוע סוכני AI מקומיים נעשים מעשיים יותר לרובוטיקה, לכלי רכב ולציוד תעשייתי. 1
NVIDIA מצביעה על Nemotron 3.5 Lightning ועל Qwen3.8-27B כמודלים מתאימים עבור Jetson AGX Orin ו-Jetson AGX Thor. אפשר להגיש את המודלים מקומית באמצעות vLLM על גבי Jetson, ולשלב שתי שיטות משלימות לשיפור יעילות ההסקה. 1
NVFP4 משתמשת בייצוג נקודה צפה של 4 ביטים כדי להפחית את עבודת החישוב ואת נפח הזיכרון הנדרש לפעולות המודל. הפחתת תנועת הנתונים בזיכרון חשובה במיוחד בהסקה משובצת: במהלך יצירת טקסט, צוואר הבקבוק אינו בהכרח רק כוח החישוב, אלא גם היכולת להעביר במהירות את משקלי המודל והאקטיבציות. 1
לפי NVIDIA, Jetson Thor מתאים במיוחד לגישה זו, משום שה-GPU בארכיטקטורת Blackwell כולל תמיכה טבעית ב-FP4 דרך Transformer Engine. 3
פענוח ספקולטיבי מחלק את העבודה בין הצעה לאימות. מודל טיוטה קטן מציע כמה טוקנים הבאים; המודל הראשי בודק אותם יחד ועדיין הוא שמקבל את ההחלטה הסופית. כאשר כמה הצעות מתקבלות, היצירה מתקדמת בכמה טוקנים בצעד אימות אחד, במקום טוקן יחיד בכל פעם. 1
הרווח תלוי בשיעור קבלת הטוקנים שמציע מודל הטיוטה. לכן הביצועים ישתנו לפי המודל, הפרומפט ותצורת הפענוח; זו אופטימיזציה לעומס עבודה מסוים, לא מכפיל מהירות קבוע.
שני המודלים מייצגים פשרות שונות בפריסה בקצה.
Nemotron 3.5 Lightning הוא מודל Mixture of Experts (MoE) עם 30 מיליארד פרמטרים, אך רק 3 מיליארד מהם מופעלים בכל טוקן. NVIDIA מתארת אותו כמודל לשכבת הביצוע של סוכנים שפועלים לאורך זמן ובאופן רציף. 2
הארכיטקטורה הזו עשויה להתאים לסוכן שנדרש להפיק תגובות רבות או לעבור שוב ושוב בלולאה תפעולית: לפרש אירוע, להפעיל כלי מאושר, לבחון את התוצאה ולהחליט אם להמשיך או להסלים. המדד החשוב אינו רק מספר הפרמטרים הכולל, אלא גם מספר הפרמטרים הפעילים לטוקן ומהירות יציבה של יצירת פלט.
Qwen3.8-27B הוא מודל צפוף, כלומר כל 27 מיליארד הפרמטרים משתתפים בחישוב של כל טוקן. NVIDIA מציגה אותו כאפשרות חזקה ל-Jetson לצד Nemotron 3.5 Lightning. 1
מודל צפוף עשוי להתאים למערכת שמקבלת פחות החלטות, אך מייחסת ערך רב יותר לכל החלטה. המחיר הוא שהפעלת הרשת כולה לכל טוקן עשויה לדרוש יותר חישוב לעומת מודל MoE דליל.
המסר המעשי של NVIDIA הוא למדוד מול היישום האמיתי: אורכי פרומפטים ותשובות, כלים, תקציב השהיה, מגבלות זיכרון ודפוס קבלת ההחלטות. 1
סוכן שמייצר תשובות רבות עשוי להעדיף מודל דליל עם יצירת פלט מהירה. מערכת שמבצעת פחות שיפוטים אך מורכבים יותר עשויה לקבל קצב יצירה איטי יותר בתמורה להתנהגות שמספק המודל הצפוף. אין ארכיטקטורה שטובה אוטומטית לכל פריסת קצה.
NVIDIA מדווחת על שיפור מרבי של פי 6.28 בתפוקת הפענוח ביחס ל-BF16 ב-Jetson AGX Thor, לאחר שילוב NVFP4 ופענוח ספקולטיבי. תצורת הפענוח המועדפת השתנתה בין המודלים: DSpark עבדה בצורה הטובה ביותר עם Nemotron 3.5 Lightning, ואילו DFlash2 הייתה המועדפת עבור Qwen3.8-27B. 1
הנתון חשוב משום שהפענוח — יצירת טוקני הפלט צעד אחר צעד — הוא לעיתים מה שקובע אם סוכן אינטראקטיבי מרגיש זריז למשתמש. עם זאת, אין לקרוא בו כהבטחת מהירות גורפת לכל פרומפט, מודל או התקנה. איכות מודל הטיוטה, שיעור קבלת הטוקנים, גודל האצווה, אורך ההקשר ותצורת סביבת ההרצה משפיעים כולם על התפוקה בפועל. 1
מודל שרץ על המכשיר אינו מחייב שכל בקשת הסקה תעבור למרכז נתונים מרוחק. במערכות פיזיות, הדבר יכול להפחית השהיה הקשורה לרשת, לאפשר המשך פעולה כאשר הקישוריות מקוטעת, ולהשאיר זרמי חיישנים ויומני תפעול על המכשיר עצמו. NVIDIA מדגישה את הערך של בינת הסקה וסוכני AI בקצה במצבים שבהם חשובה קרבת הנתונים וזמן תגובה בזמן אמת. 1
אין פירוש הדבר שלתשתיות ענן כבר אין תפקיד. ארגונים עדיין עשויים להשתמש במערכות מרכזיות לאימון מודלים, לניהול צי מכשירים, לניתוח רחב היקף או למשימות החורגות מהזיכרון ומכוח החישוב הזמינים במכשיר. השינוי העיקרי הוא שחיבור למרכז הנתונים לא חייב להיות במסלול הקריטי של כל החלטה.
NVIDIA מציינת עוזרים בתוך תא הנוסעים, זיהוי חריגות בזמן אמת ורובוטים הפועלים בסביבות קשות או מרוחקות. 1
המכנה המשותף הוא דרישה מעשית: המערכת צריכה לפרש הקשר מקומי ולהגיב מהר מספיק כדי להיות שימושית. דוגמאות אפשריות כוללות:
המועמדים המתאימים ביותר אינם רק מכשירים שמסוגלים להריץ מודל שפה גדול, אלא מערכות שבהן זמן תגובה, דרישות פרטיות או שמירת נתונים מקומית, ועמידות לעבודה ללא חיבור רציף מעניקים ערך תפעולי ממשי.
Jetson AGX Thor היא הפלטפורמה הבכירה של NVIDIA לעומסי עבודה תובעניים של AI פיזי. לפי NVIDIA, היא משלבת GPU מסוג Blackwell עם 128GB זיכרון ומספקת עד 2,070 TFLOPS ב-FP4 בתוך מעטפת הספק של 130 ואט. 3
פרופיל החומרה הזה תואם את המיקוד של המדריך ב-NVFP4, בפענוח בעל תפוקה גבוהה ובמודלי הסקה מקומיים גדולים יותר. AGX Orin נשארת רלוונטית לפריסות משובצות מבוססות, בעוד Thor מיועדת לעומסי עבודה גנרטיביים ורב-מודאליים תובעניים יותר.
ברמת הכניסה, NVIDIA הכריזה על Jetson Orin Nano 2 לרובוטיקה, רחפני מסירה ובדיקה ומערכות AI לראייה ממוחשבת. לפי החברה, המודול וערכת הפיתוח צפויים במחצית הראשונה של 2027. 1
יחד, קו המוצרים מצביע על גישה מדורגת: מערכות קטנות יותר ל-AI בקצה ברמת כניסה, AGX Orin לפריסות משובצות בוגרות, ו-AGX Thor ליישומים הזקוקים ליותר זיכרון וכוח חישוב עבור הסקה גנרטיבית מקומית.
המדריך של NVIDIA אינו טוען שכל מודל חזית יכול כעת לרוץ בנוחות על כל מודול משובץ. המסקנה השימושית יותר מצומצמת: מודלי הסקה קומפקטיים, פריסה באמצעות vLLM, קוונטיזציית NVFP4 ופענוח ספקולטיבי יכולים להפוך סוכנים מקומיים בעלי יכולת לאפשריים על חומרת Jetson. 1
עבור מפתחים, הצעד הבא הוא ניסויי ולא תאורטי: לבדוק את המודל המיועד על התקן ה-Jetson המיועד, עם הפרומפטים, הכלים, חלונות ההקשר ודרישות זמן התגובה של המוצר. תוצאת פי 6.28 מדגימה את פוטנציאל האופטימיזציה; המדידה ביישום עצמו היא שתקבע אם הפוטנציאל הופך למערכת AI שימושית בקצה. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
לפי NVIDIA, אפשר להריץ מקומית על Jetson AGX Orin ו AGX Thor את Nemotron 3.5 Lightning ואת Qwen3.8 27B באמצעות vLLM; ב Thor, השילוב של NVFP4 ופענוח ספקולטיבי השיג עד פי 6.28 תפוקת פענוח לעומת BF16 בתרחיש שנבדק.
לפי NVIDIA, אפשר להריץ מקומית על Jetson AGX Orin ו AGX Thor את Nemotron 3.5 Lightning ואת Qwen3.8 27B באמצעות vLLM; ב Thor, השילוב של NVFP4 ופענוח ספקולטיבי השיג עד פי 6.28 תפוקת פענוח לעומת BF16 בתרחיש שנבדק. Nemotron 3.5 Lightning הוא מודל MoE עם 30 מיליארד פרמטרים, אך רק 3 מיליארד פעילים לכל טוקן; Qwen3.8 27B הוא מודל צפוף שבו כל 27 מיליארד הפרמטרים משתתפים בכל טוקן.
הסקה מקומית יכולה לצמצם תלות בקישוריות למרכז נתונים עבור רובוטים, כלי רכב ומערכות תעשייתיות — אך יש למדוד ביצועים עם הפרומפטים, הכלים, מגבלות הזיכרון ויעדי ההשהיה של המוצר בפועל.