ב־27 באוגוסט 2026 הציגה גוגל דיפמיינד את מה שהיא מכנה ההערכה הדו־סמויה הראשונה של מודל AI קנייני ומתקדם, Gemini 2.5 Flash Lite. הבדיקה השתמשה בשאלות פרטיות ממשפחת מדדי הבטיחות AILuminate של MLCommons, בתחומים כמו סיוע למתקפות סייבר, סכנות כימיות וביולוגיות, דברי שנאה, פגיעה עצמית ופשיעה אלימה.
Research answer

Create a landscape editorial hero image for this Studio Global article: What was Google DeepMind’s first double-blind evaluation of a proprietary frontier AI model, conducted with the Singapore AI Safety Institut. Article summary: Google DeepMind’s pilot was a “double-blind evaluation” of Gemini 2.5 Flash-Lite: confidential, never-before-used MLCommons AILuminate prompts were run against the proprietary model without Google receiving the prompts a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ב־27 באוגוסט 2026 הציגה Google DeepMind פיילוט שנועד לבדוק מודל AI קנייני ומתקדם בלי למסור למפתחת את שאלות ההערכה ובלי לאפשר למעריכים חיצוניים גישה למשקלי המודל. הפיילוט בדק את Gemini 2.5 Flash-Lite בשיתוף מכון הבטיחות של סינגפור בתחום הבינה המלאכותית, OpenMined, AVERI ו־MLCommons. גוגל תיארה אותו כהערכה הדו־סמויה הראשונה של מודל AI קנייני ברמה מתקדמת. 1213
הרעיון מזכיר מבחן שבו כל צד מביא את הסוד שלו — אך אף אחד מהצדדים אינו מקבל גישה לסוד של האחר. במקרה הזה, שאלות המבחן נשארות חסויות, וכך גם קוד ההרצה ומשקלי המודל.
הפיילוט השתמש במבחר פרטי קטן מתוך משפחת מדדי הבטיחות AILuminate של MLCommons. לפי AVERI, השאלות לא נחשפו קודם לכן ל־Google DeepMind, ונועדו לבחון את התנהגות המודל בתחומים ובהם סיוע למתקפות סייבר, סכנות כימיות וביולוגיות, דברי שנאה, פגיעה עצמית והפקת הנחיות לפשיעה אלימה. 1
חומרי המדד נשמרו חסויים לאורך כל הבדיקה. AVERI הצפינה את השאלות, הסביבה המוגנת הריצה את המודל ואת תהליך ההערכה, והתוצאות שהתקבלו פוענחו ונבדקו מול הקריטריונים שסוכמו מראש. מטרת הפיילוט הייתה להדגים את שיטת ההערכה — לא לפרסם טבלת דירוג ציבורית. לכן לא פורסמו ציוני ביצוע מרכזיים או השאלות עצמן. 1
הבדיקה רצה בתוך Confidential Space, שירות המחשוב החסוי של Google Cloud, על גבי מכונה וירטואלית מסוג A3 Confidential VM. לפי הדוח הטכני, Intel TDX הצפינה ובודדה את זיכרון המחשב המארח, ואילו מעבד גרפי NVIDIA H100 Confidential הגן על משקלי המודל בזיכרון הגרפי באמצעות הצפנה מבוססת חומרה. חיבורים מוצפנים העבירו אל הסביבה את שאלות המעריכים ואת נכסי המודל של גוגל. 13
המערכת כללה גם נתיבי נתונים מוצפנים, חומות אש חומרתיות, מחזור חיים זמני של המובלעת ושכבת מדיניות של OpenMined המבוססת על PySyft. כך הובאו המודל, קוד ההסקה, השאלות וקוד ההערכה יחד רק בתוך הסביבה המאושרת, שבה ניתן היה להריץ את החישוב שהוגדר מראש ולהחזיר פלט מוגבל. 13
הצפנה לבדה אינה מגלה למשתתפים איזה תוכנה באמת רצה בתוך הסביבה. כאן נכנס לתמונה אימות מרחוק — תהליך שמאפשר לבדוק את זהות החומרה ואת תצורת המובלעת לפני העברת החומרים הרגישים.
לפני ששחררו את הנכסים המוצפנים שלהם, גוגל והמעריכים יכלו לבדוק את תיאור העומס המאושר ולאמת הצהרת אימות, או attestation quote, המזהה את החומרה ואת תצורת המובלעת. רק לאחר האימות הועברו השאלות והמודל לסביבה המוגנת. 13
בסיום ההרצה החזירה המובלעת את פלטי ההערכה שהוגדרו מראש, ולאחר מכן הושבתה. לפי מודל האמון המתוכנן, גוגל לא הייתה אמורה לקרוא את השאלות בתוך המובלעת, והמעריכים החיצוניים לא היו אמורים לחלץ את משקלי המודל. מדובר בהגנה חזקה יותר מהסתמכות על התחייבות חוזית בלבד שלא לתעד או לעשות שימוש חוזר בנתוני ההערכה — אך היא אינה מבטלת את כל הנחות האמון. 13
אחת הבעיות המתמשכות בהערכת מודלים היא "זיהום מדדים" — מצב שבו המודל נחשף לשאלות המבחן במהלך האימון, הכוונון או בדיקות קודמות. במקרה כזה, הציון עלול לשקף היכרות מוקדמת עם חומר הבחינה ולא את היכולת להתמודד עם שאלות חדשות.
MLCommons מדגישה שמדד אמין דורש נתונים נקיים, תיעוד של מקורם, דגימה זהירה ושקיפות מספקת כדי להבין כיצד נוצרו התוצאות. 2024
הערכה דו־סמויה מציעה אפשרות שלישית בין שתי הסדרות המקובלות, שלכל אחת מהן חסרונות:
לכן הפיילוט מדגים מנגנון אפשרי לשמירה הדדית על סודיות תוך ביצוע הערכה חיצונית. עם זאת, הוא אינו מוכיח כשלעצמו שמסקנות הבטיחות שהתקבלו מלאות או מכריעות באופן עצמאי.
מדובר בהדגמה טכנולוגית משמעותית, אך יש כמה מגבלות שמצמצמות את המסקנות שאפשר להסיק ממנה.
ראשית, המעריכים יכלו לבדוק את עומס העבודה שהוצהר עבור המובלעת ואת ממשק המודל, אך לא יכלו לבחון באופן עצמאי את משקלי גוגל או את מימוש ההסקה הקנייני שלה. לכן יכולתם לבדוק אם סביבת ההרצה התנהגה בדיוק כפי שתוכנן הייתה מוגבלת. 13
שנית, הסביבה לא הייתה ניתנת לשחזור עצמאי מקצה לקצה. הפריסה ותשתית הענן נשארו בשליטת גוגל, ולא נבנו והורצו מחדש בידי גורם שאינו קשור למשתתפים. גם תהליך האימות עדיין הסתמך על החומרה, הקושחה, מערכות ההגשה ותשתית האימות של Google Cloud. אימות הנתמך בחומרה חזק יותר מהבטחה חוזית שלא לתעד מידע, אך אינו מבטל את התלות בספק הענן ובשרשרת האספקה הרחבה שלו. 13
שלישית, הפיילוט לא פרסם את השאלות הפרטיות או את התוצאות המספריות. הסתרת השאלות מסייעת לשמר את ערכן לבדיקות עתידיות, אך גם מגבילה את הביקורת הציבורית, את ההשוואה בין מודלים ואת האפשרות לאמת באופן עצמאי את הממצאים המהותיים. AVERI הגדירה את העבודה כהערכה איכותנית ובחינה כמותית מצומצמת, ולא כתוצאה מלאה של מדד ציבורי. 1
חומרה מאובטחת פותרת רק חלק מבעיית ההערכה. כדי שהערכה דו־סמויה תהפוך לפרקטיקה יציבה בתעשייה, גם המעטפת הארגונית והניהולית תצטרך להתפתח.
הגנות משפטיות ומוסדיות צריכות להגדיר כיצד מטפלים בנתונים, אילו פלטים מותרים, מהן חובות הגילוי, מי נושא באחריות ומי רשאי לקבל גישה — במיוחד כאשר הבדיקות נוגעות ליכולות מסוכנות.
ניהול המדד צריך לכלול תיעוד של מקור השאלות, שיטות הדגימה, תיוג, מגבלות, רענון שוטף ומעקב אחר זיהום. MLCommons מדגישה שמדד אמין אינו כזה רק מפני שהנתונים שלו סודיים; גם אופן הבנייה והתחזוקה שלו צריך להיות ניתן להגנה ולביקורת. 2025
שחזור עצמאי ידרוש אימות משמעותי של תהליך הבנייה, שרשרת האימות, מדיניות ההרצה והתוצאות המדווחות בידי גורמים שאינם רק ספק המודל ומפעיל הענן.
יכולת התרחבות תהיה חיונית גם היא. תקן שימושי צריך לעבוד עם מפתחות מודלים שונים, ארכיטקטורות שונות, ספקי ענן, מעריכים, סוגי מדדים וגרסאות חוזרות של מודלים — ולא רק בשיתוף פעולה ייעודי המבוסס על מערך חומרה יחיד.
הפיילוט של Google DeepMind הוא, אם כן, תשתית לסוג מורכב יותר של הערכת AI — לא תשובה סופית לשאלת האמון במדדים. הוא מראה כיצד מחשוב חסוי יכול לצמצם את המתח בין הגנה על חומרי מבחן לבין הגנה על מודלים קנייניים. השאלה אם המנגנון יהפוך לראיה אמינה בקנה מידה תעשייתי תלויה בפיקוח עצמאי, בניהול מדדים איכותי, בהגנות משפטיות, ביכולת לשחזר את התהליך ובכדאיות התפעולית — ולא בהצפנת המובלעת בלבד. 1320
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ב־27 באוגוסט 2026 הציגה גוגל דיפמיינד את מה שהיא מכנה ההערכה הדו־סמויה הראשונה של מודל AI קנייני ומתקדם, Gemini 2.5 Flash Lite.
ב־27 באוגוסט 2026 הציגה גוגל דיפמיינד את מה שהיא מכנה ההערכה הדו־סמויה הראשונה של מודל AI קנייני ומתקדם, Gemini 2.5 Flash Lite. הבדיקה השתמשה בשאלות פרטיות ממשפחת מדדי הבטיחות AILuminate של MLCommons, בתחומים כמו סיוע למתקפות סייבר, סכנות כימיות וביולוגיות, דברי שנאה, פגיעה עצמית ופשיעה אלימה.
המודל והשאלות נפגשו בתוך מובלעת מחשוב מאובטחת. השיטה מצמצמת את הסיכון לזיהום המדד, אך עדיין אינה מספקת לבדה שחזור עצמאי, שקיפות ציבורית או תקן תעשייתי מלא.