הפרסום של OpenAI מ 6 באוקטובר כלל 722 כתבי יד ב 372 משפחות תוצאות — לא 722 תגליות שאומתו בנפרד. לפי OpenAI, כל תוצאה דרשה בממוצע כשלוש שעות חישוב; מאמץ מוקדם יותר סביב נאוויה–סטוקס נמשך, לפי דיווחים, 88 שעות.
פורסם על ידינערך באמצעות GPT-6 Lunaהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What does the scrutiny of OpenAI’s October 6 release of 722 AI-generated mathematical manuscripts in 372 result families reveal about the re. Article summary: The scrutiny shows both the promise and the verification bottleneck of AI-assisted mathematics: an unreleased model can produce substantial work quickly, but a computer-checked proof does not automatically validate the s. Topic tags: general, academic, general web, user generated, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
הפרסום של OpenAI מ-6 באוקטובר 2026 — 722 כתבי יד מתמטיים המאורגנים ב-372 משפחות תוצאות — מציג את היקף העבודה שמודל בינה מלאכותית יכול להפיק. אבל הוא גם מבליט אתגר מרכזי: תוכנה לאימות הוכחות יכולה לבדוק טיעון שנוסח בשפה פורמלית, אך עדיין צריך לוודא שהוא אכן תואם לטענה שבכתב היד. לכן מדובר באוסף עבודות שדורש בחינה, ולא ב-722 תגליות שאומתו באופן עצמאי. 12
7
OpenAI מסרה שהעבודות נוצרו באמצעות מודל פנימי שטרם פורסם, ושכל תוצאה דרשה בממוצע כשלוש שעות חישוב. לפי החברה, במהלך ההערכה הוצגו למודל כ-4,000 בעיות. הנתונים האלה מעידים על היקף המאמץ ועל קצב העבודה המדווח, אך אינם מוכיחים כשלעצמם שכל תוצאה נכונה או חשובה מבחינה מתמטית. 1
3
7
גם מספר כתבי היד דורש הקשר: הם מאורגנים במשפחות של תוצאות קשורות. לכן אין לפרש את הכותרת כאילו מדובר ב-722 פריצות דרך שונות, שכל אחת מהן כבר נבדקה ואושרה בנפרד. כל טענה צריכה להיבחן לפי ההוכחה שלה ולפי האופן שבו היא עומדת בביקורת מתמטית. 7
12
הסתייגות מסוימת מהעבודה הקודמת של OpenAI על משוואות נאוויה–סטוקס מתמקדת בלמת 8.6. בכתב היד שנועד לקריאה אנושית מופיעה הערכה עם דרישת סדירות הכוללת נגזרות עד סדר m + 4. בגרסת Lean המקבילה מופיע m + 5. דרישה לנגזרת נוספת פירושה שההערכה הפורמלית נשענת על הנחה חזקה יותר, ולכן היא חלשה יותר: היא אינה מאמתת ישירות את הטענה החזקה יותר כפי שנוסחה בכתב היד. 2
הפער הזה אינו מוכיח כשלעצמו שאחת הגרסאות שגויה, ואינו מכריע את שאלת התוצאה כולה. עם זאת, הוא אומר שאי אפשר לראות בבדיקה המוצלחת של המחשב אישור אוטומטי לטענה הכתובה. על הבודקים להשוות בין מה שהמאמר טוען לבין מה שהקוד הפורמלי מקודד בפועל. 2
זהו לקח רחב יותר על אימות פורמלי: מערכת כמו Lean בודקת את הטענה שנוסחה בשפה הפורמלית שלה. היא אינה יכולה, לבדה, להבטיח שהטענה תורגמה נאמנה מהמאמר — אלא אם גם התרגום נבדק. אי-התאמה מצדיקה בחינה זהירה; היא אינה הוכחה להחלשה מכוונת של הטענה, וגם לא ראיה לכך שכל הוכחה שנוצרה בידי בינה מלאכותית סובלת מאותה בעיה. 2
הממוצע של כשלוש שעות חישוב לתוצאה, לפי OpenAI, ממחיש את קצב התפוקה המדווח של המערכת. בנפרד, דיווחים על המאמץ הקודם סביב נאוויה–סטוקס מציינים שהסוכנים פעלו במשך כ-88 שעות. אלה נתונים על שני מאמצים שונים, ואף אחד מהם אינו אומר כמה זמן יידרש למתמטיקאים עצמאיים כדי לבדוק את הטיעונים שהופקו. 1
3
7
לפי דיווח, צוות הקדיש כשבועיים לבדיקת הוכחת נאוויה–סטוקס הקודמת. אין פירוש הדבר שהצוות בחן במשך שבועיים את אוסף כתבי היד שפורסם ב-6 באוקטובר, שיצא לאור רק ימים ספורים קודם לכן. ההבחנה חשובה: יצירת כתב יד ובדיקה עצמאית של המתמטיקה שבו הן משימות שונות. כשמפרסמים אוסף בהיקף כזה, הבדיקה עצמה נעשית עבודה משמעותית. 2
פורמליזציה ב-Lean מאפשרת לתוכנה לבדוק את השלבים הלוגיים של הוכחה כפי שקודדו בה. אבל באוסף של OpenAI יש תוצאות בשלבים שונים של אימות, ולא לכל כתב יד מצורפת פורמליזציה ב-Lean. החברה מסרה כי תמשיך להוסיף פורמליזציות. 7
12
גם כשיש קוד פורמלי והוא עובר בדיקה, צריך לברר אם הוא מוכיח את אותה הטענה שמופיעה במאמר ואם לתוצאה יש משמעות מתמטית. גם שאלות על הקשר בין הטיעון לבין עבודות קודמות מחייבות שיקול דעת אנושי; בדיקה מוצלחת של Lean אינה פותרת אותן לבדה. 2
7
הפרסום מעיד על יכולתה של בינה מלאכותית לייצר עבודה מתמטית בהיקף גדול, אך אינו מחליף ביקורת מתמטית. הדרך המועילה להעריך את התוצאות היא לבחון כל אחת לגופה: לזהות בדיוק מה נטען, להשוות בין ההוכחה הכתובה לפורמליזציה אם קיימת, ולהבחין בין טענה שנבדקה במחשב לבין תוצאה שאומתה באופן עצמאי בידי מתמטיקאים. 2
7
12
הפער בלמת 8.6 ממחיש מדוע ההבחנה הזאת חשובה. בינה מלאכותית עשויה להאיץ את המחקר המתמטי, אבל האמון בתוצאות תלוי בטענות ברורות ובבדיקה קפדנית — לא במספר כתבי היד או בשעות החישוב לבדן.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
הפרסום של OpenAI מ 6 באוקטובר כלל 722 כתבי יד ב 372 משפחות תוצאות — לא 722 תגליות שאומתו בנפרד.
הפרסום של OpenAI מ 6 באוקטובר כלל 722 כתבי יד ב 372 משפחות תוצאות — לא 722 תגליות שאומתו בנפרד. לפי OpenAI, כל תוצאה דרשה בממוצע כשלוש שעות חישוב; מאמץ מוקדם יותר סביב נאוויה–סטוקס נמשך, לפי דיווחים, 88 שעות.
בלמת 8.6 נמצא פער בין דרישת הסדירות בכתב היד לבין זו שבגרסת Lean: פער שמחייב בדיקה, אך אינו מכריע כשלעצמו אם התוצאה נכונה.
הפרסום של OpenAI מ 6 באוקטובר כלל 722 כתבי יד ב 372 משפחות תוצאות — לא 722 תגליות שאומתו בנפרד. לפי OpenAI, כל תוצאה דרשה בממוצע כשלוש שעות חישוב; מאמץ מוקדם יותר סביב נאוויה–סטוקס נמשך, לפי דיווחים, 88 שעות.
פורסם על ידינערך באמצעות GPT-6 Lunaהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What does the scrutiny of OpenAI’s October 6 release of 722 AI-generated mathematical manuscripts in 372 result families reveal about the re. Article summary: The scrutiny shows both the promise and the verification bottleneck of AI-assisted mathematics: an unreleased model can produce substantial work quickly, but a computer-checked proof does not automatically validate the s. Topic tags: general, academic, general web, user generated, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
הפרסום של OpenAI מ-6 באוקטובר 2026 — 722 כתבי יד מתמטיים המאורגנים ב-372 משפחות תוצאות — מציג את היקף העבודה שמודל בינה מלאכותית יכול להפיק. אבל הוא גם מבליט אתגר מרכזי: תוכנה לאימות הוכחות יכולה לבדוק טיעון שנוסח בשפה פורמלית, אך עדיין צריך לוודא שהוא אכן תואם לטענה שבכתב היד. לכן מדובר באוסף עבודות שדורש בחינה, ולא ב-722 תגליות שאומתו באופן עצמאי. 12
7
OpenAI מסרה שהעבודות נוצרו באמצעות מודל פנימי שטרם פורסם, ושכל תוצאה דרשה בממוצע כשלוש שעות חישוב. לפי החברה, במהלך ההערכה הוצגו למודל כ-4,000 בעיות. הנתונים האלה מעידים על היקף המאמץ ועל קצב העבודה המדווח, אך אינם מוכיחים כשלעצמם שכל תוצאה נכונה או חשובה מבחינה מתמטית. 1
3
7
גם מספר כתבי היד דורש הקשר: הם מאורגנים במשפחות של תוצאות קשורות. לכן אין לפרש את הכותרת כאילו מדובר ב-722 פריצות דרך שונות, שכל אחת מהן כבר נבדקה ואושרה בנפרד. כל טענה צריכה להיבחן לפי ההוכחה שלה ולפי האופן שבו היא עומדת בביקורת מתמטית. 7
12
הסתייגות מסוימת מהעבודה הקודמת של OpenAI על משוואות נאוויה–סטוקס מתמקדת בלמת 8.6. בכתב היד שנועד לקריאה אנושית מופיעה הערכה עם דרישת סדירות הכוללת נגזרות עד סדר m + 4. בגרסת Lean המקבילה מופיע m + 5. דרישה לנגזרת נוספת פירושה שההערכה הפורמלית נשענת על הנחה חזקה יותר, ולכן היא חלשה יותר: היא אינה מאמתת ישירות את הטענה החזקה יותר כפי שנוסחה בכתב היד. 2
הפער הזה אינו מוכיח כשלעצמו שאחת הגרסאות שגויה, ואינו מכריע את שאלת התוצאה כולה. עם זאת, הוא אומר שאי אפשר לראות בבדיקה המוצלחת של המחשב אישור אוטומטי לטענה הכתובה. על הבודקים להשוות בין מה שהמאמר טוען לבין מה שהקוד הפורמלי מקודד בפועל. 2
זהו לקח רחב יותר על אימות פורמלי: מערכת כמו Lean בודקת את הטענה שנוסחה בשפה הפורמלית שלה. היא אינה יכולה, לבדה, להבטיח שהטענה תורגמה נאמנה מהמאמר — אלא אם גם התרגום נבדק. אי-התאמה מצדיקה בחינה זהירה; היא אינה הוכחה להחלשה מכוונת של הטענה, וגם לא ראיה לכך שכל הוכחה שנוצרה בידי בינה מלאכותית סובלת מאותה בעיה. 2
הממוצע של כשלוש שעות חישוב לתוצאה, לפי OpenAI, ממחיש את קצב התפוקה המדווח של המערכת. בנפרד, דיווחים על המאמץ הקודם סביב נאוויה–סטוקס מציינים שהסוכנים פעלו במשך כ-88 שעות. אלה נתונים על שני מאמצים שונים, ואף אחד מהם אינו אומר כמה זמן יידרש למתמטיקאים עצמאיים כדי לבדוק את הטיעונים שהופקו. 1
3
7
לפי דיווח, צוות הקדיש כשבועיים לבדיקת הוכחת נאוויה–סטוקס הקודמת. אין פירוש הדבר שהצוות בחן במשך שבועיים את אוסף כתבי היד שפורסם ב-6 באוקטובר, שיצא לאור רק ימים ספורים קודם לכן. ההבחנה חשובה: יצירת כתב יד ובדיקה עצמאית של המתמטיקה שבו הן משימות שונות. כשמפרסמים אוסף בהיקף כזה, הבדיקה עצמה נעשית עבודה משמעותית. 2
פורמליזציה ב-Lean מאפשרת לתוכנה לבדוק את השלבים הלוגיים של הוכחה כפי שקודדו בה. אבל באוסף של OpenAI יש תוצאות בשלבים שונים של אימות, ולא לכל כתב יד מצורפת פורמליזציה ב-Lean. החברה מסרה כי תמשיך להוסיף פורמליזציות. 7
12
גם כשיש קוד פורמלי והוא עובר בדיקה, צריך לברר אם הוא מוכיח את אותה הטענה שמופיעה במאמר ואם לתוצאה יש משמעות מתמטית. גם שאלות על הקשר בין הטיעון לבין עבודות קודמות מחייבות שיקול דעת אנושי; בדיקה מוצלחת של Lean אינה פותרת אותן לבדה. 2
7
הפרסום מעיד על יכולתה של בינה מלאכותית לייצר עבודה מתמטית בהיקף גדול, אך אינו מחליף ביקורת מתמטית. הדרך המועילה להעריך את התוצאות היא לבחון כל אחת לגופה: לזהות בדיוק מה נטען, להשוות בין ההוכחה הכתובה לפורמליזציה אם קיימת, ולהבחין בין טענה שנבדקה במחשב לבין תוצאה שאומתה באופן עצמאי בידי מתמטיקאים. 2
7
12
הפער בלמת 8.6 ממחיש מדוע ההבחנה הזאת חשובה. בינה מלאכותית עשויה להאיץ את המחקר המתמטי, אבל האמון בתוצאות תלוי בטענות ברורות ובבדיקה קפדנית — לא במספר כתבי היד או בשעות החישוב לבדן.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
הפרסום של OpenAI מ 6 באוקטובר כלל 722 כתבי יד ב 372 משפחות תוצאות — לא 722 תגליות שאומתו בנפרד.
הפרסום של OpenAI מ 6 באוקטובר כלל 722 כתבי יד ב 372 משפחות תוצאות — לא 722 תגליות שאומתו בנפרד. לפי OpenAI, כל תוצאה דרשה בממוצע כשלוש שעות חישוב; מאמץ מוקדם יותר סביב נאוויה–סטוקס נמשך, לפי דיווחים, 88 שעות.
בלמת 8.6 נמצא פער בין דרישת הסדירות בכתב היד לבין זו שבגרסת Lean: פער שמחייב בדיקה, אך אינו מכריע כשלעצמו אם התוצאה נכונה.