לפי דיווחים, OpenAI הרחיקה קבלנים שהשתמשו בבינה מלאכותית בעבודה שנועדה להעריך את תשובות המודלים שלה. זו אינה התנגדות עקרונית לשימוש ב-AI: הערך של המשימה טמון בשיפוט אנושי עצמאי. אם כלי AI מנסח את הביקורת או קובע את הציון במקום הבודק, קשה יותר לדעת אם המשוב משקף התרשמות של אדם מהתשובה. הדיווחים קושרים את ההרחקות למערך הערכת המודלים של OpenAI ומתארים את פרויקט Lily כאחת התוכניות המבוססות על בדיקה אנושית; הם אינם קובעים שכל מי שהורחק עבד דווקא בפרויקט הזה.
16
13
מה עושים הבודקים בפרויקט Lily?
על פי הדיווחים, מאות קבלנים חיצוניים בוחנים פניות אמיתיות ל־ChatGPT, ולעיתים גם את השיחה שסביבן. הבודקים מגויסים באמצעות Crossing Hurdles ומקבלים תשלום דרך Mercor. עובד אחד דיווח שהשתכר יותר מ־50 דולר לשעה — אין בכך כדי לקבוע שזה השכר של כלל הבודקים.
2
20
בכל משימה הבודק מסכם מה המשתמש ניסה להשיג, ולאחר מכן מבקר ומדרג תשובות אפשריות של ChatGPT בסולם של 1 עד 7. לפי התיאורים, משימה עשויה לכלול עד ארבע תשובות, והבדיקה מתמקדת בין השאר בטון, בניסוח שנשמע רובוטי ובנטייה להסכים עם המשתמש יתר על המידה. הציונים וההערות נועדו לסייע בשיפור התנהגות המודלים בהמשך.
4
11
3
1
למה השימוש ב-AI בעבודת הדירוג בעייתי?
בודק אנושי יכול להעריך בעצמו אם התשובה עונה לבקשה ואם היא נשמעת מועילה או להוטה מדי לרצות. כשהבדיקה מועברת לכלי AI, המשוב עלול לשקף העדפות של מודל במקום שיפוט עצמאי של אדם. זהו סיכון לאיכות המשוב — לא הוכחה שדירוג מסוים שנעזר ב-AI פגע במודל.
4
16
לפי הוראות שדווחו, אסור לבודקים להשתמש ב-AI כדי לבדוק את עבודתם או לכתוב הערות, לרבות תכונות AI של Grammarly וכלי תרגום מבוססי AI. גם מי שמבקרים את עבודת הקבלנים האחרים מונחים שלא להשתמש בכלים לזיהוי טקסט שנוצר ב-AI, המתוארים בהוראות כבלתי אמינים.
13
9
איך מזהים שימוש חשוד — ומה אי אפשר להסיק מכך?
לפי הדיווחים, מפקחים בוחנים סימנים כגון ניסוחים חוזרים שנשמעים כאילו נוצרו ב-AI או השלמת משימות במהירות חריגה. סימנים כאלה יכולים להצדיק בדיקה נוספת, אך אינם מוכיחים כשלעצמם שנעשה שימוש ב-AI. מהדיווחים הזמינים גם אי אפשר לדעת באיזו תדירות המפקחים מזהים הפרות נכונה או מחמיצים אותן.
9
33
גם דירוג שנכתב ללא AI אינו בהכרח דירוג טוב: אדם עלול לעבוד ברשלנות או לבחור ציון גרוע בכוונה. הדיווחים שסופקו אינם מאמתים את הטענה המסוימת על עובד שהודה בבחירת ציונים גרועים במכוון, ולכן אי אפשר לקבוע כאן מה התרחש או עד כמה התופעה נפוצה. המסקנה המצומצמת היא שתווית של ״דירוג אנושי״ מעידה מי סיפק את המשוב, לא שכל שיפוט היה אמין; נדרשת גם בדיקה של איכות ההערכות עצמן.
1
4
עבור משתמשים יש שאלה נפרדת: במסגרת פרויקט Lily בודקים עשויים לראות טקסט משיחות אמיתיות, ומסנן הפרטיות שעליו דווח עלול שלא להסיר פרטים רגישים מסוימים. לכן חשוב לא רק מי מדרג את התשובות, אלא גם כיצד מטופלות השיחות שמגיעות לבדיקה.
8
12