Epoch AI מעריכה שמלאי הטקסט האנושי הציבורי האיכותי עומד על כ 300 טריליון טוקנים, צפוי להסתיים עד 2028. OpenAI ו Anthropic רוכשות ארכיוני סלאק, מיילים ותמלילי ישיבות מחברות סטארט אפ שנסגרו או נמכרו, במחירים של 10,000 עד 300,000 דולר לעסקה.
Research answer

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
האינטרנט הציבורי אוזל מטקסט אנושי נקי, ומעבדות הבינה המלאכותית המובילות בעולם נאבקות על מקור דלק חדש: התקשורת הפנימית שלכם. OpenAI ו-Anthropic רוכשות כעת באופן אגרסיבי הודעות סלאק של עובדים, מיילים, הקלטות וידאו והיסטוריות קוד מסטארט-אפים – ומשלמות עד 300,000 דולר לעסקה בשוק שקט אך צומח במהירות לנתוני אינטראקציה אנושיים קנייניים .
הדחיפה לנתונים ארגוניים נובעת מחישוב מתמטי פשוט ובלתי נמנע. ההערכה המצוטטת ביותר, של קבוצת המחקר Epoch AI, מעמידה את המלאי הכולל של טקסט ציבורי איכותי שנוצר על ידי אדם על כ-300 טריליון טוקנים (רווח בר-סמך של 90%: 100 טריליון עד 1,000 טריליון) . בקצב הצריכה הנוכחי של מודלי הקצה, היצע זה צפוי להתרוקן בין 2026 ל-2032, עם הערכה חציונית של 2028
. כמה ניתוחים מעריכים שטקסט אנושי איכותי באינטרנט הפתוח עומד על 15–20 טריליון טוקנים בלבד, מה שדוחף את תאריך המיצוי כבר ל-2026
. PBS דיווחה בסוף 2025 כי "בהלה לזהב" של נתוני אימון לצ'אטבוטים עלולה להסתיים עד 2026
.
ככל שהתקרה הזו מתקרבת, OpenAI ו-Anthropic הפנו את תשומת לבן למאגר שטרם נוצל: נתוני שיתוף פעולה ארגוניים פנימיים . תיעוד של אינטראקציות אנושיות חיות – מיילים המכילים משא ומתן, תמלילי פגישות עם קבלת החלטות בזמן אמת, ושרשורי סלאק המציגים דינמיקה אותנטית במקום העבודה – מציעים את סוג הנתונים השיחתיים האורגניים שהפכו נדירים באינטרנט הציבורי המגורד.
מערכת אקולוגית חדשה של חברות תיווך צצה כדי לתווך עסקאות רגישות אלו. שני שמות מופיעים בתדירות הגבוהה ביותר: מרקור (Mercor) ו-סימפל-קלוז'ר (SimpleClosure) .
שיעורי שוק רחבים יותר, שדווחו על ידי רויטרס ב-2024, מציעים תחושת ערך ליחידה: כ-0.001 דולר למילה עבור טקסט, 1–2 דולר לתמונה, 2–4 דולר לוידאו קצר, ו-100–300 דולר לשעה של סרט או וידאו ארוך יותר .
סימפל-קלוז'ר, חברת פירוק סטארט-אפים, עיבדה כמעט 100 עסקאות כאלה בשנה האחרונה, עם תשלומים הנעים בין 10,000 ל-100,000 דולר לחברה . פלטפורמת "Asset Hub" של החברה עוזרת למייסדים לנקות מידע אישי מזהה (PII) מהנתונים לפני רישויונם – אם כי יעילות ועקביות ההאנונימיזציה נותרה לא ברורה ומהווה נקודת מחלוקת הולכת וגוברת .
האורך אליו חברות AI מוכנות להגיע כדי להבטיח נתוני אימון נחשף במקרה יוצא הדופן של פרויקט פנמה, התוכנית הסודית של Anthropic לבניית מערך נתוני אימון ספרים ענק .
לפרויקט היו שני מסלולים. ראשית, Anthropic רכשה ספרים מודפסים פיזיים, חתכה את כריכותיהם וסרקה אותם באופן הרסני עמוד אחר עמוד, והמירה אותם ל-PDF ניתנים לחיפוש תוך זריקת המקור המודפס. המטרה: להמיר עד 2 מיליון ספרים בשישה חודשים . תזכיר פנימי המליץ להשתמש בשם קוד "כי אנחנו לא רוצים שיידעו שאנחנו עובדים על זה" .
שנית, החברה הורידה יותר מ-7 מיליון קבצי ספרים אלקטרוניים פיראטיים מספריות צללים כמו LibGen ו-Pirate Library Mirror . מסלול זה הוביל לתביעה ייצוגית שהוגשה ב-2024 על ידי הסופרים אנדריאה בארטז, קירק וואלס ג'ונסון וצ'ארלס גרייבר, שהאשימו את Anthropic בשימוש בכמעט חצי מיליון ספרים פיראטיים לאימון קלוד .
ב-20 ביולי 2026, שופט פדרלי בסן פרנסיסקו אישר הסדר בסך 1.5 מיליארד דולר – תשלום זכויות היוצרים הגדול ביותר הידוע בהיסטוריה של ארה"ב . יותר מ-500,000 סופרים ומוציאים לאור היו חלק מהתביעה הייצוגית, והם יקבלו כ-3,000 דולר לכל יצירה מזכה .
באופן מכריע, בית המשפט קבע הבחנה משפטית בעלת השלכות מרחיקות לכת על אימון AI. שימוש בספרים אלקטרוניים פיראטיים היה מפר זכויות ועורר את ההסדר. אך קניית ספרים מודפסים פיזיים וסריקתם ההרסנית פנימית לאימון נקבעה כשימוש הוגן אפשרי, מכיוון שכל עותק פיזי הוחלף בעותק דיגיטלי בודד בתהליך שבית המשפט כינה "שינויי במיוחד" . 1.5 מיליארד הדולר כיסו את החבות עבור הספרים הפיראטיים; תוכנית ההשמדה הפיזית לא נענשה .
בעוד חברות ממהרות להפוך נתונים פנימיים לכסף, נותרות שאלות משמעותיות. יעילות האנונימיזציה על ידי מתווכים כמו SimpleClosure אינה ודאית ומהווה נקודת מחלוקת הולכת וגוברת . הודעות סלאק ומיילים של עובדים מכילים מידע אישי ורגיש ביותר, ולא ברור אם טכניקות הניקוי הנוכחיות מספיקות כדי למנוע זיהוי מחדש.
בינתיים, עלויות האימון מרקיעות שחקים. ריצת אימון בודדת בקנה מידה GPT-4 עשויה לעלות כבר 100 מיליון דולר או יותר . ככל שהנתונים הציבוריים האיכותיים אוזלים, העלויות המשולבות של רישוי נתונים ארגוניים קנייניים, תשלום הסדרי ענק כמו 1.5 מיליארד הדולר של Anthropic, ובניית צינורות נתונים סינתטיים – כולן מסלימות באופן דרמטי. שוק נתוני האימון הרחב יותר ל-AI צפוי לצמוח במהירות, מכ-3.6 מיליארד דולר ב-2025 ל-23 מיליארד דולר עד 2034, כאשר רישוי טקסט אנושי הופך לסוג נכסים ממוסד .
עבור משתמשים בודדים, הנוף השתנה. החל מסוף 2025, גם OpenAI וגם Anthropic שינו את המדיניות המוגדרת כברירת מחדל כדי לאפשר אימון על צ'אטים של צרכנים (ChatGPT Free ו-Plus, Claude Free, Pro ו-Max) אלא אם משתמשים בוחרים שלא להשתתף באופן אקטיבי . לקוחות ארגוניים ו-API נותרו מחוץ לאימון כברירת מחדל על פי הסכמי עיבוד נתונים חוזיים
.
המסר ברור: במרוץ להאכיל את הרעב הבלתי יודע שובע של AI לנתונים אנושיים, הגבולות בין ציבורי לפרטי, אישי ומסחרי, נמחקים מחדש – ארכיון סלאק אחד בכל פעם.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Epoch AI מעריכה שמלאי הטקסט האנושי הציבורי האיכותי עומד על כ 300 טריליון טוקנים, צפוי להסתיים עד 2028.
Epoch AI מעריכה שמלאי הטקסט האנושי הציבורי האיכותי עומד על כ 300 טריליון טוקנים, צפוי להסתיים עד 2028. OpenAI ו Anthropic רוכשות ארכיוני סלאק, מיילים ותמלילי ישיבות מחברות סטארט אפ שנסגרו או נמכרו, במחירים של 10,000 עד 300,000 דולר לעסקה.
בית משפט בארה"ב אישר ביולי 2026 את הסכם הפשרה הגדול בהיסטוריה על הפרת זכויות יוצרים – 1.5 מיליארד דולר שתשלם Anthropic בגין שימוש בספרים פיראטיים לאימון מודל קלוד.