Haberlere göre OpenAI, Project Lily’de ChatGPT yanıtlarını değerlendirmek için yapay zekâ kullanan birden fazla taşeronu projeden çıkardı; çünkü programın hedefi model üretimi değil, bağımsız insan yargısı toplamaktı. Project Lily’de yüzlerce dış değerlendiricinin gerçek ChatGPT konuşmalarını okuyup kullanıcı niyeti...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
404 Media’nın haberine göre Project Lily, ChatGPT’nin ilerideki davranışını iyileştirmeye yardımcı olmak üzere taşeronların yanıtları değerlendirdiği bir insan inceleme operasyonu. Bu nedenle, değerlendirme işini üretken yapay zekâya yaptıran taşeronların projeden çıkarıldığı bildirildi: Sistemin değeri, bağımsız insan muhakemesinden gelen veride yatıyor. Kararı bir model veriyorsa süreç artık insanların hangi yanıtı tercih ettiğini temiz biçimde ölçemez. 19
20
Bildirilen iş akışında değerlendiricilere gerçek ChatGPT istemleri ve bazı durumlarda tüm konuşmalar veriliyor. Değerlendiriciler kullanıcının niyetini özetliyor, aday yanıtları karşılaştırıyor ve 1’den 7’ye kadar puanlıyor. Her görevde en fazla dört aday yanıt bulunabildiği; puanlamanın yalnızca olgusal doğruluktan çok üslup, aşırı onaylayıcılık (sycophancy) ve gereğinden fazla insanmış gibi konuşma gibi davranışsal niteliklere odaklandığı aktarılıyor. 8
19
Bu puanlar, belirli bir bağlamda bir insanın hangi yanıtı daha iyi bulduğunu gösteren yapılandırılmış tercih verisine dönüşebilir. Böyle bir veri, ancak yargılar yeterince tutarlı, bilgili ve bağımsız olduğunda modeli istenen davranışlara yöneltmekte işe yarar.
Project Lily’de yüzlerce dış değerlendiricinin çalıştığı bildiriliyor. Bu kişilerin Crossing Hurdles üzerinden işe alındığı, ödemelerinin Mercor aracılığıyla yapıldığı ve bir değerlendiricinin saatlik ücretinin 50 doların üzerinde olduğunu söylediği aktarılıyor. OpenAI’nin daha geniş değerlendirme operasyonu için ise 10 binden fazla taşerondan söz ediliyor; bu sayı yalnızca Project Lily’nin büyüklüğü olarak okunmamalı. 19
6
Bir yapay zekâ değerlendiricisi hızlı olabilir ve şirket içi testlerde fayda sağlayabilir. Ancak insan tercihi incelemesinden farklı bir soruya yanıt verir. Model, eğitiminde öğrendiği kalıpları yeniden üretmeye; kendisine tanıdık gelen ifade biçimlerini, üslubu ve varsayımları kayırmaya eğilimli olabilir.
Bir modelin ya da onunla yakından ilişkili bir modelin çıktıları, sonraki model çıktılarının puanlanmasında tekrar tekrar kullanılırsa geri besleme döngüsü oluşabilir:
Bu, yapay zekâyla yapılan her değerlendirmenin mutlaka modeli kötüleştirdiği anlamına gelmez. Otomatik değerlendirme, insan yargısıyla doğrulandığında ve sınırları açıkça belirlendiğinde yararlı olabilir. Fakat özellikle insan tercih verisi üretmek için kurulmuş bir süreçte insanın yerine geçirilmesi, eğitim sinyalinin bağımsızlığını zayıflatır. Haberlere göre yasağın temel gerekçesi de bu.
Haberlere göre yöneticilere, GPTZero gibi yapay zekâ metni tespit araçlarına güvenmemeleri söylendi. Bunun yerine insan incelemesiyle iş örüntülerine ve yazılı çıktıya bakılması; olağandışı derecede tekdüze ifadeler, noktalama veya biçimlendirme kalıpları ve gerçekçi görünmeyen hızda tamamlama gibi işaretlerin değerlendirilmesi istendi. 6
Bunun açık bir sınırı var: Bu işaretlerin hiçbiri tek başına bir çalışanın yapay zekâ kullandığını kanıtlamaz. Hızlı çalışan biri deneyimli olabilir; benzer dil ise ortak değerlendirme yönergesinden kaynaklanabilir. Bu yüzden bu göstergeler ancak inceleme başlatmak için bir neden sayılmalı; projeden çıkarma kararının ise daha güçlü kanıtlara ve adil bir sürece dayanması gerekir.
Kurumlar, anti-hile yöntemlerinin ayrıntılarını genellikle yayımlamaz. Kesin bir kontrol listesi, kuralları aşmak isteyenler için yol haritasına dönüşebilir: Çalışanlar ifadeleri değiştirebilir, kasıtlı gecikmeler ekleyebilir veya biçimi çeşitlendirebilir; buna rağmen yargıyı bir modele devretmeyi sürdürebilir.
Ancak gizlilik de ayrı bir risk yaratır. Çalışanlar kalite kararının hangi temelde verildiğini bilmiyorsa hatalı kararları itiraz etmek zorlaşır. Sağlam bir dürüstlük sistemi; gizli tespit yöntemlerini açık kurallar, belgelenmiş kararlar ve anlamlı itiraz ya da düzeltme mekanizmalarıyla birlikte yürütmelidir.
Mercor’un, bu değerlendirme işini yapmak için yapay zekâ kullanmanın politika ihlali olduğunu ve doğrulanmış vakalarda ilgili projeden derhâl çıkarma uygulandığını söylediği bildirildi. Haberlere göre kurallar, geri bildirim veya yorum yazmak için kullanılan araçlar dâhil olmak üzere yapay zekâ desteğini daha geniş biçimde yasaklıyordu. 6
40
Kasıtlı olarak kötü puan verildiği bildirilen vaka, daha büyük bir gerçeğe işaret ediyor: Bir puanın bir insan tarafından girilmiş olması, o puanın otomatik olarak dikkatli veya bağımsız olduğu anlamına gelmez.
Değerlendirici acele edebilir, yönergeyi yanlış anlayabilir, iş hacmini artırmaya çalışabilir, kötü niyetli davranabilir ya da şeffaf olmayan kalite sistemlerini aşmaya uğraşabilir. Bu, teknik olduğu kadar teşviklerle ilgili bir mesele. Model geliştiricisi, gerçek dünyadaki davranışı iyileştirecek dengeli ve iyi niyetli yargılar ister. Taşeronun ödülü ise daha çok hız, görev tamamlama veya reddedilmemek olabilir. Bu teşvikler birbirinden ayrıştığında veri gürültülü hâle gelebilir veya sistematik biçimde bozulabilir.
İnsan incelemesi; bağlama bağlı, öznel veya otomatik doğrulaması zor yargılarda önemini koruyor. Ancak tek tek puanların aktığı basit bir süreçten ziyade, birbirini denetleyen bir sistem olarak tasarlandığında daha güvenilir çalışır. Uygulanabilecek önlemler şunlar:
Temel sonuç basit: Tercih eğitimi, o tercihleri üreten süreç kadar güvenilirdir. İnsan değerlendiriciler tek başına kalite garantisi değildir; amaç insanların gerçekten neye değer verdiğini öğrenmekse, yapay zekâ üretimi yargılar da bağımsız insan geri bildiriminin doğrudan yerine geçemez.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Haberlere göre OpenAI, Project Lily’de ChatGPT yanıtlarını değerlendirmek için yapay zekâ kullanan birden fazla taşeronu projeden çıkardı; çünkü programın hedefi model üretimi değil, bağımsız insan yargısı toplamaktı.
Haberlere göre OpenAI, Project Lily’de ChatGPT yanıtlarını değerlendirmek için yapay zekâ kullanan birden fazla taşeronu projeden çıkardı; çünkü programın hedefi model üretimi değil, bağımsız insan yargısı toplamaktı. Project Lily’de yüzlerce dış değerlendiricinin gerçek ChatGPT konuşmalarını okuyup kullanıcı niyetini özetlediği ve en fazla dört yanıtı 1–7 ölçeğinde puanladığı bildiriliyor.
Olay, insan geri bildiriminin tek başına güvence olmadığını gösteriyor: Eğitim sistemleri, aceleci veya kötü niyetli puanlamalara karşı kalibrasyon, denetim ve bağımsız çapraz kontrol gerektiriyor.