OpenAI’nin, modellerini değerlendirmek için görevlendirdiği bazı sözleşmeli çalışanları işlerinde yapay zekâ kullandıkları için projelerden çıkardığı bildirildi. Buradaki çelişki, bir yapay zekâ şirketinde yapay zekâ kullanılması değil: Bu görevlerin amacı, ChatGPT yanıtları hakkında bağımsız insan görüşü toplamaktı. Haberler, işten çıkarmaları OpenAI’nin daha geniş değerlendirme çalışmalarıyla ilişkilendiriyor ve Project Lily’yi insan incelemesine dayalı programlardan biri olarak anlatıyor. Ancak çıkarılan çalışanların tamamının Lily’de görev yaptığını doğrulamıyor.
16
13
Project Lily’de ne değerlendiriliyor?
Haberlere göre Project Lily kapsamında yüzlerce dışarıdan sözleşmeli çalışan, gerçek ChatGPT istemlerini ve bazı görevlerde bunların çevresindeki konuşmaları inceliyor. Değerlendiricilerin Crossing Hurdles aracılığıyla işe alındığı, ödemelerinin ise Mercor üzerinden yapıldığı aktarılıyor. Bir çalışan saatte 50 doların üzerinde kazandığını söyledi; bu, herkes için doğrulanmış bir ücret değil.
2
20
Değerlendirici önce kullanıcının ne yapmak istediğini özetliyor. Ardından, kimi görevlerde dörde kadar çıkan alternatif ChatGPT yanıtlarını eleştirip 1’den 7’ye kadar puanlıyor. Değerlendirmede üslup, mekanik ifadeler ve kullanıcıya gereğinden fazla katılma gibi özellikler öne çıkıyor. Puanların ve yazılı yorumların, modelin gelecekteki yanıtlarını iyileştirmeye katkı sağlaması amaçlanıyor.
4
11
3
1
Yapay zekâ desteği neden sorun?
Bir insan, yanıtın isteği karşılayıp karşılamadığına veya fazla onaylayıcı olup olmadığına kendi bakış açısıyla karar verebilir. Eleştiriyi başka bir yapay zekâ yazdığında ya da puanı o seçtiğinde bu bağımsızlık zayıflar. Geri bildirim, insan yargısı yerine bir modelin tercihlerini yansıtabilir. Bu, verinin değerine ilişkin bir risktir; yapay zekâ destekli belirli bir puanın modele zarar verdiğinin kanıtı değildir.
4
16
Aktarılan talimatlar, değerlendiricilerin işi incelemek veya geri bildirim yazmak için Grammarly ve yapay zekâ destekli çeviri özellikleri dâhil yapay zekâ araçlarını kullanmasını yasaklıyor. Başka çalışanların değerlendirmelerini denetleyen kişilere de güvenilir bulunmadıkları gerekçesiyle yapay zekâ tespit araçlarını kullanmamaları söyleniyor.
13
9
İhlal nasıl fark ediliyor, ne belirsiz kalıyor?
Haberlere göre sorumlular, tespit yazılımlarının verdiği puanlardan çok birbirini tekrar eden, yapay zekâ ürünü gibi görünen ifadeler veya olağan dışı hızda tamamlanan işler gibi örüntülere bakıyor. Bunlar daha yakından inceleme gerekçesi olabilir; tek başlarına kanıt değildir. Eldeki haberler, bu yöntemle ihlallerin ne sıklıkla doğru saptandığını ya da gözden kaçırıldığını göstermiyor.
9
33
Üstelik yapay zekâ kullanılmadan verilen bir puan da özensiz veya kasıtlı olarak yanlış olabilir. Bir çalışanın bilerek kötü puanlar verdiğini kabul ettiği yönündeki somut iddia, sağlanan haberlerle doğrulanamıyor. Bu nedenle olayın koşulları veya ne kadar yaygın olduğu söylenemez. Çıkarılabilecek daha dar sonuç şu: İnsan tarafından puanlandı etiketi, her puanın güvenilir olduğunu garanti etmez; değerlendirmelerin kalitesinin de kontrol edilmesi gerekir.
1
4
Kullanıcılar açısından ayrı bir konu da gizlilik. Project Lily değerlendiricileri gerçek konuşma metinlerini görebiliyor; haberlerde, OpenAI’nin gizlilik filtresinin bazı hassas bilgileri çıkaramayabileceği belirtiliyor. Dolayısıyla hem değerlendirmelerin güvenilirliği hem de konuşmaların nasıl işlendiği önem taşıyor.
8
12