OpenAI được cho là đã loại nhiều nhà thầu dùng AI để thực hiện công việc đánh giá ChatGPT, vì Project Lily được thiết kế để thu thập nhận định độc lập từ con người chứ không phải phản hồi do mô hình tạo ra. Project Lily được cho là có hàng trăm người chấm đọc và đánh giá các cuộc trò chuyện ChatGPT thực tế; trong kh...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, theo điều tra của 404 Media, là một hoạt động đánh giá bởi con người: các nhà thầu xem câu trả lời của ChatGPT để góp phần cải thiện hành vi của mô hình về sau. Chính mục tiêu này lý giải cho việc các nhà thầu dùng AI để làm phần đánh giá bị loại khỏi dự án: giá trị của dữ liệu nằm ở nhận định độc lập của con người. Nếu một mô hình đưa ra nhận định thay họ, quy trình không còn đo lường rõ ràng điều người dùng thực sự ưu tiên. 19
20
Quy trình được tường thuật cho thấy người chấm nhận các câu hỏi ChatGPT thực tế và, trong một số trường hợp, toàn bộ cuộc trò chuyện. Họ tóm tắt ý định của người dùng, đối chiếu các phương án trả lời rồi cho điểm theo thang 1–7. Mỗi tác vụ có thể có tối đa bốn câu trả lời ứng viên; trọng tâm là những đặc tính hành vi như giọng điệu, mức độ nịnh hót quá mức (sycophancy) hay các tuyên bố quá giống con người, thay vì chỉ kiểm tra độ đúng về mặt sự thật. 8
19
Các điểm số này có thể trở thành dữ liệu ưu tiên: bản ghi có cấu trúc về việc một người cho rằng câu trả lời nào phù hợp hơn trong một bối cảnh cụ thể. Dữ liệu ấy hữu ích để tinh chỉnh mô hình theo hành vi mong muốn, nhưng chỉ khi các đánh giá đủ nhất quán, có hiểu biết và độc lập.
Project Lily được cho là có hàng trăm người đánh giá bên ngoài. Họ được mô tả là tuyển qua Crossing Hurdles và nhận thanh toán qua Mercor; một người chấm nói mức thù lao của mình trên 50 USD/giờ. Riêng các thông tin về hoạt động đánh giá rộng hơn của OpenAI đề cập hơn 10.000 nhà thầu trên các tuyến chấm điểm khác nhau; con số này không nên được hiểu là quy mô của riêng Project Lily. 19
6
AI có thể đánh giá nhanh và đôi khi hữu ích trong kiểm thử nội bộ, nhưng nó trả lời một câu hỏi khác với đánh giá về sở thích của con người. Mô hình thường tái tạo các khuôn mẫu học được trong dữ liệu huấn luyện và có thể thiên về câu trả lời có cách diễn đạt, phong cách hoặc giả định quen thuộc.
Khi đầu ra của một mô hình, hoặc mô hình có quan hệ gần gũi, liên tục được dùng để thưởng cho đầu ra của các mô hình sau này, một vòng lặp phản hồi có thể xuất hiện:
Điều này không chứng minh rằng mọi hình thức đánh giá bằng AI đều làm mô hình tệ đi. Đánh giá tự động vẫn có giá trị nếu được đối chiếu, kiểm định với đánh giá của con người và áp dụng trong giới hạn rõ ràng. Nhưng dùng nó thay cho tác vụ được giao rõ ràng nhằm tạo dữ liệu ưu tiên từ con người sẽ làm suy yếu tính độc lập của tín hiệu huấn luyện — và đó dường như là lý do của quy định cấm này.
Theo các thông tin được đăng tải, người giám sát được chỉ dẫn không dựa vào các công cụ phát hiện văn bản AI như GPTZero. Thay vào đó, họ xem xét mô hình làm việc và sản phẩm viết bằng đánh giá của con người, chẳng hạn cách dùng từ đồng đều bất thường, dấu câu hay định dạng có tính lặp lại, và tốc độ hoàn thành khó hợp lý. 6
Cách làm này có hạn chế rõ ràng: không dấu hiệu đơn lẻ nào đủ chứng minh một người đã dùng AI. Người viết nhanh có thể giàu kinh nghiệm; câu chữ tương tự có thể xuất phát từ cùng một bộ tiêu chí chấm. Vì vậy, các tín hiệu này chỉ nên là lý do để xem xét thêm, không phải bằng chứng tự thân đủ để loại một người khỏi dự án.
Các tổ chức thường không công bố danh sách tiêu chí chống gian lận quá cụ thể, vì một bảng kiểm chính xác có thể biến thành hướng dẫn né tránh. Nhà thầu có thể đổi cách diễn đạt, cố ý trì hoãn thời gian nộp bài hoặc thay đổi định dạng, trong khi vẫn giao phần phán đoán cho mô hình.
Tuy nhiên, sự kín kẽ cũng tạo ra rủi ro riêng. Nếu người lao động không biết quyết định chất lượng được đưa ra dựa trên đâu, họ khó phản biện sai sót. Một chương trình bảo đảm tính liêm chính bền vững cần kết hợp phương thức phát hiện bảo mật với quy định rõ ràng, quyết định được lưu vết và cơ chế khiếu nại hoặc sửa sai có ý nghĩa.
Mercor được cho là đã nói rằng dùng AI để thực hiện công việc đánh giá này là vi phạm chính sách, và trường hợp được xác nhận sẽ bị loại ngay khỏi dự án liên quan. Các bài tường thuật cũng cho biết quy định cấm hỗ trợ bằng AI theo nghĩa rộng, gồm cả công cụ dùng để viết phản hồi hoặc bình luận. 6
40
Trường hợp được tường thuật về việc cố ý cho điểm kém cho thấy một điểm lớn hơn: “phản hồi con người” không tự động đáng tin chỉ vì có người gửi đánh giá. Người chấm có thể làm vội, hiểu sai tiêu chí, tối ưu cho số lượng tác vụ, hành động thiếu thiện chí hoặc cố khai thác những hệ thống kiểm soát chất lượng thiếu minh bạch.
Đây vừa là bài toán kỹ thuật, vừa là bài toán động cơ. Nhà phát triển mô hình cần những nhận định được hiệu chuẩn và đưa ra thiện chí, nhằm dự báo hành vi tốt hơn trong thực tế. Trong khi đó, nhà thầu có thể chủ yếu được thúc đẩy bởi tốc độ, việc hoàn tất tác vụ hoặc tránh bị từ chối. Khi hai hệ động cơ này lệch nhau, dữ liệu tạo ra có thể nhiễu hoặc bị méo theo hệ thống.
Đánh giá của con người vẫn quan trọng với các nhận định phụ thuộc ngữ cảnh, mang tính chủ quan hoặc khó xác minh tự động. Nhưng nó hiệu quả nhất khi là một hệ thống nhiều lớp kiểm tra, thay vì chỉ là dòng điểm số từ từng cá nhân. Một số biện pháp thực tế gồm:
Bài học cốt lõi rất đơn giản: huấn luyện theo ưu tiên chỉ đáng tin bằng chính quy trình tạo ra các ưu tiên đó. Người đánh giá là con người không phải bảo chứng tuyệt đối cho chất lượng; và nhận định do AI tạo ra cũng không thể đơn giản thay thế phản hồi độc lập của con người khi mục tiêu là tìm hiểu điều con người thực sự coi trọng.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
OpenAI được cho là đã loại nhiều nhà thầu dùng AI để thực hiện công việc đánh giá ChatGPT, vì Project Lily được thiết kế để thu thập nhận định độc lập từ con người chứ không phải phản hồi do mô hình tạo ra.
OpenAI được cho là đã loại nhiều nhà thầu dùng AI để thực hiện công việc đánh giá ChatGPT, vì Project Lily được thiết kế để thu thập nhận định độc lập từ con người chứ không phải phản hồi do mô hình tạo ra. Project Lily được cho là có hàng trăm người chấm đọc và đánh giá các cuộc trò chuyện ChatGPT thực tế; trong khi đó, hơn 10.000 nhà thầu là quy mô được nhắc tới cho toàn bộ các tuyến đánh giá liên quan đến OpenAI, khôn...
Vụ việc cho thấy phản hồi do con người cung cấp không mặc nhiên đáng tin: hệ thống cần kiểm tra chất lượng, hiệu chuẩn người chấm và cơ chế xử lý các động cơ làm việc lệch với mục tiêu cải thiện mô hình.