AI có thể tự làm hỏng mình khi học từ dữ liệu do AI tạo ra
Các nghiên cứu chỉ ra rằng việc huấn luyện lặp lại AI bằng dữ liệu tổng hợp có thể gây ra “model collapse”, khi các mẫu hiếm trong dữ liệu biến mất và mô hình ngày càng lệch khỏi phân bố dữ liệu ban đầu. Huấn luyện đệ quy làm khuếch đại sai lệch lấy mẫu: các sự kiện hiếm ở “đuôi phân bố” xuất hiện ngày càng ít, khiế...
Đăng bởiBiên tập bằng GPT-5.5Hình ảnh được tạo bằng GPT Image 2
Các nghiên cứu chỉ ra rằng việc huấn luyện lặp lại AI bằng dữ liệu tổng hợp có thể gây ra “model collapse”, khi các mẫu hiếm trong dữ liệu biến mất và mô hình ngày càng lệch khỏi phân bố dữ liệu ban đầu.
Huấn luyện đệ quy làm khuếch đại sai lệch lấy mẫu: các sự kiện hiếm ở “đuôi phân bố” xuất hiện ngày càng ít, khiến các thế hệ mô hình sau dần quên chúng.
Ngay cả một lượng nhỏ dữ liệu thực hoặc kiến thức tiên nghiệm cũng có thể ngăn sụp đổ bằng cách giữ lại bằng chứng rằng những mẫu hiếm đó tồn tại.
What does the new study on AI model collapse find about preventing degradation when models are trained on synthetic data, why does recursiveRecursive training on AI‑generated data can gradually erase rare patterns from a model’s learned distribution, a phenomenon researchers call model collapse.
Prompt AI
Create a landscape editorial hero image for this Studio Global article: What does the new study on AI model collapse find about preventing degradation when models are trained on synthetic data, why does recursive. Article summary: The study describes model collapse as a failure mode where recursively trained generative models lose information about the original data distribution, especially its rare or low-probability regions.. Topic tags: general, government, education, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "However, as AI-generated data increasingly populates the internet, an important question arises: What happens when new AI models are trained on datasets containing their previous o" source context "Avoiding Model Collapse in AI Training - Risk Insight" Reference image 2: visual subject "Artificial intelligence models
openai.com
Các hệ thống AI tạo sinh ngày càng được huấn luyện bằng dữ liệu tổng hợp (synthetic data) — tức nội dung do các mô hình AI trước đó tạo ra. Tuy nhiên, nghiên cứu gần đây cho thấy cách làm này tiềm ẩn một rủi ro lớn gọi là “model collapse” (sụp đổ mô hình): quá trình suy giảm dần khiến mô hình mất khả năng đại diện cho toàn bộ sự đa dạng của dữ liệu ban đầu.
Một nghiên cứu lớn về huấn luyện đệ quy phát hiện rằng khi mô hình liên tục học từ dữ liệu do AI tạo ra thay vì dữ liệu thật, chúng bắt đầu quên các mẫu hiếm trong phân bố dữ liệu gốc. Qua nhiều vòng huấn luyện, những phần dữ liệu bị thiếu này tích tụ lại cho đến khi mô hình hình thành một bức tranh méo mó về thực tế.
Studio Global AI
Tiếp tục nghiên cứu của bạn
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Câu trả lời ngắn gọn cho "AI có thể tự làm hỏng mình khi học từ dữ liệu do AI tạo ra" là gì?
Các nghiên cứu chỉ ra rằng việc huấn luyện lặp lại AI bằng dữ liệu tổng hợp có thể gây ra “model collapse”, khi các mẫu hiếm trong dữ liệu biến mất và mô hình ngày càng lệch khỏi phân bố dữ liệu ban đầu.
Những điểm chính cần xác nhận đầu tiên là gì?
Các nghiên cứu chỉ ra rằng việc huấn luyện lặp lại AI bằng dữ liệu tổng hợp có thể gây ra “model collapse”, khi các mẫu hiếm trong dữ liệu biến mất và mô hình ngày càng lệch khỏi phân bố dữ liệu ban đầu. Huấn luyện đệ quy làm khuếch đại sai lệch lấy mẫu: các sự kiện hiếm ở “đuôi phân bố” xuất hiện ngày càng ít, khiến các thế hệ mô hình sau dần quên chúng.
Tôi nên làm gì tiếp theo trong thực tế?
Ngay cả một lượng nhỏ dữ liệu thực hoặc kiến thức tiên nghiệm cũng có thể ngăn sụp đổ bằng cách giữ lại bằng chứng rằng những mẫu hiếm đó tồn tại.
Điều này ngày càng đáng lo khi nội dung do AI tạo ra đang lan rộng trên internet và dần trở thành một phần lớn trong các bộ dữ liệu dùng để huấn luyện thế hệ mô hình tiếp theo.
“Model collapse” là gì?
Model collapse là một dạng lỗi xảy ra khi các mô hình tạo sinh được huấn luyện bằng dữ liệu do các mô hình trước tạo ra, thay vì dữ liệu do con người hoặc thế giới thực tạo ra.
Các nhà nghiên cứu phát hiện rằng kiểu huấn luyện đệ quy này tạo ra những sai lệch không thể đảo ngược. Cụ thể, mô hình dần mất thông tin về “đuôi phân bố” — những ví dụ hiếm hoặc bất thường xuất hiện ít nhưng rất quan trọng để mô tả đúng thực tế.
Theo thời gian:
Đầu ra của mô hình trở nên kém đa dạng hơn
Các trường hợp hiếm dần biến mất
Mô hình chỉ còn phản ánh những mẫu phổ biến nhất
Hiện tượng này đã được quan sát trong nhiều loại mô hình tạo sinh khác nhau, bao gồm:
Large Language Models (LLMs)
Variational Autoencoders (VAEs)
Gaussian Mixture Models (GMMs)
Việc nhiều kiến trúc khác nhau đều gặp hiện tượng này cho thấy model collapse có thể là một đặc tính chung của học máy tạo sinh khi dùng dữ liệu tổng hợp lặp lại, chứ không phải lỗi của riêng một loại mô hình.
Vì sao huấn luyện đệ quy làm biến mất các mẫu hiếm?
Nguyên nhân chính nằm ở cách lấy mẫu thống kê.
Khi một mô hình tạo dữ liệu tổng hợp, nó thường tái tạo các mẫu có xác suất cao nhiều hơn các mẫu hiếm. Những sự kiện hiếm vốn nằm ở phần “đuôi” của phân bố nên đã ít xuất hiện ngay từ đầu.
Khi thế hệ mô hình tiếp theo được huấn luyện trên dữ liệu đó:
Ví dụ hiếm xuất hiện còn ít hơn trước
Mô hình học một phân bố hơi sai lệch
Sai lệch này tiếp tục bị khuếch đại ở các thế hệ sau
Qua mỗi vòng lặp, sai lệch nhỏ ban đầu trở thành sai lệch lớn. Cuối cùng, phần đuôi của phân bố biến mất hoàn toàn, và mô hình chỉ còn giữ lại các mẫu phổ biến nhất.
Một khi những ví dụ hiếm không còn trong dữ liệu huấn luyện, các mô hình sau không thể tái tạo chúng, vì không còn bằng chứng nào cho thấy chúng từng tồn tại.
Vì sao dữ liệu thật có thể ngăn “sụp đổ mô hình”?
Một phát hiện đáng chú ý từ các phân tích gần đây là chỉ cần một lượng rất nhỏ dữ liệu thật cũng có thể ngăn model collapse.
Trong nghiên cứu về một nhóm mô hình thống kê gọi là exponential families, các nhà khoa học nhận thấy rằng chỉ cần một điểm dữ liệu từ phân bố thật cũng có thể đóng vai trò như “neo” cho quá trình học. Điểm dữ liệu này giữ lại bằng chứng rằng các mẫu hiếm tồn tại, ngăn vòng lặp huấn luyện hội tụ vào một phân bố sai.
Tương tự, kiến thức tiên nghiệm (prior knowledge) — tức các giả định hoặc ràng buộc được đưa sẵn vào mô hình — cũng có thể đóng vai trò tương tự. Khi mô hình bị giới hạn trong một số dạng phân bố hợp lý, nó khó bị trôi hoàn toàn theo dữ liệu tổng hợp lệch lạc.
Nói cách khác:
Dữ liệu thật giúp bảo tồn các mẫu hiếm nhưng hợp lệ
Kiến thức tiên nghiệm giữ cấu trúc thống kê của mô hình
Ngay cả khi dữ liệu tổng hợp chiếm phần lớn tập huấn luyện, những “mỏ neo” này vẫn có thể ổn định quá trình học.
Vì sao vấn đề này đặc biệt quan trọng với LLM?
Nguy cơ model collapse trở nên nghiêm trọng hơn khi nội dung do AI tạo ra ngày càng nhiều trên internet.
Các mô hình ngôn ngữ lớn thường được huấn luyện từ dữ liệu web quy mô cực lớn. Nhưng khi ngày càng nhiều bài viết, hình ảnh hoặc đoạn văn trên internet được tạo bởi AI, những dữ liệu này có thể quay trở lại làm dữ liệu huấn luyện cho thế hệ AI tiếp theo.
Nếu điều đó xảy ra trên quy mô lớn, hậu quả có thể gồm:
Nội dung AI tạo ra ngày càng kém đa dạng
Khả năng xử lý các trường hợp hiếm hoặc bất thường giảm
Mô hình hiểu thế giới theo cách ngày càng hẹp
Các nhà nghiên cứu cảnh báo rằng để tránh điều này, các hệ thống AI tương lai cần duy trì nguồn dữ liệu do con người tạo ra đáng tin cậy hoặc sử dụng các cơ chế giúp bảo tồn phân bố dữ liệu ban đầu trong quá trình huấn luyện.
Những điểm còn chưa chắc chắn
Mặc dù cơ chế model collapse đã được chứng minh khá rõ, một số chi tiết vẫn đang được nghiên cứu thêm. Ví dụ, kết luận rằng chỉ cần một điểm dữ liệu thật để ngăn sụp đổ chủ yếu dựa trên phân tích lý thuyết và các mô hình thống kê đơn giản, chứ chưa phải thử nghiệm quy mô lớn trên các LLM thương mại.
Điều đó có nghĩa là trong thực tế, lượng dữ liệu thật cần thiết có thể phụ thuộc vào kiến trúc mô hình, cách huấn luyện và cấu trúc bộ dữ liệu.
Dù vậy, thông điệp chính vẫn rất rõ ràng: nếu AI chỉ học từ sản phẩm của chính AI, nó có thể dần đánh mất những phần quan trọng của thực tế. Vì thế, việc giữ liên kết với dữ liệu thế giới thật vẫn là yếu tố sống còn để các mô hình AI duy trì độ chính xác lâu dài.
arxiv.org
Lost in Retraining: Roaming the Parameter Space of ...