DeepSeek V4 Pro 0813 phát hiện 28/32 lỗ hổng khi gộp ba lần chạy, với chi phí khoảng 295 USD. Kết quả nghiêng về một hệ thống có điều phối: dùng tác nhân rẻ và thiên về khám phá để tìm ứng viên, mô hình ổn định hoặc chính xác để xác minh, sau đó đưa các phát hiện quan trọng qua khâu đánh giá của con người.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Benchmark công bố tháng 8/2026 của Aikido đã kiểm tra 10 mô hình AI trên 32 lỗ hổng vừa được công bố, với ba lần điều tra cho mỗi mô hình. Khi gộp kết quả của ba lần chạy, DeepSeek V4 Pro 0813 dẫn đầu với 28 phát hiện, tương đương 87,5% pooled recall, với chi phí khoảng 295 USD. 3
Tuy nhiên, thông điệp đáng chú ý nhất không phải là “đã tìm ra mô hình AI bảo mật tốt nhất”. Kết quả cho thấy hiệu năng còn phụ thuộc mạnh vào cách xây dựng hệ thống: số lần chạy, công cụ, bộ nhớ điều tra, theo dõi trạng thái, xác minh và phân công vai trò cho từng mô hình.
DeepSeek V4 Pro 0813 phát hiện 28/32 lỗ hổng khi gộp ba lần chạy. Đây là kết quả nổi bật nhất về khả năng mở rộng phạm vi tìm kiếm, nhưng cần hiểu đúng: con số này là kết quả pass@3, tức tổng hợp từ ba cuộc điều tra độc lập, chứ không có nghĩa một lần gọi mô hình chắc chắn sẽ tìm ra 28 lỗ hổng.
Mỗi lần chạy có thể xem xét những tệp khác nhau, đi theo các luồng mã khác nhau hoặc đưa ra những giả thuyết khai thác khác nhau. Khi gộp lại, hệ thống tận dụng được sự đa dạng đó để tăng độ bao phủ. Vì vậy, kết quả ủng hộ việc chạy nhiều cuộc điều tra độc lập thay vì coi câu trả lời đầu tiên của mô hình là một bản đánh giá bảo mật hoàn chỉnh. 3
DeepSeek Pro phù hợp với vai trò khám phá ban đầu: tìm càng nhiều ứng viên càng tốt. Nhưng các phát hiện vẫn cần được kiểm chứng bằng bằng chứng, loại bỏ trùng lặp và đánh giá mức độ nghiêm trọng trước khi trở thành cảnh báo gửi tới môi trường sản xuất.
Ba lần chạy DeepSeek V4 Flash 0731 tìm thấy 24/32 lỗ hổng, với chi phí khoảng 108 USD. Xét trên tỷ lệ bao phủ so với chi phí, đây là lựa chọn đáng chú ý cho các cuộc quét song song hoặc những lần chạy bổ sung trong phạm vi ngân sách cố định.
Flash không nhất thiết là mô hình phù hợp nhất cho bước đánh giá cuối cùng. Giá trị thực tế của nó nằm ở việc cho phép hệ thống thực hiện nhiều lượt tìm kiếm hơn, sau đó chuyển toàn bộ phát hiện cho một tầng xác minh có tính chọn lọc cao hơn. 3
Grok 4.6 nổi bật về tính nhất quán: 21 lỗ hổng xuất hiện trong cả ba lần chạy. Đây là đặc điểm quan trọng với các đội ngũ cần kết quả có thể dự đoán, báo cáo ổn định và ít biến động giữa những lần quét định kỳ.
Điểm mạnh của Grok khác với DeepSeek Pro. Một mô hình có độ lặp lại cao có thể phù hợp hơn cho hoạt động giám sát thường xuyên hoặc quy trình chuẩn hóa, ngay cả khi một mô hình thiên về khám phá đạt pooled recall cao hơn.
Claude Opus 5 đạt 26/32 khi gộp ba lần chạy, còn GPT-5.6 Sol đạt 25/32. Cả hai đều nằm trong nhóm có hiệu năng cao. Dù vậy, kết quả làm suy yếu giả định rằng mô hình đóng đắt tiền nhất đương nhiên sẽ cho độ bao phủ lỗ hổng tốt nhất.
Doanh nghiệp vì thế không nên chọn một mô hình chỉ dựa trên thương hiệu hoặc danh tiếng ở các benchmark tổng quát. Cần đánh giá xem khả năng suy luận, cách lập báo cáo hay hành vi khi rà soát của mô hình đó có bổ sung giá trị cho toàn bộ quy trình hay không. 3
Kimi K3 đạt 92,3% pooled precision. Precision trả lời một câu hỏi khác với recall: trong số các phát hiện được gửi lên, có bao nhiêu phát hiện được chấp nhận là hợp lệ.
Vì vậy, Kimi có thể phù hợp với vai trò xác minh, viết báo cáo hoặc phân loại cảnh báo có độ tin cậy cao. Một tác nhân có recall cao như DeepSeek Pro có thể tìm kiếm rộng và chấp nhận nhiều tín hiệu nhiễu hơn; một mô hình có precision cao có thể giúp giảm số cảnh báo sai đến tay kỹ sư.
Aikido ghi nhận Qwen3.8-Max đôi khi quay lại cùng một CVE hoặc cùng một hướng suy luận. Điều này gây lãng phí nếu các lượt điều tra chỉ lặp lại giả thuyết đã kiểm tra mà không mở rộng phạm vi bao phủ.
Nhưng sự lặp lại không phải lúc nào cũng vô ích. Một lần xem xét thứ hai có thể phát hiện điều kiện khai thác, đường thực thi hoặc chi tiết xác minh bị bỏ sót. Cách xử lý phù hợp nằm ở tầng điều phối: hệ thống cần ghi nhớ những gì đã được kiểm tra, giới hạn các nhánh lặp và chuyển những trường hợp chưa rõ sang một cuộc điều tra mới thay vì tự động phát lại cùng một quy trình.
Trong bản so sánh cập nhật, GLM-5.3 cải thiện từ 24/32 lên 25/32, đồng thời vẫn có hồ sơ chi phí thấp hơn các mô hình frontier đóng được đề cập trong benchmark.
Điều đó biến GLM-5.3 thành một ứng viên đáng cân nhắc cho các tác vụ khối lượng lớn hoặc làm một thành phần trong hệ thống ensemble. Lợi thế lớn nhất xuất hiện khi tổ chức dùng chi phí thấp và tính linh hoạt triển khai để chạy nhiều cuộc điều tra hơn, thay vì chỉ thực hiện một lượt duy nhất với bất kỳ mô hình nào.
Một hệ thống tìm lỗ hổng không nên bị quy về một con số duy nhất trên bảng xếp hạng:
Mỗi chỉ số phản ánh một nhu cầu vận hành khác nhau. Giai đoạn khám phá cần recall cao và hành vi điều tra đa dạng. Ngược lại, cảnh báo gửi trực tiếp vào quy trình phát triển cần precision cao, bằng chứng tái lập được, khả năng loại bỏ trùng lặp và xếp hạng rủi ro hữu ích.
Một mô hình giỏi tìm ra nhiều khả năng có thể tạo quá nhiều nhiễu nếu được dùng để phát cảnh báo chưa qua kiểm duyệt. Ngược lại, mô hình thận trọng và chính xác có thể bỏ sót một số vấn đề nhưng lại hữu ích hơn ở khâu triage và xác minh.
Kết quả của Aikido cho thấy hiệu năng của các tác nhân AI có tính ngẫu nhiên đáng kể. Một lần chạy chỉ lấy mẫu một hướng điều tra; nhiều lần chạy độc lập làm tăng cơ hội khám phá các giả thuyết khác nhau.
Đó là lý do ba lần chạy DeepSeek tương đối rẻ có thể cạnh tranh hoặc vượt tổng độ bao phủ của một lượt chạy từ các mô hình frontier đắt tiền hơn. Đơn vị cần đánh giá không chỉ là một lần gọi mô hình, mà là toàn bộ cuộc điều tra: mô hình, công cụ, prompt, giới hạn lượt, bộ nhớ, cơ chế chạy lại và quy trình xác minh. 3
Nói cách khác, lợi thế của DeepSeek Pro không chỉ đến từ trọng số mô hình. Nó còn đến từ việc hệ thống cho phép mô hình thử nhiều đường tìm kiếm và sau đó hợp nhất kết quả.
Một hệ thống dựa trên các kết quả này nên tách riêng giai đoạn khám phá khỏi giai đoạn phán đoán:
Cách phân luồng mô hình này thực tế hơn việc coi mô hình open-weight và mô hình đóng là những sản phẩm có thể thay thế trực tiếp cho nhau.
Kết quả của Aikido hữu ích, nhưng không phải bảng xếp hạng phổ quát cho mọi mô hình AI bảo mật. Bài kiểm tra chỉ sử dụng 32 lỗ hổng thực tế mới được công bố, ba lần thử cho mỗi mô hình và một agent harness cụ thể. Hiệu năng có thể thay đổi tùy ngôn ngữ lập trình, cấu trúc kho mã, quyền truy cập công cụ, mô hình đe dọa, ngân sách điều tra và mức chấp nhận cảnh báo sai của từng tổ chức. 3
Kết luận thận trọng và có giá trị hơn là: trong bối cảnh này, các mô hình open-weight, đặc biệt là DeepSeek V4 Pro, có thể cạnh tranh hoặc vượt các mô hình frontier đóng khi được hỗ trợ bởi cơ chế chạy lặp và điều phối phù hợp.
Sản phẩm bảo mật chiến thắng không nhất thiết là mô hình có điểm headline cao nhất. Đó là hệ thống biết kết hợp tìm kiếm rộng, xác minh đáng tin cậy, kiểm soát cảnh báo sai và tạo ra bằng chứng đủ rõ để kỹ sư có thể hành động.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DeepSeek V4 Pro 0813 phát hiện 28/32 lỗ hổng khi gộp ba lần chạy, với chi phí khoảng 295 USD.
DeepSeek V4 Pro 0813 phát hiện 28/32 lỗ hổng khi gộp ba lần chạy, với chi phí khoảng 295 USD. Kết quả nghiêng về một hệ thống có điều phối: dùng tác nhân rẻ và thiên về khám phá để tìm ứng viên, mô hình ổn định hoặc chính xác để xác minh, sau đó đưa các phát hiện quan trọng qua khâu đánh giá của con người.