Các đánh giá độc lập từ AI Business Weekly báo cáo 94% độ chính xác thực tế tổng thể, với độ chính xác thay đổi theo loại truy vấn :
Trong kiểm thử benchmark chuyên nghiệp tập trung vào các truy vấn liên quan đến công việc (bao gồm phân tích chính sách, khắc phục sự cố kỹ thuật, nghiên cứu doanh nghiệp và hơn thế nữa), Perplexity đạt 92% độ chính xác thực tế, vượt qua ChatGPT với 87% trong cùng bài kiểm tra .
Benchmark DRACO của riêng Perplexity (tháng 6 năm 2026) cho thấy mô hình Deep Research của họ đạt kết quả tiên tiến nhất trên các benchmark bên ngoài bao gồm DeepSearchQA của Google DeepMind và ResearchRubrics của Scale AI .
Điểm benchmark kể một câu chuyện. Độ chính xác tin tức thực tế kể một câu chuyện khác. Một cuộc kiểm toán của NewsGuard vào tháng 9 năm 2025 cho thấy các chatbot AI nhìn chung lặp lại các tuyên bố tin giả 35% thời gian trong tháng 8 năm 2025 — tăng từ 18% của năm trước . Perplexity bị chỉ trích là có sự suy giảm tồi tệ nhất trong số các chatbot hàng đầu được kiểm tra. Trong bài kiểm tra năm 2024, Perplexity đạt tỷ lệ thành công hoàn hảo; đến năm 2025, nó thất bại trong gần một nửa số lần thử .
TruthSignal, một trang theo dõi độ tin cậy độc lập, đánh giá độ tin cậy trung bình của @AskPerplexity là 65%, gọi nó là "một công cụ đáng tin cậy cho các truy vấn tổng quát và nghiên cứu khám phá" nhưng lưu ý rằng độ tin cậy của nó "cho việc kiểm tra thực tế hoặc các chủ đề nhạy cảm vẫn đang gây tranh cãi" .
Khoảng cách giữa điểm benchmark và hiệu suất thực tế này rất quan trọng. Benchmark kiểm tra các sự kiện tĩnh, có nguồn gốc tốt. Tin tức nóng liên quan đến các câu chuyện đang thay đổi nhanh chóng, các nguồn tin mâu thuẫn và thông tin có thể chưa được xác thực trên web mở — chính xác là những điều kiện mà công cụ tìm kiếm AI gặp khó khăn.
Đề xuất giá trị chính của Perplexity là trích dẫn. Mỗi câu trả lời đều liên kết với các nguồn được đánh số — nhưng bản thân các trích dẫn đó đáng tin cậy đến đâu?
Trong một bài kiểm tra thực tế được thực hiện từ tháng 2 đến tháng 3 năm 2026, một người đánh giá đã kiểm tra ngẫu nhiên 200 trích dẫn trong số 847 truy vấn Pro Search và thấy 78% được xác nhận là chính xác . Điều đó có nghĩa là cứ khoảng 5 trích dẫn thì có 1 trích dẫn dẫn đến một nguồn thực sự không hỗ trợ tuyên bố được đưa ra.
Những người đánh giá khác lưu ý chất lượng trích dẫn rất khác nhau. Các bài đăng blog và các nguồn kém uy tín hơn đôi khi xuất hiện cùng với các bài báo học thuật hoặc tài liệu chính thức . Một số trích dẫn thực sự bị "ảo giác" — liên kết đến các trang không tồn tại hoặc không liên quan .
Đối với nghiên cứu học thuật cụ thể, một nghiên cứu của Tow Center cho thấy mặc dù Perplexity có tỷ lệ trích dẫn không chính xác thấp nhất trong số các công cụ tìm kiếm AI được kiểm tra, nó vẫn trả lời sai trong khoảng 37% trường hợp — nghĩa là hơn một phần ba đầu ra chứa lỗi hoặc tuyên bố sai nguồn .
Các bài đánh giá độc lập nhất quán đồng ý về điểm mạnh và điểm yếu của Perplexity :
Mạnh nhất ở:
Yếu nhất ở:
Mặc dù các con số như "95%" thường xuyên được lặp lại trên mạng, Perplexity chưa công bố một đánh giá phổ quát, được kiểm toán độc lập bao gồm tất cả các loại câu trả lời . Hiệu suất đo lường được của nó thay đổi tùy thuộc vào benchmark, chế độ sản phẩm, mô hình ngôn ngữ, nguồn thông tin, loại câu hỏi và cách định nghĩa độ chính xác .
Bản tóm tắt hữu ích nhất đến từ việc kết hợp tất cả dữ liệu: Đối với nghiên cứu thực tế tổng quát với các nguồn có thể xác minh — đặc biệt là các sự kiện hiện tại, khoa học, công nghệ và các chủ đề có cấu trúc — Perplexity là một trong những công cụ AI đáng tin cậy nhất hiện có. Mô hình trích dẫn của nó thay đổi cơ bản cách bạn xác minh thông tin và điểm benchmark của nó thực sự mạnh mẽ. Nhưng đối với tin tức, tuyên bố nhạy cảm và công việc học thuật, hãy coi đầu ra của nó là điểm khởi đầu, không phải câu trả lời cuối cùng. Xác minh các dữ kiện quan trọng theo cách thủ công, đặc biệt khi thông tin đang thay đổi nhanh chóng hoặc khi hậu quả nghiêm trọng.