הערכות עצמאיות של AI Business Weekly מדווחות על 94% דיוק עובדתי כולל, עם הבדלים בין סוגי שאילתות :
במבחנים מקצועיים שהתמקדו בשאלות הקשורות לעבודה — ובהן ניתוח מדיניות, פתרון תקלות טכניות ומחקר על חברות — Perplexity הגיע ל־92% דיוק עובדתי, לעומת 87% ל־ChatGPT באותם מבחנים .
גם לפי מבחן DRACO של Perplexity, שפורסם ביוני 2026, מודל Deep Research של החברה הגיע לתוצאות מובילות במבחנים חיצוניים, בהם DeepSearchQA של Google DeepMind ו־ResearchRubrics של Scale AI .
ציונים במבחנים מספרים סיפור אחד; הדיוק בעולם החדשות מספר סיפור אחר.
בביקורת שפרסמה NewsGuard בספטמבר 2025 נמצא כי צ'אטבוטים מבוססי בינה מלאכותית חזרו על טענות חדשות כוזבות ב־35% מהמקרים באוגוסט 2025 — עלייה מ־18% בשנה הקודמת . Perplexity סומן ככלי שהציג את הירידה החדה ביותר מבין הצ'אטבוטים המובילים שנבדקו. במבחן ההפרכות של NewsGuard ב־2024 הוא רשם הצלחה מלאה, אך ב־2025 לא הצליח לספק תשובה נכונה בכמעט מחצית מהניסיונות .
TruthSignal, גוף עצמאי העוקב אחר אמינות מקורות, מעניק ל־@AskPerplexity ציון אמינות ממוצע של 65%. לפי הגוף, מדובר בכלי אמין לשאלות כלליות ולמחקר ראשוני, אך האמינות שלו בבדיקת עובדות או בנושאים רגישים שנויה במחלוקת .
הפער בין ציוני המבחנים לבין הביצועים בחדשות חשוב. מבחנים סטנדרטיים בודקים בדרך כלל עובדות יציבות ומקורות מסודרים. חדשות מתפרצות, לעומת זאת, מתפתחות במהירות, כוללות גרסאות סותרות ולעיתים עוסקות במידע שעדיין לא קיבל אישור ממקור מוסמך ברשת. אלה בדיוק התנאים שבהם כלי חיפוש מבוססי בינה מלאכותית עלולים להתקשות.
היתרון המרכזי ש־Perplexity מציע הוא השקיפות: כמעט כל תשובה כוללת קישורים ממוספרים למקורות. אבל גם כאן נשאלת השאלה — האם הציטוטים עצמם באמת תומכים בטענות?
בבדיקה מעשית שנערכה בין פברואר למרץ 2026, בודק אחד בחן מדגמית 200 ציטוטים מתוך 847 שאילתות Pro Search. רק 78% מהציטוטים אומתו כמדויקים . במילים אחרות, בערך אחד מכל חמישה ציטוטים שנבדקו הוביל למקור שלא תמך בפועל בטענה שהוצגה.
בודקים אחרים מציינים שאיכות המקורות משתנה מאוד. לצד מאמרים אקדמיים ומסמכים רשמיים, עלולים להופיע גם פוסטים בבלוגים או מקורות בעלי סמכות נמוכה יותר . במקרים מסוימים דווח גם על ציטוטים שהומצאו — קישורים לעמודים שאינם קיימים או שאינם קשורים לטענה .
במחקר אקדמי המצב מורכב במיוחד. מחקר של Tow Center מצא כי ל־Perplexity היה השיעור הנמוך ביותר של ציטוטים שגויים מבין מנועי החיפוש מבוססי הבינה המלאכותית שנבדקו, אך הוא עדיין סיפק תשובה שגויה בכ־37% מהמקרים. כלומר, ביותר מאחת מכל שלוש תשובות היו טעויות או ייחוס שגוי של טענות .
סקירות עצמאיות חוזרות על דפוס דומה בכל הנוגע לחוזקות ולחולשות של Perplexity .
מתאים במיוחד ל:
פחות מתאים ל:
למרות המספרים כמו "95%" שחוזרים לעיתים קרובות ברשת, Perplexity לא פרסמה הערכה אוניברסלית ומבוקרת באופן עצמאי שמכסה את כל סוגי התשובות . הביצועים הנמדדים משתנים בהתאם למבחן, למצב המוצר, למודל השפה שנבחר, למקורות המידע, לסוג השאלה ולהגדרה של המונח "דיוק" .
הסיכום המעשי של הנתונים הוא זה: למחקר עובדתי כללי עם מקורות שניתן לאמת — במיוחד בנושאי אקטואליה, מדע, טכנולוגיה ונושאים מובנים — Perplexity הוא אחד מכלי הבינה המלאכותית האמינים יותר. מודל הציטוטים שלו מקל משמעותית על בדיקת המידע, וציוני המבחנים שלו אכן חזקים.
עם זאת, בחדשות מתפרצות, בטענות רגישות ובעבודה אקדמית, מומלץ להשתמש בו כעוזר מחקר ולא כמקור הסופי. יש לבדוק בעצמכם עובדות חשובות, לפתוח את המקורות המצוטטים ולוודא שהם באמת תומכים בטענה — במיוחד כשהמידע משתנה במהירות או כשהטעות עלולה להיות משמעותית.