לאחר מכן, הוערכו התשובות באופן סמוי על ידי שישה מומחים למחלות חניכיים מישראל, מאיטליה, מספרד, מסלובניה, מקרואטיה ומפורטוגל, שלא ידעו איזו מערכת עומדת מאחורי כל תשובה. המומחים בחנו ארבעה מדדים מרכזיים: דיוק האבחנה, בטיחות ההמלצות, הימנעות ממידע רפואי שגוי או מומצא (Hallucinations), ושלמות תכנית הטיפול.
מניתוח ממצאי המחקר עלה כי ישנם פערים משמעותיים בין המערכות. הפלטפורמות המשלבות את יכולות הבינה המלאכותית עם שליפה של מידע רפואי עדכני ממקורות אמינים דורגו ראשונות בכל המדדים, כאשר בראש הרשימה ניצב OpenEvidence ו- Perplexity , ואחריהן Claude 4.7 Opus.
ומה לגבי התרחישים הקליניים? המחקר חילק את 30 המקרים לשלוש קבוצות: מקרי חירום חריפים בחניכיים, אבחון ותכנון טיפול במחלות חניכיים כרוניות ומצבים מורכבים הדורשים קבלת החלטות קליניות. גם בחלוקה זו Perplexity דורגה ראשונה בכל שלוש הקטגוריות. ממצא מרכזי נוסף הוא שהחוקרים מצאו הבדלים גדולים יותר בין המערכות דווקא במקרי חירום ובתרחישים מורכבים, שבהם נדרש שיקול דעת קליני רחב, מאשר במקרים של סיווג מחלות חניכיים כרוניות.