עם זאת, סיקור יכולת הפרשנות (interpretability) הקשור לאנתרופיק במקורות המסופקים אכן מתאר עבודה שקרובה למושגים שעליהם שאלתם: ייצוגים פנימיים, חשיבה נסתרת, כלים לתרגום פעילויות לטקסט, והקבלות אפשריות בין תיאורים התנהגותיים לנוירליים של מצבים פנימיים ב-AI RDBMAN. להלן מה שהמקורות הזמינים תומכים בו, מאורגן לפי הממדים שביקשתם.
עבודת הפרשנות המכניסטית (mechanistic interpretability) של אנתרופיק מתוארת כמאמץ להנדסה הפוכה של רשתות עצביות אטומות, על ידי הפיכת מנגנונים ופעילויות פנימיים לתיאורים מובנים יותר לבני אדם R. ממצאים מבניים מרכזיים וטענות סמוכות הנתמכות על ידי המקורות הזמינים:
המקורות הזמינים תומכים במספר טענות פונקציונליות לגבי חקירת מצבים פנימיים:
עבודתה של אנתרופיק במקורות המסופקים אינה קובעת במפורש שקלוד מיישם את תיאוריית מרחב העבודה הגלובלי RDBMAN. עם זאת, ניתן לצייר בזהירות כמה הקבלות מבניות רופפות:
הערכת ראיות: המקורות המסופקים תומכים באנלוגיה לעיבוד דמוי-מרחב עבודה פנימי, אך אינם תומכים בקביעה שאנתרופיק טענה שקלוד מיישם את תיאוריית מרחב העבודה הגלובלי RDBMAN.
זהו החלק הרלוונטי ביותר מבחינת בטיחות מבין הראיות הזמינות:
המקורות הזמינים אינם קובעים שאנתרופיק טענה ל'אבולוציה מתכנסת' ביולוגית בין קלוד לקוגניציה אנושית RDBMAN. עם זאת, הם תומכים בגרסה זהירה יותר של הרעיון:
ניואנס מפתח: המקורות תומכים בטענות זהירות על מצבים פנימיים מובנים של AI ועל התכנסות בין-שיטתית, אך אינם תומכים בטענות חזקות על תודעה, רגשות דמויי-אדם או אבולוציה מתכנסת ביולוגית RDBMAN.
| ממד | מה הראיות מראות בפועל |
|---|---|
| 'Jacobian lens' ו-'J-space' | אין ראיה ברורה במקורות המסופקים שאלו מונחים של אנתרופיק; הפריט הקרוב ביותר הוא 'Jacobian Scopes', שיטת ייחוס מבוססת-גרדיאנט נפרדת A. |
| מבנה מרחב עבודה פנימי | המקורות תומכים בתמונה זהירה של מצבים עצביים פנימיים, ניתוח מקודד אוטומטי דליל וכלי תרגום מפעילות לטקסט, אך לא בפרטים החזקים והבלתי-מגובים על ספירות תכונות מדויקות או מרחבים פנימיים בעלי שם RDBMAN. |
| מאפיינים פונקציונליים | הטענות הנתמכות החזקות ביותר נוגעות לאמונות פנימיות נסתרות, תרגום מפעילות לטקסט, ופער בין ייצוגים פנימיים לחשיבה מילולית DBMN. |
| תיאוריית מרחב העבודה הגלובלי | ישנן אנלוגיות מעוררות מחשבה, אך המקורות המסופקים אינם מראים שאנתרופיק טוענת במפורש ליישור ל-GWT RDBMAN. |
| השלכות בטיחות | NLA רלוונטיים מכיוון שהם מתוארים כחושפים ייצוגים פנימיים שאולי לא יופיעו בתפוקות או בשרשרת-חשיבה DBMN. |
| אבולוציה מתכנסת | המקורות תומכים בטענות התכנסות בין-שיטתיות זהירות לגבי מצבים פנימיים של AI, אך לא בטענות חזקות על אבולוציה מתכנסת ביולוגית או תודעה A. |