Ретельний пошук у наданих джерелах не виявив жодних публічно задокументованих досліджень Anthropic, які б використовували конкретні назви «Jacobian lens» або «J-space». Найближчим за назвою є «Jacobian Scopes», який описується як окремий набір градієнтних методів причинної атрибуції на рівні токенів для інтерпретації прогнозів LLM, опублікований іншими авторами A. Це не пов'язано з тим, про що запитували в оригінальному питанні. Відсутність доказів не доводить, що цих концепцій не існує деінде, але це означає, що наявні джерела не підтримують твердження про публікації Anthropic під цими назвами ADWWGCI.
Механістична інтерпретованість Anthropic — це фундаментальна спроба зворотного інжинірингу непрозорих нейронних мереж шляхом перетворення внутрішніх активацій і механізмів на більш зрозумілі для людини описи DA. Ключові структурні знахідки включають:
Наявні джерела підтверджують кілька функціональних тверджень щодо внутрішніх станів Claude:
Роботи Anthropic у наданих джерелах чітко не стверджують, що Claude реалізує Теорію глобального робочого простору (GWT) DWWGCI. Можна обережно провести деякі структурні паралелі: розрив між внутрішніми репрезентаціями та вербалізованими результатами, описаний NLA, віддалено нагадує розрив між прихованою обробкою та інформацією, доступною для звітування в GWT. Але джерела не встановлюють, що Anthropic офіційно заявляв про відповідність GWT DWWC.
Це найбільш безпосередньо релевантна частина наявних доказів:
Наявні джерела не встановлюють, що Anthropic заявляв про біологічну «конвергентну еволюцію» між Claude та людським пізнанням DWWGCI. Однак вони підтримують більш обережну версію цієї ідеї:
Джерела підтримують обережні твердження про структуровані внутрішні стани ШІ та конвергенцію методів, але не підтримують сильних тверджень про свідомість, людські емоції або біологічну конвергенцію DWWGCIA.