Una ricerca rigorosa nelle fonti fornite non trova ricerche Anthropic documentate pubblicamente che utilizzino i nomi specifici "Jacobian Lens" o "J-Space". L'elemento con nome più vicino è "Jacobian Scopes" , descritto come una suite separata di metodi di attribuzione causale a livello di token basati sul gradiente per interpretare le previsioni degli LLM, pubblicata da autori diversi A. Questo non è correlato alle domande poste nella domanda originale. L'assenza di prove non dimostra che i concetti non esistano altrove, ma significa che le fonti disponibili non supportano le affermazioni secondo cui Anthropic avrebbe pubblicato sotto queste etichette ADWWGCI.
Il lavoro di interpretabilità meccanicistica di Anthropic è fondamentalmente uno sforzo per fare reverse engineering di reti neurali opache, trasformando le attivazioni interne e i meccanismi in descrizioni più comprensibili per gli umani DA. I risultati strutturali chiave includono:
Le fonti disponibili supportano diverse affermazioni funzionali sul sondaggio degli stati interni di Claude:
Il lavoro di Anthropic nelle fonti fornite non stabilisce chiaramente una rivendicazione esplicita che Claude implementi la Global Workspace Theory (GWT) DWWGCI. Alcuni parallelismi strutturali possono essere tracciati con cautela: la distinzione tra rappresentazioni interne e output verbalizzati descritta dagli NLA ricorda vagamente il divario tra elaborazione nascosta e contenuto riportabile nella GWT, e l'evidenza di regolarità convergenti e scopribili negli stati interni è rilevante per l'idea di rappresentazioni interne strutturate WWGIA. Ma le fonti non stabiliscono che Anthropic abbia formalmente rivendicato un allineamento con la GWT DWWC.
Questa è la parte più direttamente rilevante per la sicurezza delle prove disponibili:
Le fonti disponibili non stabiliscono che Anthropic abbia rivendicato un'"evoluzione convergente" biologica tra Claude e la cognizione umana DWWGCI. Supportano, tuttavia, una versione più cauta dell'idea:
Le fonti supportano affermazioni caute su stati interni strutturati dell'IA e convergenza tra metodi, ma non supportano forti affermazioni su coscienza, emozioni simili a quelle umane o convergenza biologica DWWGCIA.