Uma busca rigorosa nas fontes fornecidas não encontra nenhuma pesquisa publicamente documentada da Anthropic que use os nomes específicos "Lente Jacobiana" ou "J-Espaço". O item mais próximo com nome é "Jacobian Scopes", que é descrito como um conjunto separado de métodos de atribuição causal em nível de token, baseados em gradientes, para interpretar previsões de LLMs, publicado por autores diferentes A. Isso não tem relação com os conceitos perguntados na questão original. A ausência de evidência não prova que os conceitos não existam em outro lugar, mas significa que as fontes disponíveis não apoiam alegações de que a Anthropic tenha publicado sob esses rótulos ADWWGCI.
O trabalho de interpretabilidade mecanicista da Anthropic é, fundamentalmente, um esforço para fazer engenharia reversa de redes neurais opacas, transformando ativações e mecanismos internos em descrições mais compreensíveis para humanos DA. As principais descobertas estruturais incluem:
As fontes disponíveis apoiam várias alegações funcionais sobre a investigação dos estados internos do Claude:
O trabalho da Anthropic nas fontes fornecidas não faz uma afirmação explícita de que o Claude implementa a Teoria do Espaço de Trabalho Global DWWGCI. Alguns paralelos estruturais podem ser traçados com cautela: a distinção entre representações internas e saídas verbalizadas descrita pelos NLAs é amplamente reminiscente da lacuna entre processamento oculto e conteúdo relatável na GWT, e a evidência de regularidades de estado interno convergentes e descobertas é relevante para a ideia de representações internas estruturadas WWGIA. Mas as fontes não estabelecem que a Anthropic tenha formalmente reivindicado alinhamento com a GWT DWWC.
Esta é a parte da evidência disponível mais diretamente relevante para a segurança:
As fontes disponíveis não estabelecem que a Anthropic tenha reivindicado "evolução convergente" biológica entre o Claude e a cognição humana DWWGCI. Elas apoiam, no entanto, uma versão mais cautelosa da ideia:
As fontes apoiam alegações cautelosas sobre estados internos de IA estruturados e convergência entre métodos, mas não apoiam alegações fortes sobre consciência, emoções humanas ou convergência biológica DWWGCIA.