De acordo com o relatório da OpenAI, os resultados abrangeram oito áreas e incluíram provas, contraexemplos e limites melhorados :
A OpenAI não se baseou apenas na saída do modelo. Cada resultado foi acompanhado por um certificado de prova formal no Lean 4 — um arquivo de prova verificável por computador que qualquer leitor pode verificar de forma independente em um laptop . O Lean é um assistente de provas que verifica cada passo lógico, dos axiomas à conclusão, detectando lacunas, erros de tipo e inconsistências . A OpenAI publicou todos os arquivos Lean publicamente no GitHub, e a contagem de "sorry" — indicando passos não comprovados — é zero para todas as dez provas .
No entanto, vários comentaristas observaram que a verificação formal tem limites importantes: o Lean pode confirmar que uma declaração formal segue de suas definições formais, mas não pode certificar que um resumo de comunicado de imprensa reflete com precisão o teorema formal, que as definições formais correspondem ao problema pretendido pela comunidade matemática, ou que a novidade e o enquadramento histórico do resultado estão corretos . Especialistas ainda precisam auditar a fidelidade das declarações, as definições, as reduções e a ponte entre o informal e o formal .
A OpenAI divulgou que o custo total de computação para gerar todas as dez soluções foi de aproximadamente US$ 2.000 em custos de token, com base na taxa da API Sol . Esse valor é um preço equivalente ao da API apenas para os tokens de busca de soluções — exclui tentativas fracassadas, execuções de exploração paralela e o poder computacional interno gasto na busca antes de chegar a um certificado . Em comparação, o estipêndio anual de um único estudante de doutorado em matemática em uma universidade de ponta pode exceder US$ 50.000, tornando a eficiência de custo o aspecto mais marcante do anúncio para muitos observadores .
A comunidade matemática e pesquisadores de IA levantaram vários pontos de cautela: