AI가 계산을 해냈다는 사실만으로 그 결과를 믿어도 될까. 하버드대 물리학자 매슈 슈워츠가 클로드와 함께 만든 오픈소스 도구 BootLoops 1.0은 이 질문에 ‘결과를 확인할 수 있는 절차부터 마련하자’고 답한다. 특정 모델에 종속되지 않는 이 도구는 과학 소프트웨어와 작업 규약을 결합해, 언어 모델이 내놓은 계산 결과를 시험할 수 있게 설계됐다.
11
2
답을 내는 것보다, 답을 시험하는 것
BootLoops의 핵심은 계산 결과를 그럴듯하게 제시하는 데 그치지 않고, 결과가 정해진 검증 절차를 통과하는지 확인하는 데 있다. 예를 들어 결과를 구하는 데 사용하지 않은 지점에서 별도의 계산 경로와 대조하고, 잘못된 결과가 나왔을 때 검사 절차가 이를 잡아낼 수 있는지 양성 대조군으로 확인한다. 결과를 만드는 데 쓰인 계산 도구가 자기 결과를 그대로 인증하지 않도록 출처와 기여 과정을 기록하는 원칙도 포함한다.
2
11
이런 방식은 수학물리학처럼 문제와 답의 조건을 구체적으로 정할 수 있는 계산에서 특히 유용하다. 정해둔 검사를 통과했다는 근거를 제공하지만, AI가 생성한 모든 주장이나 연구의 결론이 자동으로 옳다는 뜻은 아니다.
2
5
보고된 성과와 아직 남은 검증
슈워츠 팀은 수학물리학 적분 30개를 계산했다고 밝혔다. 이 가운데 15개는 새 결과로 소개됐으며, 타원형 파인만 적분도 포함됐다. 팀은 수학자 조지 왓슨의 연구와 관련된 계산 중 슈워츠가 ‘왓슨의 마지막 문제’라고 부르는 문제도 풀었다고 보고했다.
14
16
4
더 넓은 연구에서는 3개월 동안 19명의 공동저자와 함께 18개 분야에서 원고 36편을 작성했다고 보고됐다. 생태학과 집단유전학도 포함된 분야다. 다만 이는 보고된 연구 성과이지, 모든 결과가 독립적인 검증을 마쳤다는 의미는 아니다. 슈워츠는 일부 결과가 여전히 확인 중이라고 말했다.
3
15
4
AI가 계산해도 전문가가 필요한 이유
슈워츠는 과학자가 필요로 하는 것과 현재 언어 모델이 잘하는 일 사이의 간극을 ‘임피던스 불일치’라고 표현한다. 모델은 문제와 검증 기준이 명확한 계산 작업에서는 도움을 줄 수 있지만, 어떤 질문이 중요한지 정하고 답이 실제로 무엇을 의미하는지 해석하는 일은 별개의 과제다.
1
5
슈워츠의 설명에 따르면 클로드는 여러 분야를 넘나드는 수학적 연결을 찾아냈지만, 그중 일부는 기술적으로 맞더라도 해당 분야에서 중요한 성과는 아니었다. 분야 전문가가 연구 방향을 잡고 의미 있는 질문을 고르는 데 힘을 보탰다. 계산 검증은 결과가 정해진 검사를 통과했는지를 확인하고, 과학적 판단은 무엇을 계산할지와 그 결과를 어떻게 이해할지를 가늠한다.
5
도구의 가능성과 한계
BootLoops는 AI를 검증 가능한 계산 과제에 활용하고, 독립적인 확인 절차와 전문가의 역할을 작업 과정에 포함하는 방법을 보여준다. 그러나 보고된 성과를 모든 결과가 틀림없다는 보증이나 추가 검증의 대체물로 받아들여서는 안 된다. 특히 중요한 결정을 내릴 때는 계산 결과뿐 아니라 질문의 설정과 전제, 결과가 낳을 영향도 사람이 함께 살펴야 한다.
2
4
5