다만 이를 클로드의 보편적인 성공률로 해석해서는 안 됩니다. 표적별 결과는 0%에서 90%까지 크게 달랐습니다. Mythos가 한 번에 하나의 표적에 24시간 집중한 실험에서 35.1%로 가장 높은 적중률을 보였고, 여러 표적을 동시에 다룬 캠페인에서는 더 낮은 결과가 나왔습니다.
이번 실험은 언어 모델이 단백질 과학의 모든 방법론을 새로 발명했다는 이야기가 아닙니다. 먼저 인간 단백질 설계 전문가가 약 3만 토큰 분량의 프롬프트로 작업 절차를 설명했습니다. 그 뒤 클로드는 추가적인 인간 개입을 최소화한 채 해당 절차를 수행했습니다.
클로드가 맡은 작업은 다음과 같습니다.
따라서 이번 성과의 핵심은 각각의 계산 방법을 발명했다는 데 있지 않습니다. 긴 작업 흐름을 도구와 함께 관리하고, 후보를 만들고 버리고 다듬는 개별 의사결정을 연속적으로 수행했다는 데 있습니다.
실험 대상에는 이미 널리 연구된 벤치마크 표적과 새로운 경연 표적이 함께 포함됐습니다. 순전히 컴퓨터 안에서만 진행한 평가보다 현실적인 결과를 제공하지만, 과거 벤치마크에 대한 친숙함이 성과에 영향을 줬을 가능성까지 없애는 것은 아닙니다.
컴퓨터 모델은 어떤 단백질이 표적에 결합할 것이라고 예측할 수 있습니다. 하지만 실제 단백질이 잘 발현되고, 올바르게 접히며, 실험 조건에서 결합한다는 보장은 없습니다. 그래서 앤트로픽은 설계안을 외부 검증 기관에 보냈습니다.
Adaptyv Bio는 어떤 모델이 설계했는지 모르는 상태에서 후보를 전달받았습니다. 이후 디지털 단백질 서열을 DNA로 합성하고, 단백질을 발현한 뒤 결합 측정과 품질 관리를 진행했습니다. 표면 플라스몬 공명법(SPR)으로 결합을 측정한 결과 1,320개 설계 중 354개가 표적에 결합했습니다.
Twist Bioscience도 별도로 설계 단백질을 제작하고 시험했습니다. 앤트로픽에 따르면 최소 6개 표적에서 높은 결합력을 가진 후보가 나왔고, 최소 4개 표적에서는 기존에 보고된 최고 수준과 같거나 더 나은 결합력을 보인 후보가 확인됐습니다.
이는 예측 구조나 모델이 작성한 설명만 평가한 것보다 강한 증거입니다. 하지만 검증이 답한 질문은 여전히 제한적입니다.
설계된 단백질이 주어진 실험 조건에서 선택한 표적에 결합하는가?
이 결과만으로 해당 단백질이 치료제로 유용하다고 결론 내릴 수는 없습니다.
앤트로픽이 제시한 비교 중 하나는 RBX1 표적입니다. 회사는 클로드 설계안의 적중률이 약 **40%**였으며, 과거 단백질 설계 경연 참가자들의 3.7%보다 높았다고 밝혔습니다. 또한 이 표적에서 기존 우승 설계안보다 나은 결과를 냈다고 설명했습니다.
일부 후보의 결합력도 두드러졌습니다. 앤트로픽은 몇몇 설계가 기존에 발표된 최고 결과보다 몇 배 더 강하게 결합했다고 보고했습니다. 고무적인 결과이지만, 단일 캠페인에서 회사가 발표한 결과인 만큼 단백질 설계 전반에서 우월성이 입증됐다고 보기는 어렵습니다.
결합 단백질은 특정 생물학적 표적에 달라붙도록 설계된 분자입니다. 치료제뿐 아니라 진단이나 연구용 시약으로도 활용될 수 있지만, 결합은 신약 개발의 초기 이정표에 불과합니다.
실제 의약품 후보가 되려면 다음과 같은 특성도 갖춰야 합니다.
앤트로픽 역시 이번 작업을 신약과 유사한 분자를 향한 초기 단계로 설명하고 있습니다. 임상 효능이나 사람을 대상으로 한 안전성, 실제 신약 개발 단계의 성공적인 진행을 입증한 실험은 아닙니다.
표적 선정은 중요한 한계입니다. 단백질 결합체는 일반적으로 세포 안에서 작동하는 단백질보다 접근하기 쉬운 세포 외 표적을 대상으로 설계하기가 수월합니다.
이 비판이 다수의 설계 단백질이 실제로 표적에 결합했다는 실험 결과를 무효로 만들지는 않습니다. 다만 결론의 범위를 좁혀 줍니다. 이번 실험이 보여준 것은 클로드가 정해진 작업 흐름 아래에서 상당수의 실험 검증 결합체를 만들 수 있다는 점입니다. 임상적으로 중요한 어려운 표적, 특히 세포 내부 표적을 대상으로 신뢰성 있는 치료제를 만들거나 기존 신약 개발법을 전반적으로 앞선다는 점까지 입증한 것은 아닙니다.
또한 핵심 성과의 상당 부분은 앤트로픽이 직접 보고했습니다. 실제 단백질 합성과 분석은 외부 기관이 수행해 신뢰도를 높였지만, 더 다양한 표적을 대상으로 한 독립적인 반복 검증이 이 결과의 일반성을 판단하는 데 필요합니다.
앤트로픽은 단백질 결합체 설계를 더 큰 구상의 한 요소로 제시합니다. 화학·생물학 데이터를 분석하고 여러 연구 작업을 연결하는 전방위적 신약 개발 시스템을 만들어 신약 연구를 가속하겠다는 구상입니다.
회사의 Claude Science는 연구 워크플로, 계산 도구, 과학 데이터 분석을 결합합니다. 이번 단백질 설계 캠페인은 이러한 기능을 실제 실험 과정과 연결했을 때 AI 에이전트가 어떤 역할을 할 수 있는지 보여주는 사례입니다.
앤트로픽은 가장 강력한 생명과학 관련 기능을 현재 제한적으로 제공하고 있다고 밝혔습니다. 과학자 대상 접근 프로그램을 우선 과제로 꼽았으며, 현재 생명과학 연구에 일반적으로 이용 가능한 모델 가운데서는 Opus 5가 가장 강력하다고 설명했습니다.
실용적인 가능성은 AI가 실험실을 없애는 데 있지 않습니다. 표적 조사, 소프트웨어 실행, 후보 분류, 실험에 보낼 소수의 설계안 선정에 걸리는 시간을 줄여 연구자가 실험 자체에 더 집중하게 만드는 데 있습니다.
이런 작업 흐름에는 이중용도 위험이 있습니다. 생물학적 시스템을 조사하고 단백질을 설계하며 전문 도구를 연결하는 능력은 유익한 연구를 지원할 수 있지만, 동시에 해로운 생물학적 작업에 필요한 전문 지식과 시간을 낮출 수도 있습니다.
앤트로픽은 고도화된 모델에서 단백질 설계와 기타 이중용도 생물학 연구 기능을 일반 이용자에게 제공하지 않고, 자격을 갖춘 과학자를 대상으로 통제되거나 신뢰 기반의 접근을 제공하는 방안을 추진하고 있습니다. 회사가 밝힌 과제는 정당한 치료제 연구는 지원하되 병원체 설계, 독소 관련 작업 또는 기타 위험한 생물학적 활동에 기여할 수 있는 지원은 제한하는 것입니다.
이 정책은 기술적 성과와 별개의 문제가 아닙니다. 모델이 생물학적 질문에서 후보 분자 설계까지 더 자율적으로 이동할수록, 설계가 실제로 작동하는지만큼이나 누가 이 작업 흐름에 접근할 수 있는지, 어떤 안전장치가 있는지, 사용을 어떻게 감시할 것인지가 중요해집니다.
이번 시연은 Claude Mythos Preview와 Claude Opus 4.8이 기존 단백질 설계 도구를 자율적으로 조율하고, 22.6~35.1%의 적중률로 실험 검증 결합체를 만들 수 있다는 점을 보여줬습니다. 1,320개 설계 중 354개가 표적에 결합했고, 평가 대상 15개 중 14개에서 최소 하나의 결합체가 나왔습니다.
이는 AI가 초기 단백질 설계 연구를 지원하는 방식에 관한 중요한 증거입니다. 그러나 자율적인 신약 발견 시스템, 세포 내부 표적 문제의 해결책, 또는 최적화·독성시험·임상시험·규제 심사를 대체하는 기술을 보여준 것은 아닙니다.
앞으로의 핵심 검증 과제는 더 어렵고 덜 익숙한 표적에서도 이 결과가 반복되는지, 그리고 위험한 생물학적 지원을 광범위하게 제공하지 않으면서도 정당한 연구에 이 능력을 유용하게 개방할 수 있는지입니다.