진전은 매우 빨랐습니다. 2년 전, 선도적인 에이전트는 약 12%의 작업만 올바르게 완료했습니다. 1년 전 최고 모델의 점수는 42%에 불과했습니다 . 2026년 6월까지 여러 Anthropic 모델이 인간 기준선을 넘어섰습니다: Claude Mythos Preview 85.4%, Fable 5 85.0%, Opus 4.8 83.4%
. 대조적으로, OpenAI의 Operator는 동일한 벤치마크에서 38%에 그쳤습니다
.
a16z는 원시적인 UI 탐색이 모델 계층의 기본 상품이 됨에 따라 지속 가능한 경쟁 우위는 스택의 상위로 이동한다고 주장합니다 . 프론티어는 "에이전트가 컴퓨터를 사용할 수 있는가?"에서 "이 업무를 안정적으로 수행할 수 있는가?"로 옮겨가고 있습니다
. 진정한 해자는 이제 다음과 같습니다
:
이는 a16z의 더 광범위한 테제, 즉 AI 에이전트가 채팅 기반 인터페이스에서 사용자 행동을 관찰하고 조치를 취하는 능동적이고 자율적인 시스템으로 전환되고 있다는 점과 일치합니다 . 주소 가능 시장은 약 4,000억 달러의 소프트웨어 지출에서 약 13조 달러의 글로벌 노동 지출로 확장됩니다
.
a16z 분석은 컴퓨터 사용 워크플로가 기록 시스템 업데이트, 포털을 통한 데이터 이동, 티켓 처리와 같은 협소하고 반복적인 백오피스 작업에 대해 "대규모 프로덕션에서 견디기 시작하고 있다"고 지적합니다 . 현재 프로덕션 배포는 개방형 일반 컴퓨터 사용이 아닌 표준화된 협소 워크플로에 집중되어 있습니다
.
두 회사는 성장하는 생태계를 보여줍니다: