플로트보트는 동일한 DeepSeek V4 플래시 모델에 실행 하네스만 교체한 뒤 5개 에이전트 벤치마크에서 클로드 오퍼스 4.8을 앞섰다고 보고했다. 입력 대 출력 토큰 비율을 3대 1로 놓으면 보고된 혼합 API 비용은 딥시크가 100만 토큰당 0.175달러, 오퍼스가 10달러로 약 57.1배 차이다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did AOE Tech Labs’ Floatboat team’s August 7, 2026 single-variable Harness benchmark experiment show that DeepSeek-V4-Flash—the $0.14 mo. Article summary: Floatboat’s August 7 result is best understood as a vendor-reported ablation: it held the DeepSeek-V4-Flash model constant and replaced the execution harness. Its claim is not that model capability ceased to matter, but . Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
플로트보트가 2026년 8월 7일 공개한 결과를 ‘DeepSeek-V4-Flash가 본질적으로 Claude Opus 4.8보다 더 뛰어나다’는 증거로 읽기는 어렵다. 이번 실험은 모델을 고정한 채 실행 하네스만 바꾼 기업 자체 보고 방식의 비교 실험에 가깝다. 플로트보트는 이 변경만으로 같은 저비용 모델이 5개 공개 에이전트 벤치마크에서 클로드 오퍼스 4.8의 공개 비교 점수를 모두 넘어섰다고 밝혔다. 3
보다 중요한 결론은 따로 있다. 장시간 실행되는 에이전트 작업에서는 모델 자체만큼, 혹은 그 이상으로 모델을 둘러싼 실행 시스템이 성패에 영향을 줄 수 있다는 점이다. 다만 이 결론은 아직 유력한 가설에 가깝다. 실험이 독립적으로 재현되지 않았기 때문이다.
플로트보트에 따르면 실험에는 공식 DeepSeek-V4-Flash-0731 릴리스와 동일한 입력·파라미터가 사용됐다. 달라진 것은 딥시크의 공식 ‘미니멀’ 하네스와 플로트보트의 평가 하네스였다.
플로트보트의 하네스는 격리된 물리 샌드박스와 함께 작업 공간 및 파일 접근, 도구, 지속적인 상태 저장, 결과 확인과 오류 수정, 작업 재개가 가능한 실행 루프를 제공했다. 3
에이전트 작업은 한 번 그럴듯한 답을 생성하는 것으로 끝나지 않는다. 에이전트는 환경에 반복적으로 행동을 취하고, 결과를 관찰한 뒤 계획을 수정하며, 이미 완료한 작업을 망가뜨리지 않아야 한다. 이 과정 전체를 관리하는 기반이 바로 실행 하네스다.
플로트보트의 하네스에서 DeepSeek-V4-Flash가 기록했다는 점수는 다음과 같다.
플로트보트는 이 5개 점수가 모두 공개된 Claude Opus 4.8 비교 점수를 웃돌았다고 밝혔다. 3
다만 이 헤드라인에는 중요한 단서가 붙는다. 공개 벤치마크 비교에는 서로 다른 하네스, 프롬프트, 도구 구성, 샘플링 설정, 평가 절차에서 나온 점수가 함께 포함될 수 있다. 따라서 이번 실험에서 상대적으로 의미 있는 부분은 서로 다른 시스템을 단순히 한 순위표에 올린 것이 아니라, 같은 모델에 하네스만 바꿔 본 통제된 비교다.
그럼에도 결과의 출처가 기업 자체 보고라는 사실은 변하지 않는다.
보고된 DeepSeek-V4-Flash 가격은 입력 토큰 100만 개당 0.14달러, 출력 토큰 100만 개당 0.28달러다. 입력 대 출력 비율을 3대 1로 가정하면 혼합 단가는 다음과 같다.
(3 × $0.14 + $0.28) ÷ 4 = 토큰 100만 개당 $0.175
플로트보트가 제시한 Claude Opus 4.8 가격은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러다. 같은 비율을 적용하면 다음과 같다.
(3 × $5 + $25) ÷ 4 = 토큰 100만 개당 $10
따라서 혼합 API 토큰 가격만 비교하면 오퍼스가 약 57.1배 더 비싸다. 3
단, 이것이 실제로 완료된 작업의 비용이 57.1배라는 뜻은 아니다. 도구 사용료, 컴퓨팅 비용, 캐싱, 긴 컨텍스트 처리, 재시도, 엔지니어링 비용, 하네스 운영 비용은 계산에서 빠져 있다. 이는 모델 토큰 가격 비교이지 총소유비용 분석은 아니다.
플로트보트는 5개 벤치마크를 짧은 작업부터 긴 작업 순서로 배열했을 때 하네스 교체에 따른 상대적 성과 향상이 **1.9%, 9.6%, 12.6%, 19.9%, 23.6%**로 나타났다고 보고했다. 회사는 작업 단계가 늘어날수록 하네스의 영향이 커지는 비감소 추세라고 설명했다. 3
장기 과제에서는 개별 판단 하나하나가 합리적으로 보여도 전체 작업이 실패할 수 있다. 에이전트는 다음을 반복해서 수행해야 하기 때문이다.
실행 루프가 빈약하면 모델의 올바른 추론도 유실된 맥락, 잘못된 도구 호출, 성급한 종료, 복구할 수 없는 변경으로 이어질 수 있다. 더 강력한 모델은 개별 판단을 개선할 수 있지만, 상태를 보존하지 못하고 유용한 피드백을 제공하지 않으며 안전한 복구 수단도 없는 환경까지 대신 해결해 주지는 못한다.
그래서 이번 결과는 단순한 모델 순위 경쟁을 넘어선다. 질문을 ‘어떤 모델이 가장 똑똑한가’에서 ‘어떤 모델과 실행 환경의 조합이 작업을 끝까지 안정적으로 완수하는가’로 바꿔 놓기 때문이다.
플로트보트는 하네스 교체의 효과와 모델 업그레이드의 효과를 비교하기 위해 **하네스 레버리지 비율(Harness Leverage Ratio·HLR)**이라는 지표를 제시했다.
HLR = 하네스만 바꿨을 때의 성과 향상
─────────────────────────────
더 강한 기준 시스템으로 업그레이드했을 때의 성과 향상
HLR이 1보다 크다는 것은 해당 벤치마크와 비교 조건에서 하네스 교체로 얻은 점수 상승폭이 더 강한 기준 시스템으로 바꿨을 때의 측정된 상승폭보다 컸다는 뜻이다. 다만 HLR은 업계 표준이 아니며, 기준 모델, 비교 시스템, 벤치마크 버전과 평가 통제 조건에 따라 값이 달라진다. 2
4
DeepSWE에서 플로트보트는 DeepSeek의 하네스에 있던 플래시 점수가 54.4점에서 자사 하네스 사용 후 67.25점으로 올랐다고 보고했다. 상승폭은 12.85점이다. 반면 인용된 Opus 4.8 점수는 58.0점으로, 딥시크 기준 점수보다 3.6점 높았다. 이를 계산하면 HLR은 약 3.57이다. 3
또 플로트보트는 HLR이 가장 짧은 작업의 0.78에서 가장 긴 작업의 3.57까지 높아졌다고 밝혔다. 이 패턴이 재현된다면 작업에 필요한 상태, 도구 호출, 오류 복구가 많아질수록 실행 환경 개선의 가치가 불균형적으로 커진다는 해석을 뒷받침할 수 있다. 다만 기준 시스템이나 평가 방식을 바꾸면 비율도 달라질 수 있으므로 보편 법칙으로 볼 수는 없다.
이번 벤치마크는 플로트보트가 내세워 온 제품 방향과도 맞물린다. 공개 자료에서 플로트보트는 1인 사업자를 위한 에이전트 중심 업무 환경으로 소개되며, 파일·브라우징·AI 상호작용·일정 관리·커뮤니케이션·재사용 가능한 스킬과 워크플로를 한데 묶는 형태를 지향한다. 1 2026년 5월 출시 발표에서는 캘린더 기반의 선제적 에이전트 워크플로를 강조했으며, 세쿼이아와 웨이라이트 캐피털의 지원을 받고 있다고 밝혔다.
18
이런 제품 전략에서 실행 환경은 언어 모델을 감싸는 얇은 껍데기가 아니다. 에이전트가 여러 애플리케이션의 맥락을 유지하고, 적절한 시점에 행동하며, 권한을 준수하고, 사용자가 매번 작업 단계를 재구성하지 않아도 진척을 내도록 하는 핵심 계층이다.
이번 결과가 독립 검증을 통과한다면 일상용 에이전트의 경쟁력은 실행 기반으로 이동할 가능성이 있다. 안전한 상태 관리, 관찰 가능성, 결과 검증, 오류 복구, 권한 제어, 사용자 통제가 모델 자체만큼 중요한 제품 요소가 된다는 의미다.
이 경우 모델을 쓰는 방식도 유연해진다. 신뢰할 수 있는 실행 환경 안에서는 저비용 모델이 반복적이고 구조화된 업무를 맡고, 실제로 깊은 추론이나 판단이 필요한 작업에만 프리미엄 모델을 배정할 수 있다. 가장 좋은 제품은 가장 싼 모델이나 가장 강한 모델을 단독으로 쓰는 시스템이 아니라, 각 모델이 가장 잘하는 업무에 배치되는 모델·런타임 조합일 수 있다.
다만 핵심적인 단서는 여전히 남아 있다. 8월 7일 실험을 뒷받침하는 가장 강한 근거는 플로트보트의 기술 브리프이며, 회사 역시 광범위한 모델 간 비교에서는 하네스와 평가 설정이 서로 다르다고 인정한다. 프롬프트, 예산, 도구, 재시도, 샘플링, 데이터 버전을 엄격히 통제한 독립 재실험과 평가 자료 공개가 이뤄져야 ‘5개 벤치마크 승리’가 업계의 확립된 결과로 받아들여질 수 있다. 3
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
플로트보트는 동일한 DeepSeek V4 플래시 모델에 실행 하네스만 교체한 뒤 5개 에이전트 벤치마크에서 클로드 오퍼스 4.8을 앞섰다고 보고했다.
플로트보트는 동일한 DeepSeek V4 플래시 모델에 실행 하네스만 교체한 뒤 5개 에이전트 벤치마크에서 클로드 오퍼스 4.8을 앞섰다고 보고했다. 입력 대 출력 토큰 비율을 3대 1로 놓으면 보고된 혼합 API 비용은 딥시크가 100만 토큰당 0.175달러, 오퍼스가 10달러로 약 57.1배 차이다.
짧은 과제에서 긴 과제로 갈수록 하네스 교체에 따른 상대적 성과 향상이 1.9%에서 23.6%로 커졌다. 상태 유지, 도구 호출, 검증과 복구가 장기 과제의 성패를 좌우한다는 의미다.