Floatboatは、モデルをDeepSeek V4 Flashのまま固定し、実行ハーネスだけを変更した結果、5つの公開エージェント評価でClaude Opus 4.8を上回ったと報告。ただし、独立検証はまだ行われていません。 入力と出力の比率を3対1とすると、報告されたAPIトークン単価はDeepSeekが100万トークンあたり0.175ドル、Opusが10ドルで、Opusは約57.1倍高価です。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did AOE Tech Labs’ Floatboat team’s August 7, 2026 single-variable Harness benchmark experiment show that DeepSeek-V4-Flash—the $0.14 mo. Article summary: Floatboat’s August 7 result is best understood as a vendor-reported ablation: it held the DeepSeek-V4-Flash model constant and replaced the execution harness. Its claim is not that model capability ceased to matter, but . Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Floatboatが2026年8月7日に公表した結果は、「DeepSeek-V4-Flashが本質的にClaude Opus 4.8より高性能だった」と読むよりも、同じモデルでも、周囲の実行環境を変えるだけでエージェントの成績が大きく変わり得ることを示す、企業発表のアブレーション(要因を一つずつ切り分ける比較)として見るのが適切です。Floatboatによれば、低価格のDeepSeek-V4-Flashは実行ハーネスを置き換えたことで、5つの公開エージェント評価における公表済みのClaude Opus 4.8比較値をすべて上回りました。3
ただし、この結論はまだ確定的ではありません。実験は独立機関によって再現されておらず、企業自身も、モデル同士の公開比較には異なるハーネスや評価設定が含まれると説明しています。3 現時点でより有用な問いは、「最も賢いモデルはどれか」ではなく、どのモデルと実行環境の組み合わせなら、複数ステップの仕事を最後まで安定して完了できるのかです。
Floatboatは、公式リリース版のDeepSeek-V4-Flash-0731を使い、入力とパラメーターを同じにしたうえで、DeepSeek公式のミニマリスト型ハーネスと、自社の評価ハーネスを比較したとしています。3
自社ハーネスでは、物理的に分離されたサンドボックス環境に加え、作業スペースやファイルへのアクセス、ツール、保持される状態、結果を確認して誤りを修正しながら作業を続けるための実行ループが用意されました。3
これは、エージェントの仕事が一度きりの回答生成ではないため重要です。エージェントは環境に対して何度も行動し、結果を観察し、計画を更新し、すでに終えた作業を壊さないようにしなければなりません。
Floatboatのハーネス上でDeepSeek-V4-Flashが記録したとされるスコアは次の通りです。
Floatboatは、これら5項目すべてで、公表されているClaude Opus 4.8の比較値を上回ったと説明しています。3
もっとも、同じランキング上で数字を並べれば、そのまま厳密な優劣が決まるわけではありません。公開ベンチマークでは、ハーネス、プロンプト、ツール構成、サンプリング設定、評価手順などが異なる場合があります。今回の比較でより意味があるのは、モデルを固定してハーネスだけを変えた部分です。それでも、結果そのものはあくまでFloatboatによる報告です。
報告されたDeepSeekの価格は、入力トークンが100万あたり0.14ドル、出力トークンが100万あたり0.28ドルです。入力と出力の比率を3対1とすると、混合単価は次のようになります。
(3 × $0.14 + $0.28) ÷ 4 = $0.175/100万トークン
一方、Claude Opus 4.8は入力が100万あたり5ドル、出力が100万あたり25ドルとされました。同じ比率で計算すると、次の通りです。
(3 × $5 + $25) ÷ 4 = $10/100万トークン
したがって、混合したAPIトークン単価では、OpusはDeepSeekの約57.1倍になります。3
ただし、これはタスク完了までの総費用が57.1倍という意味ではありません。ツール利用料、計算資源、キャッシュ、コンテキストの長さ、再試行、開発・運用コスト、ハーネスそのものの費用は含まれていないためです。あくまでモデルのトークン単価を比較した数字です。
Floatboatは、5つのベンチマークを短い作業から長い作業の順に並べた場合、ハーネス変更による相対的な伸びが**1.9%、9.6%、12.6%、19.9%、23.6%**になったと報告しています。つまり、タスクの依存ステップが増えるほど、ハーネスの影響が大きくなったという説明です。3
長時間のエージェントタスクでは、個々の判断が一見もっともらしくても、全体として失敗することがあります。たとえば、エージェントには次のような処理が必要です。
実行ループが弱いと、正しい推論であっても、文脈の喪失、無効なツール呼び出し、早すぎる終了、復旧不能な変更につながります。高性能なモデルは局所的な判断を改善できますが、状態を保存せず、有用なフィードバックを返さず、安全な復旧手段もない環境を単独で補うことはできません。
この点で、今回の結果は単なるモデル比較を超えています。競争の焦点を「どのモデルが最も賢いか」から、「どのモデルとランタイムの組み合わせが、現実の仕事を壊さず完遂できるか」へ移す可能性があります。
Floatboatは、ハーネス変更の効果とモデル変更の効果を比べる指標として、**Harness Leverage Ratio(HLR、ハーネス・レバレッジ比)**を提案しました。定義は次の通りです。
HLR = ハーネスだけを変更したときのスコア上昇幅
───────────────────────────────
より強い基準システムへ更新したときの上昇幅
HLRが1を超える場合、選択したベンチマークと比較条件では、モデルをアップグレードするよりもハーネスを変更したほうが大きなスコア上昇をもたらしたことになります。ただし、HLRは業界標準の指標ではありません。基準モデル、比較対象、ベンチマークのバージョン、プロンプト、予算、ツール、再試行回数、データの版などによって値は変わります。2
4
DeepSWEについて、FloatboatはDeepSeek公式ハーネスでのFlashのスコアが54.4だったのに対し、自社ハーネスでは67.25に上昇したと報告しました。上昇幅は12.85ポイントです。これに対し、引用されたOpus 4.8のスコアは58.0で、DeepSeek側の基準値との差は3.6ポイントでした。この計算から、HLRは約3.57になります。3
さらにFloatboatは、HLRが最短のタスクで0.78、最長のタスクで3.57になったとしています。このパターンが独立検証でも確認されれば、状態管理、ツール呼び出し、検証、復旧を必要とするタスクほど、モデルの変更よりランタイムの改善が効きやすいという見方を補強するでしょう。ただし、普遍的な法則とみなすことはできません。比較対象や評価環境を変えれば、HLRも変わるからです。
このベンチマーク結果は、Floatboatの製品戦略とも一致します。公開情報では、同社のサービスは個人事業者や小規模チーム向けのエージェントネイティブな作業環境として、ファイル、ブラウジング、AIとの対話、スケジュール、コミュニケーション、再利用可能なスキルやワークフローを組み合わせるものと説明されています。1
2026年5月のローンチ発表では、カレンダーを起点に自律的なエージェントワークフローを動かす方針が示され、SequoiaとWelight Capitalの支援を受けていると発表されました。18 ここでの考え方は、ランタイムを単なる言語モデルの薄いラッパーではなく、製品の中核レイヤーとして扱うことです。
日常的に使えるエージェントには、複数のアプリケーションをまたいで文脈を維持し、適切なタイミングで動き、権限を守り、ユーザーに毎回手順を再構築させずに仕事を進める能力が求められます。
今回の結果が独立テストでも再現されるなら、日常利用のエージェントで競争力を左右するのは、最新モデルへのアクセスだけではなく、安全な状態管理、可観測性、検証、復旧、権限管理、ユーザーによる制御といった実行基盤になる可能性があります。
その場合、モデルの使い分けも柔軟になります。信頼できるランタイムの中では、低価格モデルが定型的で手順の明確な作業を担い、深い推論や判断が必要な場面だけ高価なモデルに切り替える、といった構成が可能です。最良の製品は、最安のモデルでも最強のモデルでもなく、仕事の性質に応じて各モデルを適切に配置できるシステムになるかもしれません。
ただし、現段階で最も重要な留保は残ります。8月7日の実験を裏付ける主要な資料はFloatboat自身の技術説明であり、同社も、より広いモデル横断比較ではハーネスや評価設定が異なると認めています。独立した再実行、評価用アーティファクトの公開、プロンプト、予算、ツール、再試行、データバージョンをそろえた厳密な検証が行われるまでは、「5戦全勝」を業界で確立した結果とみなすべきではありません。3
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Floatboatは、モデルをDeepSeek V4 Flashのまま固定し、実行ハーネスだけを変更した結果、5つの公開エージェント評価でClaude Opus 4.8を上回ったと報告。ただし、独立検証はまだ行われていません。
Floatboatは、モデルをDeepSeek V4 Flashのまま固定し、実行ハーネスだけを変更した結果、5つの公開エージェント評価でClaude Opus 4.8を上回ったと報告。ただし、独立検証はまだ行われていません。 入力と出力の比率を3対1とすると、報告されたAPIトークン単価はDeepSeekが100万トークンあたり0.175ドル、Opusが10ドルで、Opusは約57.1倍高価です。
短いタスクから長いタスクになるにつれて、ハーネス変更による相対的な伸びは1.9%から23.6%へ拡大。状態保持、ツール操作、検証、エラーからの復旧が重要になることを示唆しています。