Better Harness 係 Qoder 開源嘅 Coding Agent 工作流檢視工具:佢評估 agent 身處嘅工程環境,將有證據支持嘅缺口化成範圍清晰、可驗證嘅修復工作。 框架分為三層:Harness Engineering 實踐、五個交付維度嘅 Agent Work Loop 評估,以及可喺支援宿主環境運行嘅實作。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Cloud Qoder’s Better Harness, open-sourced on GitHub on July 28, 2026, and how does its three-layer framework—covering Harne. Article summary: Better Harness is Qoder’s MIT-licensed, open-source reviewer and improvement loop for the environment around coding agents—not merely a benchmark of an agent’s answer on one task. It maps project setup and real agent act. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Qoder 嘅 Better Harness,係一個開源工具,用嚟檢視同改善 Coding Agent 周邊嘅工作流程。佢唔係只睇某次模型回答得好唔好、或者一個 code diff 啱唔啱;反而會睇整個專案點樣畀 agent 做嘢:有冇清楚指引、適當控制、驗證途徑、agent 設定,以及喺支援情況下,有冇真實工作 session 嘅紀錄可供查證。
目的係搵出流程斷點,提出範圍有限嘅修復方案,之後再跑一次,驗證改善有冇真係留下可查嘅證據。1
2
4
據當時報道,Qoder 喺 2026 年 7 月 28 日宣布於 GitHub 開源 Better Harness。5
Coding Agent 從來唔係單獨運作。佢周圍仲有 repository 指引、規格、工具、權限、腳本、測試、code review 要求、發版檢查同人手交接。Qoder 將呢套環境叫做 harness。官方文件所講嘅 harness,可以包括 repository instructions、rules、skills、hooks、plugins、connectors、scripts、test commands、release checks,同埋人手 review 步驟。2
分別好重要:就算模型本身幾叻,外圍流程含糊或者缺乏監測,交付都可以唔穩定。譬如專案有測試指令,但冇講清楚 agent 幾時必須執行;又或者有 rule file,但 agent 根本冇用;失敗任務帶來嘅教訓,亦未必有方法保存成可長期維護嘅專案資產。Better Harness 想找出嘅,就係呢類操作層面問題,而唔係見到有設定檔就當成流程已經有效。1
4
5
Better Harness 被定位為一個三層框架,將工程實踐、評估模型同可實際運行嘅實作連埋一齊。5
第一層係影響 agent 工作質素嘅實際機制,包括 session 同 CLI 模式、可觀測性、rules、skills、MCP 設定、memory、hooks 同自動化。5
用白話講,呢層會問:
Better Harness 會先描繪現有 harness,包括目標、背景、執行入口、回饋循環、交付機制同學習紀錄方式。1
第二層會將上述實踐轉成五個互相連接嘅交付維度:任務理解、受控執行、改動驗證、可靠交付、學習紀錄。1
4
換句話講,問題由「agent 有冇寫到似樣嘅 code?」轉為:整套由頭到尾嘅流程,係咪可以重複地產出容易理解、受控、驗證過、可交付,而且有吸收舊經驗嘅改動?
框架要找嘅,正正係工作循環入面嘅斷點,例如少咗某個機制、整合冇接通、某一步從未實際執行,或者結果冇足夠證據支持。1
第三層係令前兩層唔止停留喺原則同文件,而係真係可喺項目中運行。Better Harness 透過 Coding Agent 執行,在支援情況下收集專案同 session 證據,然後輸出有優先次序、可驗證嘅下一步改善建議。4
Qoder 目前資料指出有 10 個 host adapters;開源時嘅報道則點名支援 Claude Code、Codex、Qoder 同 Cursor 等 Coding Agent 環境。5
6
支援範圍會隨版本改變,所以如果要確認某個宿主環境可唔可以整合,應以項目最新 adapter 文件為準。現有提供嘅資料並未證實支援 OpenClaw。
Better Harness 一個關鍵設計,係將收集證據同最終評估分開做。Qoder 表示,主分析流程先收集原始資料,再交畀三個獨立、唯讀嘅 sub-agents 分析,最後先整合結果。1
三個角度包括:
呢種分工,幫到團隊分清「設計上應該有」同「實際上真係做過」。專案同設定證據可以證明能力存在;session 證據就有助證明 agent 喺某個真實任務入面有冇適當使用呢項能力。1
4
Better Harness 最實用嘅原則之一,就係:有工件存在,唔等於有效。
例如 repository 有自動化測試,最多只證明具備潛在能力;但單靠測試套件存在,唔能夠證明 agent 改完 code 後有執行相關測試、正確理解結果,或者真係靠結果阻止咗錯誤交付。Rules、hooks、skills 同審批閘口,都係同一道理。1
5
因此,Better Harness 會盡量將證據鏈講清楚。報告會將有支持嘅缺口化成按優先次序排列嘅 findings,列出影響、預期產出、範圍清晰嘅修復方式同驗收檢查;冇證據嘅地方,會明確保留,而唔會偷偷變成一個充滿把握嘅分數。4
6
一個有用嘅 finding,應該畀團隊檢查到以下幾點:
Better Harness 並唔係一次性審計工具,而係一個迭代流程:
呢個先係佢所講「持續改善」嘅基礎:工具可以顯示流程有冇變,以及新證據係咪支持較強嘅評估。但佢本身唔能夠證明每一個修復,都必然令所有專案、所有 host 環境嘅 agent 表現更好。Qoder 資料強調觀察到嘅證據同明確限制,而唔會將分數升跌當成因果證明。4
6
開源時報道提到,框架曾用於一項涉及 30 個真實 GitHub 項目嘅初步演練。5 呢個較適合視為探索性應用:展示框架可以喺不同 repository 搵到重複出現嘅 harness 缺口,而唔係一項受控實驗,證明 Better Harness 會提升每一個 Coding Agent 或每一個專案。
現有一手文件足以支持其證據模型、findings 結構同迭代修復方式;但提供嘅來源未有足夠一手細節,讓人獨立評估呢 30 個項目嘅樣本選取、評分程序或整體結果。要將 Better Harness 同正式 benchmark 比較,或者作出廣泛效能宣稱時,呢些限制尤其重要。1
4
Qoder 更大嘅主張係,Harness Engineering 應該成為 AI 輔助軟件開發嘅品質基礎設施:有共同詞彙、工作流控制、可觀察證據、可比較嘅交付維度,以及可以重複執行嘅改善循環。1
2
Better Harness 就係將呢個想法落地嘅一種做法。對使用支援 host 嘅團隊而言,佢提供一個方法去檢視 agent 工作條件、用證據而唔係印象討論問題,並喺後續運行中測試流程修復係咪站得住腳。
佢嘅價值唔係保證每次修改都會改善結果,而係令 AI Coding Agent 工作流變得更容易檢查、review,同埋被證偽。4
6
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Better Harness 係 Qoder 開源嘅 Coding Agent 工作流檢視工具:佢評估 agent 身處嘅工程環境,將有證據支持嘅缺口化成範圍清晰、可驗證嘅修復工作。
Better Harness 係 Qoder 開源嘅 Coding Agent 工作流檢視工具:佢評估 agent 身處嘅工程環境,將有證據支持嘅缺口化成範圍清晰、可驗證嘅修復工作。 框架分為三層:Harness Engineering 實踐、五個交付維度嘅 Agent Work Loop 評估,以及可喺支援宿主環境運行嘅實作。
工具分開收集 Project Harness、Agent Customization 同 Session Evidence;有測試、規則或 hook,唔代表 agent 真係有正確使用,缺失證據會保留為限制,而非硬塞成高分。