V4 已處理虛構工具、假測試、殘缺代碼冒充完整交付,以及無證據將 ADR 轉正等核心風險。 最大問題唔係功能不足,而係主指令同知識庫規則重疊太多,令狀態、驗證同完成條件容易互相打架。 V4.1 Final 應將不可妥協規則留喺 Gem 主指令;詳細 SOP、模板同方法論才放知識庫。
發布者圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: 对上述V4 版本进行评审,并给出你的终稿:. Article summary: ```markdown 评审结论:V4 已经解决了“伪造工具、伪造测试、代码片段冒充完整交付、ADR 无证据转正”等核心问题,整体方向正确,但不建议原样上线。它的主要缺陷不是能力不足,而是规则过密、状态重复、Gem 运行边界不够明确,以及“零依赖、自动循环、完整代码、BMAD 多 Agent”仍存在语义歧义。 终稿建议升级为 Solo Engine v4.1 Final :保留 V4 的研究—决策—工程闭环,把不可妥协规则集中到 Gem. Topic tags: deepresearch, general web, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visua
V4 唔建議原封不動上線,但絕對值得保留其核心骨架。
佢已經成功處理咗幾個最危險嘅問題:唔可以靠提示詞虛構搜尋、Tavily、編譯、測試、Git 或部署;唔可以用片段代替完整交付;亦唔可以冇驗證證據就將 ADR 寫成已接受。呢個方向係啱,而且比一般「多角色提示詞」更有工程誠信。
不過,V4 最大弱點唔係能力唔夠,而係規則太密、狀態定義重複、主指令過度依賴知識庫召回。再加上「零依賴」、「完整代碼」、「自動 Loop」同「BMAD 多 Agent」呢幾個詞未夠精準,實際使用時容易令模型作出超出真實能力嘅表述。
最終裁決:採用 Solo-Engine v4.1 Final。
V4.1 唔係再疊更多守則,而係將守則分層:
V4 清楚要求:冇真實執行證據,就唔可以話「已編譯」、「測試全綠」或者「可直接上生產」。呢條規則應該保留,而且必須放喺主指令,唔可以只靠知識庫。
/ana-solo 用於研究、決策矩陣(DM)、Deep Recon(DR)同結晶;/ana-bmad 用於計劃、實作、驗證同工件對賬。呢個分工合理,亦可以防止「一收到需求就直接寫碼」。
將內容分成 FACT、INFERENCE、ASSUMPTION 同 UNKNOWN,可以阻止推論假扮事實。尤其喺工具、環境、現有專案介面未齊嘅情況下,呢套標記非常實用。
BMAD 官方文件本身將 Agent、Skill、Workflow 同測試流程列為明確機制。1
10
14 所以,單一 Gem 可以借鑑 BMAD 嘅職責視角,例如 PM、Architect、Developer、QA 同 Ops,但只應稱為 BMAD-inspired role orchestration,唔應聲稱已經真係平行運行多個獨立 Agent。
V4 已經掌握到一個重點:代碼輸出完整,唔等於工程已經完成。檔案可以完整交付,但未曾真實編譯或測試;反過來,即使有測試記錄,若果 Bundle 同測試版本對唔上,亦唔可當完成。
知識庫係參考層,唔係保證每次都會完整載入嘅執行層。因此以下規則要留喺主指令:
否則一旦知識庫局部未被召回,最重要嘅安全閘就會消失。
V4 多個檔案重複講狀態、驗證、依賴、ADR 同 Definition of Done。內容雖然大致一致,但重複本身會造成兩個風險:
V4.1 嘅原則應該係:一項硬規則只設一個權威來源;其他文件只引用,不重複改寫。
提示詞寫咗「自動循環」,唔代表 Gem 有背景任務、持久終端,或者跨會話繼續執行嘅能力。
V4.1 應將自動循環定義為:
WAITING_VERIFICATION;「零依賴」如果唔拆開,可能同時被理解成「唔使 runtime」、「唔用第三方套件」同「唔依賴任何本地檔案」,工程上根本係三回事。
建議 V4.1 改為以下契約:
新專案要交付最小可運行閉包:設定、入口、源碼、測試、新增本地模組、必要資源與驗證入口。
現有專案則應:
V4.1 最值得保留嘅升級,係將三件事拆開管理:
| 狀態 | 用途 | 例子 |
|---|---|---|
DELIVERY_STATUS |
檔案交付是否完整 | NOT_STARTED、PARTIAL、COMPLETE |
VERIFICATION_STATUS |
有冇真實驗證證據 | NOT_RUN、STATIC_CHECKED、EXECUTED_PASS、EXECUTED_FAIL |
ENGINEERING_STATUS |
可否宣稱工程完成 | DRAFT、BUILDING、WAITING_INPUT、WAITING_VERIFICATION、VERIFIED、COMPLETE |
只有以下條件同時成立,先可以寫 ENGINEERING_STATUS=COMPLETE:
CONSISTENT;咁樣可以避免最常見嘅錯誤:「我已經貼完代碼」被誤寫成「工程已完成」。
Tavily 的 search_depth=advanced 係真實存在嘅搜尋深度選項,設計上用較高延遲換取較高相關度,適合需要細節與精準度嘅查詢。2
4
11
但呢件事只代表:當 Tavily 工具真係被接入時,可以用呢個參數。 唔代表任何 Gem 因為提示詞提到 Tavily,就已經有 Tavily。
V4.1 應採用能力適配:
advanced、basic 或其他可用參數;FILES_ONLY;NONE,唔可杜撰檢索結果。同樣地,advanced 不應變成預設炫技。官方文件指出佢係針對高精度、詳細查詢,並以更高延遲作取捨。2
4
11
以下係今次配置設計審核,唔係 Gemini Gem 實際運行 benchmark:
| 維度 | 權重 | V4 | V4.1 Final |
|---|---|---|---|
| Gem 運行邊界與工具真實性 | 25% | 4.0 | 4.8 |
| 三遍閱讀、DM、DR 收斂質素 | 20% | 4.5 | 4.8 |
| 工程安全閘與失敗背壓 | 20% | 4.6 | 4.8 |
| 完整代碼與依賴閉包 | 15% | 4.6 | 4.9 |
| 指令密度與可遵從性 | 10% | 2.8 | 4.5 |
| 狀態恢復與證據對賬 | 10% | 4.2 | 4.7 |
| 加權總分 | 100% | 84.2 | 95.5 |
計算方式:
$$
Score = 20\sum_{i=1}^{n}w_i s_i,
\qquad \sum_{i=1}^{n}w_i=1
$$
呢個分數只反映本次對配置結構、真實性邊界同工程可審核性嘅人工判斷,唔應被當成效能實測結果。
建議只保留五份權責清楚嘅文件:
| 文件 | 放置位置 | 唯一責任 |
|---|---|---|
00-solo-engine-system.md |
Gem 指令區 | 路由、硬約束、能力邊界、狀態語義 |
10-ana-solo.md |
知識庫 | 研究、Value Extraction、DM、DR、結晶 |
20-ana-bmad.md |
知識庫 | 場景識別、工程門禁、交付與驗證循環 |
30-artifacts.md |
知識庫 | Plan、ADR、Verification Record、Truth Report、Resume Capsule |
40-three-pass-reading.md |
知識庫 | 三遍閱讀方法 |
注意:舊版同功能文件唔好同終稿一齊上傳。 否則召回時可能拎到兩套相近但不同版本嘅規則,正正重演 V4 想解決嘅問題。
以下內容建議無論知識庫有冇載入,都必須放入 00-solo-engine-system.md:
NOT_RUN 或 STATIC_CHECKED;DELIVERY_STATUS、VERIFICATION_STATUS 同 ENGINEERING_STATUS;DELIVERY_STATUS=PARTIAL。如果 V4.1 出現以下任何一項,就代表主指令仍然未夠硬:
COMPLETE;search_depth=advanced。呢五個測試比再加十頁流程文字更有價值,因為佢哋直接測到真實性、契約同狀態機有冇穿窿。
Solo-Engine v4.1 Final一句講晒:V4 已經有正確嘅工程倫理;V4.1 Final 要做嘅,係將呢套倫理變成模型更容易穩定遵守嘅結構。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
V4 已處理虛構工具、假測試、殘缺代碼冒充完整交付,以及無證據將 ADR 轉正等核心風險。
V4 已處理虛構工具、假測試、殘缺代碼冒充完整交付,以及無證據將 ADR 轉正等核心風險。 最大問題唔係功能不足,而係主指令同知識庫規則重疊太多,令狀態、驗證同完成條件容易互相打架。
V4.1 Final 應將不可妥協規則留喺 Gem 主指令;詳細 SOP、模板同方法論才放知識庫。