V4は、ツール実行・テスト結果・複数Agent稼働の捏造を抑え、コード納品と実検証を分離した点で正しい方向に進んでいる。 一方で、重要ルールの知識ベース依存、状態定義の重複、Gemが実際に持たないバックグラウンド実行や永続環境を想起させる表現が残る。
公開者GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: 对上述V4 版本进行评审,并给出你的终稿:. Article summary: ```markdown 评审结论:V4 已经解决了“伪造工具、伪造测试、代码片段冒充完整交付、ADR 无证据转正”等核心问题,整体方向正确,但不建议原样上线。它的主要缺陷不是能力不足,而是规则过密、状态重复、Gem 运行边界不够明确,以及“零依赖、自动循环、完整代码、BMAD 多 Agent”仍存在语义歧义。 终稿建议升级为 Solo Engine v4.1 Final :保留 V4 的研究—决策—工程闭环,把不可妥协规则集中到 Gem. Topic tags: deepresearch, general web, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visua
V4は、存在しないツール呼び出しやテスト結果を捏造しないこと、コード断片を完全納品と見せかけないこと、証拠なしにADRを正式採用へ進めないことという重要な問題を解決しています。研究、意思決定、実装、検証を一本の流れにした設計も妥当です。
ただし、そのまま長期運用へ入れるのは推奨しません。問題は機能不足ではなく、指示の密度が高すぎること、状態定義が複数箇所で重複していること、Gemの実行可能範囲が十分に限定されていないことです。
最終案は Solo-Engine v4.1 Final です。V4の骨格を維持しながら、以下を徹底します。
V4の最も大きな前進は、AI支援開発で起きやすい「もっともらしい虚偽」を、運用ルールとして明確に排除したことです。
具体的には、検索、Tavily、MCP、コード実行、コンパイル、テスト、Git操作、ファイル書き込み、デプロイを、実際に使えるツールが存在し、実行証跡がある場合にしか実行済みと表現しないという線引きです。
また、次の分離も適切です。
DELIVERY_STATUS:必要なコードファイルを完全に出力したかVERIFICATION_STATUS:コンパイルやテストを実際に実行したかENGINEERING_STATUS:要件、検証、工件整合まで含めて完了と呼べるかこの3つを混ぜると、「コードは書いたがビルドしていない」状態が、誤って「完成」に見えてしまいます。V4はこのリスクを正しく認識しています。
さらに、BMADについても表現を正すべきです。BMADの公式資料では、Agent、Skill、Workflow、テスト用ワークフローが実行機構として整理されています。1
10
14 単一Gem内でPM、Architect、Developer、QA、Opsの観点からレビューすることは有効ですが、これは独立した複数Agentランタイムの実行と同義ではありません。したがって、呼称は 「BMAD-inspired role orchestration」 が正確です。
知識ベースの資料が、毎回必要な粒度で完全に参照されるとは限りません。そのため、以下は詳細手順書だけでなく、必ず主指示にも置くべきです。
V4では状態、依存関係、ADR、検証、完了条件が複数ファイルに分散し、似た規則が繰り返されています。規則は多ければ安全になるわけではありません。長い出力では、重複した指示の一部だけが選択的に守られ、別の箇所と状態が食い違う危険があります。
v4.1では、主指示を「ルーター兼ガードレール」、知識ベースを「方法論とテンプレート」として役割分担させます。
プロンプトに自動ループと書いても、Gemが自動的にバックグラウンドで動作したり、ユーザーの離席後に処理を続けたり、会話をまたいで永続的な端末を保持したりするわけではありません。
v4.1でいう自動ループは、次のすべてを満たす有限の反復です。
WAITING_VERIFICATION で止まる「ゼロ依存」は、ランタイムすら不要という意味にも、サードパーティーパッケージを追加しないという意味にも、未提供のローカルファイルを参照しないという意味にも読めます。これらは別問題です。
v4.1の規約では、以下のように分けます。
新規プロジェクトでは、ビルド設定、エントリーポイント、ソース、テスト、必要リソース、設定例まで含めた最小プロジェクト閉包が必要です。
既存プロジェクトでは、すべてのリポジトリファイルを再掲する必要はありません。ただし、追加または変更した各ファイルは完全な内容で出力する必要があります。コンパイルや契約に影響する既存ファイルが未提供なら、推測で実装してはいけません。
ツールはプロンプトで生み出せません。Gemは会話内で実際に公開されている能力だけを使います。
RESEARCH:Tavily、ネイティブWeb、Deep Research、提供ファイルのみ、またはなしEXECUTION:対象言語のツールチェーン、制限付き実行器、またはなしFILES:読み取り専用、読み書き可能、またはチャット出力のみPERSISTENCE:セッション内のみ、または実際の永続ワークスペースTavilyについても同じです。search_depth=advanced は詳細かつ高精度の検索に向く正式なパラメータですが、遅延やコストの増加を伴います。2
4
11 Tavily接続が実在する場合だけ使用でき、接続がないGemが「advancedで検索済み」と書くことはできません。
検証には段階を設けます。
| レベル | 意味 |
|---|---|
| V0 | 未実行。コード生成または設計レビューのみ |
| V1 | 静的確認。依存、契約、構文上のレビュー |
| V2 | 記録済み環境で解析、コンパイル、ビルドに成功 |
| V3 | 必要な振る舞いテストと回帰テストに成功 |
| V4 | 対象環境、または合意済みの等価環境で検証済み |
実行器がない場合、Gemが言えるのは「指定環境向けに生成し、静的確認を行った」までです。「コンパイルエラーゼロ」や「全テスト成功」とは言えません。
失敗を成功に見せかけるため、テストの削除、例外の握りつぶし、固定値返却、想定ログの実行ログ化を禁止します。
実行できる環境では、実装と検証の反復を原則3回までに制限します。同じ根本原因に対する修正が2回続けて失敗した場合、開発者視点の修補を止め、Architect視点で要件、契約、アルゴリズム、環境、依存関係を見直します。元の認可範囲を超える変更が必要なら、ユーザー確認に戻します。
以下はGemの実行ベンチマークではなく、今回の設定監査における要件適合度の評価です。各項目を5点満点で採点し、重み付きで100点に換算しています。
| 評価軸 | 重み | V4 | v4.1 Final |
|---|---|---|---|
| Gemの実行境界とツール真正性 | 25% | 4.0 | 4.8 |
| 三読・DM・DRによる意思決定の収束 | 20% | 4.5 | 4.8 |
| 工学的ガードレールと失敗時の背圧 | 20% | 4.6 | 4.8 |
| 完全コードと依存閉包 | 15% | 4.6 | 4.9 |
| 指示密度と遵守しやすさ | 10% | 2.8 | 4.5 |
| 状態復元と証拠照合 | 10% | 4.2 | 4.7 |
| 加重合計 | 100% | 84.2 | 95.5 |
計算式は次の通りです。
$$
Score = 20\sum_{i=1}^{n}w_i s_i,
\qquad \sum_{i=1}^{n}w_i=1
$$
ここでの点数は、運用上の設計品質を比較するための補助指標であり、実行結果そのものを保証するものではありません。
採用案:Solo-Engine v4.1 Final
V4は、内部実験や設計検証の出発点として十分に価値があります。しかし恒常運用では、規則をさらに積み増すよりも、以下の改善が重要です。
00-solo-engine-system.md:Gem指示。ルーティング、真正性、能力境界、完了条件10-ana-solo.md:分析、証拠区分、Decision Matrix、Deep Recon20-ana-bmad.md:工程ループ、Preflight、依存規約、完全納品30-artifacts.md:Plan、ADR、検証記録、Truth Report、Resume Capsule40-three-pass-reading.md:三読プロセス旧版の同等ファイルを同時にアップロードすると、重複ルールの再発につながります。移行時は旧版を外し、v4.1 Finalの構成に統一するのが安全です。
今回の情報だけでは、現在のGemに以下が実際に接続されているかは確認できません。
このためv4.1 Finalは、能力を前提に宣言するのではなく、その会話で実際に露出している能力へ適応する設計を採用します。それが、AI支援の開発フローを「もっともらしい報告」から「監査可能な作業記録」へ近づける最も重要な変更です。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
V4は、ツール実行・テスト結果・複数Agent稼働の捏造を抑え、コード納品と実検証を分離した点で正しい方向に進んでいる。
V4は、ツール実行・テスト結果・複数Agent稼働の捏造を抑え、コード納品と実検証を分離した点で正しい方向に進んでいる。 一方で、重要ルールの知識ベース依存、状態定義の重複、Gemが実際に持たないバックグラウンド実行や永続環境を想起させる表現が残る。
v4.1 Finalでは、非妥協ルールを主指示に集約し、詳細な手順書・テンプレートは知識ベースへ分離する。