V4 правильно запрещает имитацию поиска, тестов, Git операций и работы нескольких независимых агентов, но правила в ней слишком повторяются. В v4.1 Final жёсткие требования переносятся в основную инструкцию Gem, а подробные SOP и шаблоны — в базу знаний.
ОпубликовалИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: 对上述V4 版本进行评审,并给出你的终稿:. Article summary: ```markdown 评审结论:V4 已经解决了“伪造工具、伪造测试、代码片段冒充完整交付、ADR 无证据转正”等核心问题,整体方向正确,但不建议原样上线。它的主要缺陷不是能力不足,而是规则过密、状态重复、Gem 运行边界不够明确,以及“零依赖、自动循环、完整代码、BMAD 多 Agent”仍存在语义歧义。 终稿建议升级为 Solo Engine v4.1 Final :保留 V4 的研究—决策—工程闭环,把不可妥协规则集中到 Gem. Topic tags: deepresearch, general web, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visua
V4 не стоит выпускать без правок. Она уже устраняет ключевые риски: вымышленные инструменты, фиктивное тестирование, выдачу фрагментов за полноценный код и перевод ADR в статус принятого решения без доказательств. Однако главная проблема V4 — не нехватка функций, а избыточная плотность правил и не до конца определённые границы того, что Gem реально способен сделать.
Финальный выбор — Solo-Engine v4.1 Final. Он сохраняет полезный контур «исследование → решение → инженерная реализация», но сокращает повторы, делает основную инструкцию самодостаточной и запрещает выдавать желаемые возможности за реальные.
/ana-solo для анализа и /ana-bmad для инженерной работы.FACT, INFERENCE, ASSUMPTION и UNKNOWN.Важное уточнение касается BMAD. Документация BMAD действительно описывает агентов, навыки, workflow и отдельные процессы тестирования как самостоятельные механизмы исполнения.1
10
14 Поэтому один Gem может использовать BMAD-inspired role orchestration — последовательную проверку с точек зрения аналитика, архитектора, разработчика и QA, — но не должен утверждать, что запустил несколько независимых агентов в полноценном BMAD runtime.
Нельзя считать гарантией, что каждый файл knowledge base будет полностью и одинаково извлекаться в каждом ответе. Поэтому правила о честности инструментов, полном коде, верификации и критериях завершения должны находиться прямо в главной инструкции Gem, а не только в справочных SOP.
В V4 несколько документов параллельно определяют статусы, зависимости, верификацию, ADR и Definition of Done. Это повышает риск частичного соблюдения: модель может выполнить одну формулировку и пропустить другую, близкую по смыслу.
В v4.1 правило простое: непреложные ограничения — в system instruction; процедура и шаблоны — в knowledge base; фактическое состояние проекта — в артефактах проекта.
Фраза «автоматически повторять цикл» не даёт Gem доступа к постоянному терминалу, фоновым задачам или работе после завершения сессии. В финальной версии цикл разрешён только:
WAITING_VERIFICATION, если исполнителя кода нет.Он не может одновременно означать «не нужен runtime», «нет внешних пакетов» и «не нужны отсутствующие локальные файлы». В v4.1 он разделён на проверяемые условия:
Для нового проекта нужен замкнутый минимальный набор: конфигурация сборки, точка входа, исходники, тесты, ресурсы и сценарий проверки.
Для существующего проекта нужно полностью вывести каждый новый или изменённый файл, а также все новые локальные зависимости. Неизменённые файлы, уже предоставленные пользователем, повторять не требуется. Но если отсутствует файл или интерфейс, от которого зависит компиляция, его нельзя додумывать: корректное состояние — WAITING_INPUT.
Ключевое изменение v4.1 — разъединение трёх вопросов:
| Статус | На что отвечает |
|---|---|
DELIVERY_STATUS |
Все ли требуемые файлы выведены полностью? |
VERIFICATION_STATUS |
Что действительно было проверено и каким способом? |
ENGINEERING_STATUS |
Есть ли основания объявить инженерную работу завершённой? |
Полнота вывода не доказывает работоспособность. Статическая проверка не равна сборке. А успешный тест старого bundle не подтверждает новый bundle.
В отсутствие реального исполнителя допустимы генерация кода и статический обзор, но верификация должна оставаться NOT_RUN или STATIC_CHECKED, а инженерный статус — WAITING_VERIFICATION.
Параметр Tavily search_depth=advanced действительно предназначен для более точных и детальных запросов, но требует большего времени отклика и может быть дороже.2
4
11 Это параметр фактического вызова API, а не способность, которую можно получить одной только подсказкой.
Следовательно, Gem должен:
advanced для критичных запросов высокой точности, если это поддерживает текущая schema инструмента;Главная инструкция должна содержать только то, что нельзя потерять при неполном извлечении knowledge base:
/ana-solo и /ana-bmad.В базе знаний остаются подробные документы:
ANA-SOLO;ANA-BMAD;Старые версии однотипных файлов не следует загружать одновременно с финальным пакетом: иначе возможны конфликтующие извлечения правил.
/ana-bmad работает как последовательность контрольных точек, а не как инсценировка командного чата:
ALGO, STRUCTURAL, BUGFIX, OPS или смешанный.Оценки ниже — экспертный аудит конфигурации, а не benchmark фактического исполнения Gemini Gem.
| Критерий | Вес | V4 | V4.1 Final |
|---|---|---|---|
| Границы Gem и честность инструментов | 25% | 4,0 | 4,8 |
| Три прохода, DM и DR | 20% | 4,5 | 4,8 |
| Инженерные предохранители и реакция на сбой | 20% | 4,6 | 4,8 |
| Полнота кода и замыкание зависимостей | 15% | 4,6 | 4,9 |
| Плотность инструкций и исполнимость | 10% | 2,8 | 4,5 |
| Восстановление состояния и сверка доказательств | 10% | 4,2 | 4,7 |
| Итоговый балл | 100% | 84,2 | 95,5 |
Формула нормализации:
$$
Score = 20\sum_{i=1}^{n} w_i s_i,\qquad \sum_{i=1}^{n}w_i=1
$$
Финальная конфигурация не должна считаться устойчивой, если происходит хотя бы одно из следующего:
DELIVERY_STATUS получает значение COMPLETE.search_depth=advanced.The Pick: Solo-Engine v4.1 Final.
V4 годится как сильная экспериментальная основа, но не как долговременная конфигурация без редактуры. В v4.1 улучшение достигается не добавлением новых запретов, а устранением дублирования, строгим описанием реальных возможностей Gem и превращением статусов в проверяемый контракт.
Если в будущем появятся Gemini API Managed Agent, MCP, постоянная рабочая область или кодовый sandbox, их следует подключать через отдельный Runtime Adapter. Не стоит расширять основную инструкцию вымышленными описаниями инструментов в надежде, что они начнут существовать.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
V4 правильно запрещает имитацию поиска, тестов, Git операций и работы нескольких независимых агентов, но правила в ней слишком повторяются.
V4 правильно запрещает имитацию поиска, тестов, Git операций и работы нескольких независимых агентов, но правила в ней слишком повторяются. В v4.1 Final жёсткие требования переносятся в основную инструкцию Gem, а подробные SOP и шаблоны — в базу знаний.
Автоцикл ограничен текущим сеансом, явным разрешением пользователя, доступными инструментами и бюджетом повторных попыток.