Strands Harness 係 AWS 推出嘅開源 AI Agent「骨架」:目標唔係再提供一個模型,而係填補「本機試到個 Agent 幾似樣」同「變成可部署應用」之間嗰段最麻煩嘅路。
開發者可以先用模型加任務,在自己電腦跑起原型;之後保留同一套工具、狀態及上下文處理方式,整理成 Python 或 TypeScript 專案,再按目標環境部署。AWS 定位佢為可本機運行、亦可部署到開發者偏好供應商嘅通用 Agent Harness,唔係 AWS 專用 runtime。
7
模型以外,Harness 究竟幫你處理乜?
一個模型本身唔等於一個可靠嘅 Agent。真正決定 Agent 點樣做事嘅,仲包括:點樣取得上下文、何時調用工具、點樣保留工作狀態、點樣交畀其他 Agent,以及執行時有咩限制。
Strands Harness 預先配備咗以下能力:
- 檔案操作、Shell 指令及網頁工具
- 上下文管理
- 持久 session 同記憶
- Prompt 快取
- 多 Agent 委派
以上功能令開發者毋須每次由互動式 Demo 走向服務化應用時,都自己砌 Agent loop、工具層同狀態層。
5
Strands 亦支援 Model Context Protocol(MCP)。MCP 係一種開放標準,讓 Agent 連接由外部託管嘅工具;換言之,Agent 可按授權使用公司內部系統或第三方服務,而唔使將每個整合都硬寫入 Agent 核心邏輯。Strands SDK 採用可插拔、唔綁定單一模型供應商嘅方式,支援 Amazon Bedrock、Anthropic API、OpenAI,以及 Ollama 等本機或開源模型選項。
15
由工作電腦搬到部署環境
Strands 嘅賣點係可攜性:先喺本機做原型,將項目建立或整理成 Python/TypeScript 專案,作為一般軟件測試,再按目標環境加入部署設定。
現有發布報道指,相關部署指引涵蓋 AWS、Google Cloud、Azure、Cloudflare、Modal 及本機環境。
6
不過,可以部署唔代表一鍵變成可安心投產。以下工作仍然係開發及營運團隊責任:
- 只授予 Agent 完成工作所需嘅最少檔案、Shell、網絡及資料權限。
- 密碼、API key 同供應商憑證要放喺 prompt 同原始碼以外。
- 將 MCP server 同外部工具視為信任邊界一部分。
- 涉及改基建、發訊息、修改正式資料等後果較大嘅操作,應加入人工批准或沙盒隔離。
- 上線前建立日誌、監察、測試,以及針對實際工作負載嘅評估。
Harness 可以慳返整合工序,但唔會替機構決定存取控制、風險承受能力同可靠性標準。
用 Strands CLI 快速起步
官方 quickstart 指出,CLI 需要 Node.js 20 或以上;互動式設定可讓你選擇 Python 或 TypeScript。Python 專案則需要 Python 3.10 或以上。
2
# 安裝互動式 CLI
npm install -g @strands-agents/cli
# 啟動設定助手
strands
如使用 Python,文件列出嘅安裝方式如下:
python -m venv .venv
source .venv/bin/activate # Windows: .venv\Scripts\activate
pip install strands-harness
TypeScript 則先建立 Node.js 專案,再依照最新版 quickstart 安裝 @strands-agents/harness。
2
實際做法可以係:透過互動設定定義 Agent 角色、可使用工具、模型供應商同記憶需求;先本機運行;然後將產生或設定好嘅專案提交到版本控制並測試,當成可部署成品。CLI 指令流程可能隨版本改動,若要用特定產生或匯出指令,應先查看 strands --help 同最新 quickstart。
2
模型可換,供應商設定仍然要做
Strands 支援跨供應商模型,但可攜性唔會自動消除各供應商嘅登入、存取及付費要求。Harness SDK 預設使用 Amazon Bedrock;用家需要設定 AWS 憑證,並為所選模型啟用存取權限。
12
其他供應商同樣會有自己嘅 credentials、endpoint、收費安排同政策控制。至於使用本機或開放權重模型嘅團隊,Strands 相關基準工具文件提及可透過 LiteLLM、vLLM 等 runtime 接入。
18
實務上,呢個設計令團隊可以唔好將 Agent 營運設計鎖死喺一個模型廠商;但每次轉模型或 runtime,都應重新測試質素、延遲同工具調用可靠性。
AWS 話平 28%,應該點睇?
AWS 聲稱,Strands Harness 在六項 benchmark 中,使用相同 Claude 或 GPT 模型時,比其他 Harness 低 28% 成本,而準確度接近相若。
7
另有報道引述 AWS 比較,指它相對 Claude Code 及 Codex 約 便宜 45%;若將 DeepSeek Harness 納入比較,則收窄為 28%。兩個數字比較嘅對象組合不同,唔應當成同一個「通用慳錢幅度」。
5
呢類數據值得研究,因為上下文點樣組裝、點樣處理工具輸出、點樣編排工作同驗證結果,確實會大幅影響 token 用量同任務結果。有研究立場論文亦認為,面對長步驟任務、而模型能力相近時,執行 Harness 對表現差異嘅影響可以大過模型本身。
17
但要記住,基準結果仍然係 AWS 自行發布。《The Register》指出,發布時嘅比較把通用 Harness 同編程 Agent 放埋一齊,並形容為 AWS 自己「批改自己份功課」。
3 呢個唔代表結果必然錯,只代表它唔係獨立證據,亦無法保證任何 Agent 工作負載都會更平或更好。
較公平嘅內部測試,應固定模型、prompt、任務集、工具、權限、重試策略、延遲目標同成本計法。成本亦唔止 input/output token,仲包括工具調用、儲存、基建、人手覆核、失敗重試,以及一次錯誤操作所帶來嘅代價。
邊類團隊較適合用?
Strands Harness 較適合想要一個通用 Agent 起點、需要真正工具存取與有狀態行為,但同時想保留模型同部署目標選擇權嘅開發者。
尤其當一個本機 proof of concept 原本要大幅重寫,先可以加入記憶、工具整合、上下文控制或雲端部署途徑時,佢嘅價值會更明顯。
5
7
至於 AWS 嘅 benchmark 數字,最穩陣嘅態度係視為可驗證假設,而唔係採購承諾:由範圍窄、隔離好嘅 Agent 開始;只開真正需要嘅工具;以具代表性嘅工作量量度成功率、延遲同全盤成本;等權限、監察同審批控制到位,先逐步推向正式環境。