傳統護欄通常只是關鍵字或分類器過濾,缺乏實際的操作情境。結果可能是 誤判率高,卻仍然漏掉複雜攻擊,例如跨多步驟的提示注入。
Giskard 將 Guards 定位為一個「運行時(runtime)」安全平台,部署在 AI 代理與企業系統之間。
與只檢查輸入或輸出的工具不同,它會分析代理整個執行過程,包括:
目標是在行為真正影響企業系統之前,就發現並阻止風險。
系統不只依賴關鍵字,而是分析請求的 意圖與情境。例如請求是否與代理任務一致、是否涉及敏感資料、或是否試圖操控工具行為。
Guards 同時使用多種偵測器,包括:
當偵測到風險時,系統可以選擇 允許、監控或阻擋 該操作。
攻擊不一定出現在輸入或輸出,而可能藏在中間步驟,例如文件中的惡意提示或不安全的工具呼叫。
因此 Guards 會檢查整個 代理執行鏈(execution chain),以找出跨步驟的攻擊模式。
平台的一個核心概念是 policy‑as‑code(政策即程式碼)。
企業通常已有各種治理規則,例如:
Policy‑as‑code 的做法,是把這些自然語言規則轉換為 可由系統自動執行的控制邏輯。
研究指出,AI 代理治理框架可以將文件、設計規格或風險控制轉換為可在運行時監控的護欄,例如將政策編譯成輕量分類器或規則系統,以即時監控代理行為。
企業因此可以定義規則,例如:
因為這些規則是可版本化與程式化的,它們可以隨 AI 系統快速演進而更新。
另一個推動企業導入 AI 治理平台的重要因素,是 法規要求。
歐盟的 AI Act(人工智慧法案) 採取風險分級監管模式,對可能影響健康、安全或基本權利的「高風險 AI 系統」提出嚴格要求。
這些要求包括:
像 Giskard Guards 這類平台,嘗試透過以下方式支援企業達成這些義務:
這些機制能幫助企業滿足 AI Act 對 人類監督與技術可靠性 的要求。
AI 代理治理需求最強烈的,是高度監管的產業。
銀行與保險 可能使用 AI 代理處理:
這些流程涉及敏感金融資料與合規要求,因此必須確保代理不會做出未授權操作。
醫療領域 的風險甚至更高。AI 代理可能用於:
在這些情境中,護欄必須確保機密醫療資訊不被外洩,同時避免自動化建議繞過必要的人類審核。
因此許多企業更傾向於 基礎設施層級的安全控制,而不是只依賴提示設計或模型指示。
Giskard 也把 Guards 定位為歐洲 「主權 AI(sovereign AI)」 生態的一部分。
平台支援 本地部署(on‑premise)或受控環境部署,讓企業可以將資料、監控與政策執行保留在自己的基礎設施內。
對於需要遵守 GDPR 或 EU AI Act 的組織而言,能夠控制安全系統的部署位置,是導入 AI 的重要考量。
隨著 AI 代理越來越深入企業流程,安全策略也正在改變。
只檢查提示或輸出內容的護欄,難以覆蓋會 規劃任務、存取資料並操作工具 的代理系統。
Giskard 的思路代表了一種新的方向:
在整個代理工作流程中監控行為,並以即時政策控制 AI 的行動。
這種「行為層安全」是否能在大規模企業環境中有效防止複雜失敗案例,仍需要時間驗證。但隨著 AI 代理逐漸進入關鍵業務系統,這類治理層很可能會成為企業 AI 架構中的標準組件。