問題不在於 AI 唔識傾偈,而在於它未必識得「次次照做」
生成式 AI 智能助手的根本問題,是將一個以機率運作的語言模型,放進一個用戶期望「零偏差」的控制系統。
Alexa+、Gemini for Home 等新一代助手,確實比以往更能理解自然語句,亦可以將多個步驟組合成一個 Routine。不過,當涉及開燈、播歌、校計時器或者執行固定自動化流程時,模型每次推算的結果可能有差異;再加上額外延遲,以及揀錯工具或 API 的可能性,反而令最基本的工作變得不可靠。16
失誤不是古怪例外,而是日常指令都會出事
Google 的 Gemini for Home 測試中,曾經忽略用戶的播歌要求、在對話中途轉移話題、在星期三堅稱當日是星期二,甚至拒絕關閉智能燈,聲稱自己「無法控制或與家居照明等實體設備互動」。對一個主打智能家居的喇叭來說,這些正正是最基本的功能。1
Alexa+ 亦出現類似情況。有報道指,一個以往運作穩定的咖啡機 Routine 在升級後失效;亦有用戶表示,轉用 Alexa+ 後,原本建立好的 Routines 不見了。67
但事情又不是單純「Alexa+ 完全做不到」。測試人員同時發現,Alexa+ 可以只靠語音成功建立一個較複雜的自動化:例如當有人在指定時段經過 Ring 門口鏡頭,就開啟露台燈。系統不但完成設定,還能辨認用戶在 App 裏使用不同名稱的同一批燈具。2 這說明問題更像是表現忽好忽壞,而不是能力根本不存在。
傳統助手是「對應指令」,LLM 卻是在「估答案」
傳統語音助手通常會將辨認到的句子,對應至固定意圖、指定裝置和預先定義的 API 呼叫。用戶說「關掉廚房啲燈」,系統理論上就會穩定地執行同一個動作。
大型語言模型(LLM)則不同。它會按上下文和機率,理解用戶意思,再生成一個可能的工具或 API 呼叫。Google 自己亦形容 Gemini 具有「非確定性」——換句話說,它並非每次都像傳統程式一樣照着同一份腳本執行。15
這種彈性令對話更自然,亦有助處理含糊或多步驟要求;但對家居控制來說,同一句「關燈」,不應該因為前後文、說話方式或者不同一輪對話而被不同解讀。當指令涉及實體設備,尤其是門鎖、暖氣、爐具或警報系統時,這種不確定性就不只是令人尷尬,而是直接影響可靠性和安全。315
真正重要的是速度和可靠性,不是示範時有幾流暢
目前反覆出現的問題,包括回答慢、答錯問題、漏接指令、選錯歌曲,以及升級後遺失既有 Routine。相關報道將可靠性、延遲和產品價值,視為 AI 智能家居要面對的核心難題。5712
因此,較合理的技術架構,應該是由 LLM 負責理解自然語言和整理要求,再交由一層確定式的驗證及執行系統確認:裝置是否存在、指令是否安全、參數是否完整,最後才真正發出控制命令。LLM 不應該單獨決定一個實體設備要做甚麼。
Apple 亦未能避開同一個難題
這並非 Amazon 和 Google 獨有的問題。Apple 亦因工程問題和軟件錯誤,延遲了更個人化的新 Siri 功能;相關延誤更牽連智能家居產品計劃,原定推出的家居顯示器需要等新 Siri AI 準備好才會上市。482
另有報道指,現有 HomePod 類硬件的處理能力未必足以應付 Apple 更新一代的 AI 計劃,這可能是新硬件延遲,以及 Siri 表現不一致的其中一個原因。914
一個好 Demo,不代表產品已經準備好
生成式 AI 示範最容易令人留下深刻印象的,通常是它能夠記住上下文、理解自然講法,或者一次過完成幾個步驟。但對每日都要用的家居產品來說,真正的標準其實簡單得多:
- 指令要可預測;
- 回應要夠快;
- 做不到時要清楚交代;
- 出錯時要有安全而可靠的後備方案。
凡是會控制家庭設備、處理日程、代人購物或發送訊息的系統,都不應只靠一場流暢的產品示範來證明自己已經可以上市。如果可靠性和失敗處理仍未建立,過早推出的代價就會轉嫁給付費用戶——實際上,消費者便成了產品的測試員。