生成式 AI 助理更擅長理解日常說話,卻可能在開燈、調光和執行例行程序等基本操作上失準,因為語言模型靠概率推測,而家居控制就要求每次都執行同一個已驗證動作。 較可靠的做法不是完全移除 AI,而是只讓模型把自然語言轉成受限制的指令,再由確定性軟件驗證、執行及確認裝置狀態。
研究答案

Create a landscape editorial hero image for this Studio Global article: Why, roughly a year after Amazon and Google introduced generative AI-powered smart home assistants such as Alexa Plus and Gemini for Home, d. Article summary: These assistants have become better at interpreting casual language, but that does not make them better controllers. Smart-home control needs a fast, exact, repeatable mapping from an utterance to one verified device act. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
生成式 AI 令智能喇叭更識「聽人講嘢」,卻未有令它們穩定地做好最基本的家居控制。Amazon 在 2025 年 2 月推出 Alexa+,其中一個賣點就是讓用戶用日常語言控制裝置——例如講「Alexa,將啲燈較暗少少」,毋須再講出裝置名稱和準確亮度百分比。然而,相關測試和評測仍然指出系統有錯誤、延遲、指令失敗,以及一些舊版本原本做得較穩定的功能倒退。
表面上,這似乎有點矛盾:AI 明明更聰明,點解連開盞燈都未必做得到?答案可能在於,對話需要理解、推測和即興發揮;家居自動化就只需要一件事——揀啱裝置,即時而且每次都準確完成動作。
較早期的語音助理,通常會將聽到的句子配對到預先定義好的意圖或指令。例如,set bedroom lamp brightness to 45%
換成生成式助理後,真正執行之前多了一連串推測。系統要先判斷你想表達甚麼,再辨認相關房間或裝置、理解上下文、選擇可用功能、組合 API 或工具呼叫,最後還要經過智能家居平台及不同品牌的整合層。每多一個交接位,就多一個出錯機會:名稱可能理解錯、參數可能無效、裝置狀態可能過時、連線可能超時,或者第三方整合根本沒有正常回應。
喬治亞理工學院教授 Mark Riedl 將這個取捨講得很直接:大型語言模型(LLM)能理解更多溝通方式,但開放性愈高,解讀錯誤的機會亦愈多。 有關智能家居的報道同樣將舊式的模板配對,與以概率運作、同類要求可能產生不同回應的 Transformer 系統作比較。
叫助理將盞燈調暗,聽落好像非常簡單,正因為結果很容易定義:它要揀中一盞燈,套用一個亮度值,並確認裝置真的轉到指定狀態。系統講得似模似樣但盞燈完全冇郁,或者只改變一組燈其中幾盞,對用戶來說都算失敗。
這種「非成功即失敗」的標準,會暴露出開放式對話中不易察覺的弱點。模型可以講得流利,卻可能認錯裝置名稱、揀錯功能,甚至在沒有可靠確認狀態的情況下聲稱已經完成。用戶或許願意接受聊天助理多問一句,但如果臨瞓前的例行程序失效,或者系統話已經關燈、盞燈卻仍然着住,容忍度自然低得多。
問題亦與產品本身的整合難度有關。Alexa+ 要將語言模型接駁到既有服務,以及數以百萬計支援 Alexa 的裝置;相關報道形容,即使新模型比上一代更靈活、更有能力,這種結合仍然相當棘手。
科技評論人 David Pogue 表示,他要求 Alexa+ 完成 135 項任務,最後「啱啱少於一半」成功。 這是個人實測,不是針對所有 Alexa+ 用戶或所有支援裝置進行的受控研究,因此不能當成普遍適用的成功率。
不過,這仍然是一個值得重視的產品訊號。假如一個家居助理在日常操作中接近一半時間出錯,用戶自然難以信任它處理燈光、調光、例行程序、音樂等重複工作。Pogue 亦提到,對某些熟悉操作而言,舊版 Alexa 反而更可靠,包括控制燈光和設定調光程度。
重點在於:功能範圍更闊,不代表可靠性更高。一個助理可以識做更多種類的要求,卻在用戶每日最常用的幾個指令上變得更難預測。
在智能家居裡,速度本身就是可靠性的一部分。牆身掣唔需要解釋自己點解開燈,只需要即撳即有反應。當助理要等幾秒,甚至有 Alexa+ 測試指部分要求最長要等 15 秒才回應,用戶感受到的就不只是「慢」,而是不知道指令到底有冇成功。
長時間等待,可能代表要求要經過更多遠端推理、上下文處理、流程編排和工具執行。就算裝置最後真的有反應,整個操作亦不再像使用一件家電,而更像等一項網上服務慢慢判斷你究竟想做甚麼。
Apple 傳聞中的 HomePod 和 Apple TV 計劃,正好反映硬件與助理軟件現時已經密不可分。有報道指 Apple 正為這些產品準備以 AI 為核心的 Siri 支援,而測試版程式碼亦顯示,公司正積極為 HomePod 和 Apple TV 開發 Siri 整合。
另有報道聲稱,Apple 正押後更新版 HomePod 和 Apple TV 的推出,等待新一代 Siri 體驗追上進度。不過,這些仍屬媒體報道,並非 Apple 已確認的產品時間表,因此需要審慎看待。
較宏觀的重點,不在於某一款產品幾時推出,而在於:當智能喇叭的價值愈來愈依賴全新的 AI 助理,一個未完成的助理就可能拖慢整件產品。這亦增加了推出風險——示範時對答流暢,不代表在真實家庭裡處理日常指令時已經足夠可靠。
這不代表自然語言介面沒有價值。生成式模型很適合將靈活、口語化的說法轉換成結構清晰的意圖。真正危險的地方,是讓一個不受限制的模型成為執行動作的最後話事人。
較穩妥的設計應該包括:
一項評估 13 個模型的研究,亦反映出這些防護措施的重要性。在測試的無效多裝置指令情境中,GPT-4o 的成功率是 0%,即使加入上下文學習、檢索增強生成和微調等方法,結果仍然如此。 這個數字只適用於特定實驗設定,不能直接代表日常使用表現;但它說明了一點:模型輸出在控制真實裝置之前,必須先經過驗證。
Amazon、Google 和 Apple 都希望同一件產品同時滿足兩種互相拉扯的期待。
作為對話夥伴,AI 助理可以探索、詳答,甚至容許一定程度的含糊;但作為家庭的控制中樞,它必須安靜、快速、了解裝置當前狀態,而且精準到近乎沉悶。
舊式系統令人煩惱,是因為用戶要學習一套死板的講法。新系統承諾消除這個負擔,但自然語言其實只是入口。每一句「將客廳啲燈較暗少少」背後,仍然是一個非常具體的任務:指定一組裝置,改變一個狀態,再可靠地確認結果。
只要企業未能在對話層之下保留確定性的執行機制,「更聰明」的助理就會繼續危及語音控制最重要的資產——信任。讓產品提早上市,的確可以取得真實使用回饋;但如果測試場地是付費用戶的屋企,最後承擔架構尚未達到家電級可靠性代價的,便是消費者。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
生成式 AI 助理更擅長理解日常說話,卻可能在開燈、調光和執行例行程序等基本操作上失準,因為語言模型靠概率推測,而家居控制就要求每次都執行同一個已驗證動作。
生成式 AI 助理更擅長理解日常說話,卻可能在開燈、調光和執行例行程序等基本操作上失準,因為語言模型靠概率推測,而家居控制就要求每次都執行同一個已驗證動作。 較可靠的做法不是完全移除 AI,而是只讓模型把自然語言轉成受限制的指令,再由確定性軟件驗證、執行及確認裝置狀態。
Alexa+ 的實測和相關報道反映出更強的對話能力,不等於更高的可靠性;如果企業在系統未達到家電般穩定之前推出產品,付費用戶便可能變成測試員。