調暗一盞燈看起來很簡單,因為目標很明確:選定一個裝置、套用一個數值,並確認裝置真的達到要求。只要燈沒有變暗、只改到群組中的部分燈具,或系統口頭宣稱完成但實際狀態沒有改變,這次操作就算失敗。
這種非黑即白的標準,會放大生成式模型在閒聊時不一定明顯的弱點。模型可以說得流暢,卻可能認錯裝置名稱、選錯功能,或在沒有可靠確認狀態的情況下宣稱成功。使用者或許能接受聊天機器人多問一句,但很難接受睡前例行程序失敗,或明明說已關燈,燈卻仍然亮著。
這也說明了為何把語言模型接上既有智慧家庭服務如此困難。Alexa+ 必須同時整合語言模型、既有服務,以及數以百萬計的 Alexa 裝置;報導指出,即使新模型更強、更有彈性,這種組合仍難以穩定完成最基本的操作。
科技評論人 David Pogue 表示,他要求 Alexa+ 執行 135 項任務,正確完成的比例略低於一半。 這是個人實測,不是針對所有 Alexa+ 使用者、所有裝置與所有情境所做的受控研究,因此不能直接當成普遍成功率。
但它仍是重要的產品訊號。對一個要負責開關燈、調光、執行例行程序、播放音樂等日常工作的家庭助理來說,如果失敗率接近這種程度,使用者自然會停止信任它。Pogue 也提到,在部分熟悉的任務上,舊版 Alexa 反而更可靠,包括控制燈具與設定調光程度。
關鍵區別在於:能處理更多類型的請求,不代表每一項請求都做得更準。助理可以在對話中變得更有能力,卻在使用者每天反覆執行的少數幾項指令上變得更難預測。
智慧家庭的「快」不是錦上添花,而是可靠度的一部分。牆上的開關不需要解釋推理過程,只要按下去就應該立即反應。當助理需要等待數秒,甚至在部分 Alexa+ 測試中最長達 15 秒才回應,使用者感受到的不只是慢,更會開始懷疑指令到底有沒有成功。
這種長時間等待,可能代表請求必須經過更多遠端推理、上下文處理、工作編排與工具執行。即使裝置最後真的有反應,操作感也不再像使用家電,而像是在等待某項雲端服務先判斷「這句話到底是什麼意思」。
對一個原本應該取代牆壁開關的產品來說,慢且不確定,就已經足以讓人覺得它壞了。
Apple 傳出的 HomePod 與 Apple TV 規劃,顯示硬體與助理軟體如今已經緊密綁在一起。報導稱,Apple 正為這些產品準備以 AI 為導向的 Siri 支援;測試版程式碼也出現與下一代 Siri、HomePod 及 Apple TV 整合相關的線索。
但更廣泛的問題很清楚:一旦智慧音箱的產品價值取決於全新的 AI 助理,助理若尚未成熟,就可能反過來拖慢周邊硬體的推出。這也提高了發布產品的門檻——企業不能只在展示場合讓對話看起來令人印象深刻,還必須讓它在日復一日的家庭操作中足夠穩定。
這不代表自然語言介面沒有價值。生成式模型很適合把「把客廳燈調暗一點」轉換成結構化意圖。真正危險的是,讓一個不受限制的模型成為執行動作的最後裁決者。
較穩健的架構應該包括:
針對 LLM 應用於智慧家庭的研究,也凸顯了這些防護措施的必要性。在一項評估 13 個模型的研究中,GPT-4o 在特定測試情境下,面對無效的多裝置指令,成功率為 0%;即使加入上下文學習、檢索增強生成與微調,仍未能解決該問題。 這項結果只反映特定實驗設計,不等同於日常使用表現,但它清楚說明:模型輸出在控制真實裝置前,必須先經過驗證。
Amazon、Google 與 Apple 都試圖讓同一項產品同時滿足兩種互相衝突的期待。
作為對話夥伴,AI 可以探索、補充、冗長,並容忍模糊說法;作為家庭控制中樞,它卻必須安靜、快速、掌握即時狀態,而且精準無誤。
舊系統令人挫折,是因為使用者必須學會僵硬的指令。新系統承諾消除這項負擔,但自然語言只是問題的前端。每一句輕鬆的日常請求,背後仍然是一個具體動作:一個裝置、一次狀態變更,以及一次可靠的確認。
在企業把確定性執行保留於對話層之下以前,「更聰明」的助理仍可能破壞語音控制最重要的價值——信任。提前推出尚未成熟的系統或許能換來大量回饋,但當測試發生在付費家庭裡,承擔架構尚未達到家電級可靠度成本的,就成了使用者。