Meta據報撤回以AI使用量評核員工嘅做法,核心原因其實好直接:用得多AI,唔代表做得更好。
今年較早時,部分科技公司將AI使用情況變成職場上好顯眼嘅指標。Meta員工據報曾面對有關AI使用量同「AI Native」狀態嘅評核措辭;加上內部按token使用量排名,結果令使用模型本身變成一場競賽。呢種為咗提高自己AI token用量而行動嘅現象,被稱為「tokenmaxxing」。
2
3
7
而家,Meta據報已將AI使用量同「AI Native」狀態從績效評核準則中移除。新取向係評估員工嘅貢獻同成果,無論成果係由AI輔助,定係用其他方法做到,都可以獲得認可。
7
9
Token數量點解唔適合做績效指標?
Token係AI模型讀取或生成文字時處理嘅基本單位。佢可以反映系統需求同成本,但用嚟衡量一個人嘅工作表現,就相當有限。
員工可以寫更多提示詞、叫模型做更長嘅工作,甚至將AI用喺價值不高嘅任務上;但咁做未必改善交付質素、準確度、可靠性、速度,或者商業價值。一旦使用量同表揚或考核掛鈎,個指標就容易由「量度工具」變成「追逐目標」。業界報道指出,有人會藉增加AI使用量去操弄排名,而推理成本亦急升。
1
11
16
呢個正正係tokenmaxxing嘅問題:它優化嘅只係生產力嘅替代指標,而唔係真實生產力。
Meta據報曾因成本「指數式增加」而告知員工將會限制AI使用;報道亦指Meta同Amazon已撤下token使用量排行榜。
1
2 呢個轉向唔代表AI喺工作場所冇價值,而係原始使用量本身,無法證明AI真正創造咗幾多價值。
新評核改為問:你交付咗乜?
據報,Meta新指引取消咗以AI使用情況作評核重點,亦叫經理唔好以token總數或AI採用儀表板去判斷員工影響力。
7
9
換言之,評核問題應由「你用咗幾多AI?」轉為:「你實際交付咗乜成果?」
以貢獻為本嘅評核,可以聚焦於:
- 成果嘅質素同準確度;
- 系統或流程係咪可靠、易於維護;
- 對客戶或內部團隊嘅實用性與影響範圍;
- 營運或業務成效;
- 以及判斷AI幾時有幫助、幾時唔應該用嘅能力。
報道引述嘅新措辭尤其關鍵:同一份成果可以由AI支援,亦可以透過其他方法做到,兩者都應按成果獲得評價。
7
9 AI仍然係工具,但唔應再係張「成績表」。
點解Meta仲要員工測試Hatch?
改變評核政策,唔等於Meta放棄推動AI。相反,Meta據報仍鼓勵員工測試Hatch——一個更自主嘅AI代理項目。
7
呢兩件事其實並唔矛盾。可以喺網站同應用程式中執行操作嘅AI代理,與只負責生成文字嘅聊天機械人,係兩種好唔同嘅產品。透過內部測試,公司可以先了解代理有冇準確完成任務、能否安全處理權限,以及整個使用體驗值唔值得用戶信任,之後先決定會否更廣泛推出。
對Hatch呢類產品而言,有意義嘅證據唔係測試者消耗咗幾多token,而係代理能否喺適當用戶控制下,可靠地完成有價值嘅任務,同時避免錯誤、安全問題,或者要人花大量時間監督。
對職場AI嘅更大啟示
Meta嘅調整亦反映更廣泛嘅業界轉變。最初要求員工「盡量用AI」嘅公司,開始面對更難答嘅問題:呢筆開支有冇帶來可量度嘅收益?有報道指AI成本上升,生產力卻未見相應增幅,令部分僱主轉向使用上限、預算控制,或者更有選擇地部署AI。
1
10
11
對公司嚟講,較合理嘅做法係將AI採用視為一個以結果為本嘅實驗:
- 先界定邊類工作應該改善;
- 衡量質素、節省時間、可靠性同成本,而唔係只睇工具活動量;
- 保留人類對決策與交付成果嘅責任;
- 用適當嘅非AI基準作比較;
- 停止獎勵不必要模型使用量嘅制度。
AI使用數據仍然有營運價值,例如用於容量規劃同成本管理;但它唔可以取代對員工實際貢獻嘅判斷。Meta據報今次改政策,正正劃清咗呢條界線:應獎勵工作帶來嘅影響,而唔係為完成工作而消耗咗幾多AI token。
7
9