各大科企緊急煞停內部AI Token排名榜同無上限燒錢模式,發現用AI用量嚟衡量生產力完全係得個桔,Uber營運總監直認使咗天價AI預算但完全見唔到實際業務有咩改善。 METR嘅標誌性研究發現,資深開發者用AI寫code反而慢咗19%,仲搞到後續研究爛尾——因為高達五成開發者已經拒絕做任何冇AI幫手嘅工作,依賴程度深到冇得救。

Create a landscape editorial hero image for this Studio Global article: What are the key findings and concerns surrounding developers' increasing reliance on AI coding tools in 2026, including METR's failed follo. Article summary: Here is a consolidated picture of the key findings and concerns as of late May 2026.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# 🤖AI Coding Tools Essential for Developers in 2026. AI coding tools are now a must-have for devs. In 2026, AI coding tools become indispensable. Starting in 2026, AI coding tools" source context "AI Coding Tools Essential for Developers in 2026 - ContentBuffer" Reference image 2: visual subject "Split screen showing a developer feeling fast and productive with AI coding tools on one side and the same developer dealing with bugs errors and techn
到咗2026年5月底,AI編碼工具嘅蜜月期正式宣布玩完。本來大家都好似掘金咁,搏命想將AI塞入開發者嘅日常工作流程,但依家一頭撞埋去一大堆冷冰冰嘅數據、失控嘅成本,仲有令人心寒嘅心理依賴。研究實驗室根本冇辦法再量度到人類嘅生產力,因為啲開發者已經拒絕寫任何冇AI幫手嘅code。同時間,2026年初嗰股用AI Token消耗量嚟衡量生產力嘅管理潮流,隨住各大企業承認呢條數根本計唔掂,亦都極速崩塌。結果係,我哋嚟到咗一個關鍵嘅企業反噬時刻,大家開始雞手鴨腳咁重新搵過啲真係有用嘅衡量指標。
喺2026年2月,AI研究實驗室METR公布咗一個震撼得嚟又極之簡單嘅發現:佢哋根本冇辦法完成自己嗰份關於開發者生產力嘅研究。
METR原本諗住為佢哋2025年嗰份突破性嘅隨機對照試驗做個後續研究,點知一大班獲邀嘅開發者竟然拒絕參與——原因係,佢哋唔肯做任何冇AI幫手嘅工作,即使只係做研究用途嘅有限度任務都唔得 。
其實2025年嗰份原始研究已經留低咗好大個陰影。研究發現,用緊Cursor Pro同Claude 3.5/3.7 Sonnet呢類AI工具嘅資深開源開發者,完成任務嘅速度比起冇用AI嘅人慢咗足足19%。最反諷嘅係,班開發者自己本來預測AI會幫佢哋慳到大約24%時間,仲話感覺自己生產力高咗,但客觀數據講嘅故仔完全相反:佢哋使咗多咗時間去debug、去引導個AI,仲要乾等AI完成任務 。
到咗2025年8月,METR嘗試擴大研究規模去57個開發者同超過800個任務,點知呢次仲大鑊。結果喺統計上得個吉——估計生產力慢咗4%,但個置信區間闊到爆,由-15%去到+9%。最致命嘅一點係,有30%至50%嘅參加者承認佢哋做緊「自我審查」,即係特登唔提交嗰啲冇AI就完成唔到嘅任務。個研究樣本根本就無可救藥咁偏埋咗去嗰一小撮仲肯冇AI做嘢嘅開發者度 。最終,METR索性成個實驗都唔要,話佢哋啲數據「完全唔可靠」
。
短短唔夠一年之內,研究嘅敘事角度就由「AI令資深開發者變慢,但佢哋自己察覺唔到」,演變成一個更震撼嘅發現:「開發者直頭連嘗試冇AI做嘢都唔肯。」呢種依賴已經深到根本冇辦法量度 。
正當METR嘅研究搞到一鑊泡嘅時候,矽谷就有另一股平行嘅狂熱橫掃緊。Tokenmaxxing——嗰種將AI Token原始消耗量當成開發者生產力指標放到最大嘅玩法——成為咗2026年初嘅潮流標誌,但好快就喺自己嘅重量之下玩死咗自己。
呢種文化仲被人徹底遊戲化。據報,Meta嘅員工係用一個叫「Claudeonomics」嘅內部儀表板嚟鬥,爭取緊「Token傳說」同「Session不死」呢類稱號,純粹睇邊個燒得最多Token 。Nvidia嘅CEO黃仁勳更加語出驚人,話如果佢公司一個成50萬美金年薪嘅工程師,唔係「重Token消費者」,佢會「極度驚慌」
。成個業界,Token預算竟然變咗做榮譽勳章,象徵緊一個員工有幾咁擁抱AI,同埋由此推斷出佢哋有幾咁創意爆棚。
嚟到2026年5月底,反噬終於推上咗最高點。亞馬遜煞停咗佢哋內部、放喺Kiro開發者平台上嗰個叫「KiroRank」嘅排行榜,原因係發現有員工為咗谷高自己嘅用量分數,竟然走去做啲「完全冇用嘅AI代理」。
亞馬遜嘅高級副總裁Dave Treadwell仲直接向員工發咗個訊息:「唔該,唔好淨係為咗用AI而用AI」。一位亞馬遜發言人證實,個排行榜只係個「Beta版本嘅儀表板」,並「唔係一個正式或者獲准嘅工具」,但佢產生出嚟嘅運算成本已經造成咗無可挽回嘅損失
。依家公司正轉向用一個叫「標準化部署次數」嘅指標,嚟嘗試量度真正有意義嘅工作
。
仲爆得更戲劇性嘅係,Uber嘅AI大計變成咗一個活生生嘅反面教材。
2025年12月,公司俾咗大約5,000個工程師廣泛嘅權限,去用Anthropic嘅Claude Code。幾個月之內,使用率就由32%爆升到84%,而到咗2026年4月,公司竟然已經使曬成個財政年度嘅AI預算。
根據Uber嘅技術總監Praveen Neppalli Naga所講,依家公司95%嘅工程師每個月都會用AI工具,而有70%提交嘅code都係由AI生成嘅——呢個比例係所有主要科企入面,公開報過最高嘅數字 。
但係,呢種驚人嘅採用率,完全冇換嚟清晰嘅回報。營運總監Andrew Macdonald就喺5月底一個訪問中公開承認,公司根本冇辦法喺畀咗咁大筆AI開支,同有意義嘅業務成果之間,拉得出一條線。「呢個連結仲未出現」,佢話:「要justify呢筆開支越嚟越難」。聽講內部,Uber嘅高層已經開始用一個名詞去稱呼呢個問題:就係「Tokenmaxxing」
。
Meta同其他大型公司都已經煞停或者檢討緊佢哋嘅AI使用排行榜 。成個科技界依家都喺度重新審視緊呢種失控、但又產生唔到相稱回報嘅AI開支。《財富》雜誌就結論話,「Tokenmaxxing」呢個潮流,「已經死咗」
。
呢場反噬並唔單止係關乎預算咁簡單。越嚟越多證據顯示,AI生成嘅code,根本就係喺度軟件項目入面種緊啲計時炸彈。
2026年呢場大清算,正正催生緊一套新嘅、更加清醒嘅共識,去諗點樣將AI融入軟件工程入面。
由2026年得出嘅教訓係好清楚嘅:AI編碼工具仲未可靠咁證明到佢哋嘅經濟價值之前,就已經創造咗一種前所未有嘅心理同運作上嘅依賴。能夠成功駕馭呢個悖論嘅公司,將會係嗰啲將AI視為一種需要有紀律咁去駕馭嘅工具,而唔係一個要你不斷餵飼更大Token祭品嘅神明。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
各大科企緊急煞停內部AI Token排名榜同無上限燒錢模式,發現用AI用量嚟衡量生產力完全係得個桔,Uber營運總監直認使咗天價AI預算但完全見唔到實際業務有咩改善。
各大科企緊急煞停內部AI Token排名榜同無上限燒錢模式,發現用AI用量嚟衡量生產力完全係得個桔,Uber營運總監直認使咗天價AI預算但完全見唔到實際業務有咩改善。 METR嘅標誌性研究發現,資深開發者用AI寫code反而慢咗19%,仲搞到後續研究爛尾——因為高達五成開發者已經拒絕做任何冇AI幫手嘅工作,依賴程度深到冇得救。
「Tokenmaxxing」呢股鬥燒Token嘅歪風徹底玩死自己,引致嚴重嘅運算資源浪費、爆標嘅成本,仲積累咗威脅長遠系統穩定嘅技術債,依家各大公司焗住要重新設計評估制度。