Qwen3.8 27B 於 2026 年 8 月 14 日發布,是採用 Apache 2.0 授權、具原生文字、圖像及影片理解能力的 27B 多模態模型;據報發布兩日內下載量突破 100 萬,量化版本約 17GB,可在合適的消費級硬件上運行。[1][2][3] 它是密集模型,約 27.8B 參數每個 token 都會啟用;64 層之中有 48 層採用線性注意力,另外 16 層採用完整注意力,有助減輕長上下文的 KV cache 記憶體負擔。[17][18] 代價是速度:模型預設開啟 thinking mode,一次社群測試為製作騎單車鵜鶘 SVG 花了 21 分鐘,使用 22,276 個推理 token,反映它可能會「諗得太耐...
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Qwen3.8-27B, released on August 14, 2026, and why is it being called the new “model kill line” or “local Opus 4.6”—considering its r. Article summary: Qwen3.8-27B is Alibaba Qwen’s Apache-2.0 open-weight, dense 27B multimodal model, released August 14, 2026. Its significance is not that it literally equals Anthropic Opus 4.6 in every task, but that a model small enough. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Qwen3.8-27B 真正受矚目,未必因為它可以在所有項目「打低」更大型的模型,而是因為它將一個接近前沿級的能力層級,帶到不少開發者實際買得起、用得到的硬件上。
由阿里巴巴 Qwen 團隊於 2026 年 8 月 14 日發布的 Qwen3.8-27B,屬於開放權重模型,採用 Apache 2.0 授權;它是密集模型,不是混合專家(MoE)架構,並原生支援文字、圖像及影片輸入。模型原生上下文窗口達 262,144 token,配合 YaRN,理論上可延伸至約 100 萬 token。1
2
這個組合正是它迅速爆紅的原因。報道指它在兩日內突破 100 萬次下載,並登上 Hugging Face 全球熱門模型榜;幾日之內,它亦成為 Cline 開發者選用最多的本地模型之一。2
3
10 社群所稱的「模型斬殺線」和「本地 Opus 4.6」,形容的是部署門檻和實際體驗,並不是已經證實它在所有任務都等同 Anthropic 的 Opus 4.6。
簡單講,Qwen3.8-27B 是一個約 270 億參數的密集模型。MoE 模型每個 token 只會啟用部分專家,但密集模型的全部參數都會參與運算。Qwen 官方模型資料亦顯示,它可以切換 thinking mode,即選擇先進行較長的隱藏推理,或者直接回答;技術資料則列明它原生接受文字、圖像和影片輸入。1
4
幾個規格,直接關係到它能否在本地運行:
所以,重點並不是「任何人用任何手提電腦都可以順暢運行」。真正的轉變是:具備這種能力組合的模型,已經落入個人開發者、小型團隊、機械人和邊緣設備有機會實際部署的尺寸。
「模型斬殺線」是開源模型社群的講法,意思近似一條最低能力門檻:當一個相對細的模型已經足以應付常見編程、推理和 Agent 任務,之後的新模型就要解釋,點解自己要更大、更貴,或者更難部署。
Qwen3.8-27B 之所以被貼上這個標籤,主要有三個原因:
換句話說,「斬殺線」問的不是「邊個模型參數最多」,而是:一項具體工作,最低要用幾大的模型先夠用?
如果 Qwen3.8-27B 已經足以處理某個編程助手、私人文件流程、機械人控制器或離線 Agent 的工作,開發者未必再會預設使用更大型的雲端模型。
「本地 Opus 4.6」這個叫法,捕捉到它最吸引人的地方:高階模型般的使用體驗,配合可以下載、自己部署的形式。不過,這個稱呼不應被理解為全面追平 Opus 4.6 的嚴格 benchmark 結論。
現有報道本身亦指出,仍然有不少差距和不確定性。即使兩個模型在 Intelligence Index 處於相同區間,也不能證明它們在長時間 Agent 任務、複雜軟件工程、事實可靠性,或者每一種多模態工作上表現一致。社群示範可以顯示模型「做到過乜」,但未必能反映它做到幾穩定、幾快,或者每次成本幾多。
較穩妥的講法是:Qwen3.8-27B 將部分近似前沿模型的行為帶入一個本地 27B 模型。即使雲端前沿系統在最高質素、吞吐量、超長管理式工作階段,以及某些特殊任務上仍然佔優,這依然是一次部署層面的突破。
Qwen3.8-27B 預設以 thinking mode 運作。官方模型庫說明,模型會先產生隱藏推理內容,再輸出答案;使用者亦可以按照指示關閉這個模式。4
這種設計可能提升複雜任務的表現,但處理簡單要求時,亦可能慢到令人心急。一次廣泛流傳的本地測試中,模型為製作一個「鵜鶘踩單車」的 SVG,花了 21 分鐘,並使用 22,276 個推理 token。這顯示它有相當強的持續推理傾向,但不應當作一般速度 benchmark。
實際使用時,開發者要在幾方面取捨:
因此,本地模型的優勢不只是「免費智能」,而是控制權:你可以自己決定用甚麼硬件、推理設定、私隱邊界和運行成本。相應地,記憶體、散熱、吞吐量和回應時間,也要由你自己管理。
Qwen3.8-27B 雖然是密集模型,但並非傳統的每一層都使用完整注意力的 Transformer。它的 64 層採用約 3:1 的排列:48 層 Gated DeltaNet 線性注意力,配合 16 層完整注意力。17
18
傳統完整注意力層會維持 key-value(KV)cache,而 cache 通常會隨着序列長度增加。Qwen 的線性注意力層採用另一種近似循環狀態的設計,只有 16 層完整注意力維持傳統、會隨上下文增長的 KV cache。18
實際意思是,相比每一層都用完整注意力的模型,它可以減輕長上下文帶來的記憶體壓力。當然,262K token 並不是「完全免費」:權重、KV cache、上下文處理和執行時開銷仍然會佔用記憶體。但這種架構,有助解釋為何一個密集 27B 模型可以在本地系統上追求相當長的上下文窗口。
MoE 模型的優點,是每個 token 只啟用部分專家,因此每 token 的運算量可能較低。但本地部署仍然要處理完整專家集合:一般來說,所有專家權重都要儲存在記憶體內,或者需要時由儲存裝置讀取。
Qwen3.8-27B 作為密集模型,記憶體故事反而簡單直接:每個參數都會啟用,但整個模型細到量化版本有機會放入一張消費級顯示卡的記憶體級別內。17
對本地電腦、機械人或邊緣裝置而言,真正限制可能包括:
對這些系統來說,最佳模型未必是理論上每 token 運算量最低的模型,而可能是那個完整工作集可以穩定放入裝置、毋須不斷搬運資料的模型。
Qwen3.8-27B 出現的時機,正值雲端推理經濟開始轉變。DeepSeek V4-Pro 一度是低價高性能的代表,但 8 月的新定價加入繁忙時段和非繁忙時段。報道指,V4-Pro 繁忙時段的輸出價格最高達每 100 萬 token 27 元人民幣,相比之前每 100 萬 token 6 元的輸出價格明顯上升。
這不代表本地推理必然更便宜。硬件要錢,運行要電,本地系統亦可能比託管 API 慢得多。不過,對高用量或重視私隱的工作負載而言,這個變化令比較更加實際:模型部署之後,本地使用的邊際成本較可預測;資料不用交給第三方;即使沒有網絡,也可以繼續工作。
於是,行業正在由「邊間公司的 API token 最平?」逐步轉向另一條問題:究竟哪些工作根本不需要使用 API?
Qwen3.8-27B 最重要的影響,可能不是單一模型的 benchmark,而是 AI 產品的預設架構。開發者可以考慮一套分工系統:
這樣做可以減少對 API 的依賴,但又不必假設一個本地 checkpoint 可以取代所有雲端模型。評估方式亦會變得更具體:與其單看參數數量,不如在產品真正使用的任務上,同時量度質素、延遲、記憶體、耗電、私隱和成本。
Qwen3.8-27B 被稱為「模型斬殺線」,是因為它提高了市場對「30B 參數以下本地模型應有能力」的期望。Apache 2.0 開放權重、原生多模態、長上下文設計、快速採用,以及約 17GB 的量化體積,令它成為近期本地 AI 發展中相當關鍵的一個模型。1
2
3
但最有力的結論,仍然是它的可部署性,而不是它全面勝過所有模型。Qwen3.8-27B 沒有令雲端前沿模型突然失去意義,而且預設推理模式亦可能以速度換取質素。
它真正做到的事情更精準,也更實用:將「模型要幾大」和「硬件要幾勁」正式拉入能力比較的核心。今後面對新模型,開發者問的可能不再只是「token 幾錢」,而是:這個模型有沒有大到值得,還是細到已經夠用?
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Qwen3.8 27B 於 2026 年 8 月 14 日發布,是採用 Apache 2.0 授權、具原生文字、圖像及影片理解能力的 27B 多模態模型;據報發布兩日內下載量突破 100 萬,量化版本約 17GB,可在合適的消費級硬件上運行。[1][2][3]
Qwen3.8 27B 於 2026 年 8 月 14 日發布,是採用 Apache 2.0 授權、具原生文字、圖像及影片理解能力的 27B 多模態模型;據報發布兩日內下載量突破 100 萬,量化版本約 17GB,可在合適的消費級硬件上運行。[1][2][3] 它是密集模型,約 27.8B 參數每個 token 都會啟用;64 層之中有 48 層採用線性注意力,另外 16 層採用完整注意力,有助減輕長上下文的 KV cache 記憶體負擔。[17][18]
代價是速度:模型預設開啟 thinking mode,一次社群測試為製作騎單車鵜鶘 SVG 花了 21 分鐘,使用 22,276 個推理 token,反映它可能會「諗得太耐」。[48][52]