StartLux V1.0 27B Preview 以 27B 參數取得 39.25 分,綜合排名第二,僅落後 1.6T 參數的 DeepSeek V4 Pro 1.30 分;但這是針對特定 Agent 基準測試的結果,並非代表整體能力已超越超大型模型。 模型在位置導航項目排名第一,在瀏覽器自動化及金融分析等任務中,據報與 DeepSeek V4 Pro 並列第一或取得領先;同時超越 284B 的 DeepSeek V4 Flash 0731 及 198B 的 Step 3.7 Flash。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Shanghai-based StartLux’s StartLux-V1.0-27B-Preview, a 27-billion-parameter model built on Qwen3.6-27B with targeted post-training a. Article summary: StartLux-V1.0-27B-Preview was a notable outlier in CAICT’s MCP special test: it placed second overall with a 39.25 score despite having 27 billion parameters. It trailed the 1.6-trillion-parameter DeepSeek-V4-Pro by 1.30. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
上海 AI 公司 StartLux 的本地模型 StartLux-V1.0-27B-Preview,最近在中國信息通信研究院(中國信通院)的可信 AI 大模型基準測試——MCP 專項測試中交出亮眼成績:以 27B(270 億)參數取得 39.25 分,綜合排名第二,僅落後 1.6T(1.6 萬億)參數的 DeepSeek-V4-Pro 1.30 分。模型亦擊敗參數量達 284B 的 DeepSeek-V4-Flash-0731,以及 198B 的 Step-3.7-Flash。10
3
不過,這個結果不等於 27B 模型已全面勝過萬億參數模型。更準確的解讀是:當測試重點放在工具調用、多步規劃及實際完成工作時,一個針對 Agent 工作流程優化的細型模型,可能在特定任務大幅縮窄與超大型模型的差距。
MCP(Model Context Protocol)是一套讓模型接駁外部工具及資料的協議。相關測試並非一般的問答或知識排行榜,而是要求模型理解目標、拆解步驟、選擇合適工具,並在真實環境中完成操作。
中國信通院這次 MCP 專項測試涵蓋六類任務:位置導航、網頁搜尋、瀏覽器自動化、金融分析、代碼倉庫管理及 3D 設計,另加一項綜合評估,共七項檢驗項目。測試重點包括多工具協作、複雜任務執行及真實環境互動;報道指測試經三輪完整運行後取平均分。10
7
對企業而言,這類測試或許比單純比較模型能否答對一條推理題更貼近實際。企業真正關心的,往往是 Agent 能否可靠地搜尋資料、操作瀏覽器、分析報告,或者在出錯後自行恢復並完成整個流程。
報告所列的整體表現如下:
同參數級別比較方面,StartLux 據報比 Qwen-3.6-27B 高 5.34 分。參測名單亦包括 AgentCPM-Explore,但現有資料未提供所有比較模型的可靠綜合分數,因此不宜把未公布的數字自行補上。2
3
10
分項表現方面,StartLux 在位置導航排名第一;瀏覽器自動化及金融分析則據報與 DeepSeek-V4-Pro 並列第一,或由 StartLux 單獨領先。4
6
7
模型參數越多,通常代表更大的能力上限及更廣泛的處理範圍。對前沿推理、跨領域任務及非常複雜的工作,超大型模型仍然可能具備優勢。因此,StartLux 的成績不能用來證明參數規模已經不重要。
它真正反映的是另一件事:在有明確工作流程的 Agent 任務上,後訓練、工具使用、規劃能力及針對性優化,可能比單純增加參數更直接影響結果。StartLux 形容其模型採用本地 Agent 定位,並推廣「AI 訓練 AI」的 Auto Research 方法;這些是公司的解釋,但測試本身只能證明模型在該基準中的表現,未能單獨證明究竟是哪一種訓練方法造成結果。
所以較穩妥的結論是:針對工具調用、規劃及工作流程完成度作優化,有機會令細型模型在部分企業任務中追近大型模型,而不是令所有細型模型都能取代巨型模型。
27B 模型在配合量化技術及合適硬件後,通常比 1.6T 模型更有機會部署在企業私有基礎設施,甚至工作站或配置足夠的消費級電腦上。這對處理大量、重複及相對固定的 Agent 工作,可能帶來幾項好處:
但本地部署並非「買回來就用」。企業同時要自行負責硬件採購、模型更新、權限管理、審計紀錄、監控及保安。一個較小的模型可能較易運行,卻不代表較易管治。
StartLux 並非唯一將重點放在效率及本地運行的模型。NVIDIA 形容 Nemotron 3.5 Lightning 是開放的 30B 混合專家(MoE)模型,但每次推理只啟用 3B 參數,定位是為長時間運行的 Agent 提供高吞吐執行能力。NVIDIA 的模型支援紀錄亦列出 12B 及 31B 的 Gemma 4 變體。25
26
至於 Meta 的 Muse Glimmer,現有次級資料及模型目錄將它歸入本地 Agent 類別,但目前資料未能獨立核實 Meta 最初發布的官方文件,因此不應把相關描述說得過滿。27
33
整體趨勢已相當清晰:業界開始同時優化啟用參數、推理吞吐量、量化效果、工具可靠度及本地運行能力。競爭焦點正由「模型有幾大」逐步轉向「模型能否以合理成本長時間做好一件事」。
StartLux 的測試結果,可能令企業採取更分工清晰的採購策略:
換句話說,企業不應只問:「哪個模型參數最多?」更實際的問題是:「哪個模型可以在可接受的成本及風險下,穩定完成這項工作?」
StartLux-V1.0-27B-Preview 沒有令大小模型之爭一夜之間結束,但它令參數與實際效益之間的取捨更加難以忽視。當私隱、成本、延遲及私有部署是首要考慮時,一個能穩定操作工具、完成流程的 27B 模型,可能比一個規模大得多但部署複雜的模型更適合企業。
下一階段的 AI 採購,未必是選出一個包辦所有工作的「宇宙第一」模型,而是按工作性質配對模型規模及部署方式。StartLux 的 39.25 分之所以值得留意,不是因為它令參數數量失去意義,而是因為它展示了:部分 Agent 能力,原來可以集中在一個足以考慮本地運行的模型之中。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
StartLux V1.0 27B Preview 以 27B 參數取得 39.25 分,綜合排名第二,僅落後 1.6T 參數的 DeepSeek V4 Pro 1.30 分;但這是針對特定 Agent 基準測試的結果,並非代表整體能力已超越超大型模型。
StartLux V1.0 27B Preview 以 27B 參數取得 39.25 分,綜合排名第二,僅落後 1.6T 參數的 DeepSeek V4 Pro 1.30 分;但這是針對特定 Agent 基準測試的結果,並非代表整體能力已超越超大型模型。 模型在位置導航項目排名第一,在瀏覽器自動化及金融分析等任務中,據報與 DeepSeek V4 Pro 並列第一或取得領先;同時超越 284B 的 DeepSeek V4 Flash 0731 及 198B 的 Step 3.7 Flash。
這次測試提醒企業選型不應只看參數數量,還要比較工具調用可靠度、任務完成率、私有部署能力、資料安全、延遲及整體營運成本。