GA 上線後,工程團隊仍卡在哪裡

7 月 16 日 Kimi K3 API 首發到 8 月 3 日 Qwen3.8-Max GA,國產萬億級 MoE 幾乎每週都有新動態。對部署決策而言,摩擦點不在新聞稿分數,而在「能不能真的當開源模型規劃」:

  • 權重時程:官方三次承諾「下週」在 Hugging Face 與 ModelScope 釋出 Qwen3.8-Max 與 Qwen3.8-27B,但截至 8 月 4 日尚無 repo、無授權條文、無 model card——與 Kimi K3 7 月 27 日已釋出 594 GB MXFP4 權重形成對照。
  • Open-Source 標籤爭議:qwen.ai 首頁已標 Open-Source,社群指出在檔案未上架前不應與已可下載的 K3、DeepSeek V4-Flash(MIT)同列;這是行銷標籤與工程事實的落差,而非單純跑分問題。
  • 授權空白:VentureBeat 等媒體提醒:若採 Kimi K3 式自訂授權而非 Apache 2.0,自架與 MaaS 商用門檻可能與 API 定價優勢無關。
  • Benchmark 可驗證性:Arena 文本榜 1496 分為 7 月 27 日至 8 月 2 日週榜初步數據;Frontend Code Arena 1668 分、OSWorld-Verified 86.1 等多為官方 harness,權重釋出前社群仍難獨立重跑。
  • 百萬上下文成本:1,000,000 token 輸入在 API 模式下意味實質頻寬與 token 帳單;自架則需對應 GPU 叢集與 KV 快取策略,與 Mac 開發機是不同量級。
  • 競品定價壓力:OpenAI Luna 降價 80%、DeepSeek V4-Flash 低價路由分流,使 Qwen 的 $2/$6 雖低於 Kimi K3 輸出端,卻仍須在真實 Agent 任務上證明性價比。

Qwen3.8-Max 對照 Kimi K3、DeepSeek V4 與 Claude——決策矩陣

問題不是「誰分數更高」,而是「今天能不能下載權重、明天能不能合規商用、API 帳單能否承受長上下文 Agent」。

維度 Qwen3.8-Max Kimi K3 DeepSeek V4-Flash Claude Fable 5 / Opus 5
GA / 權重狀態2026-08-03 API GA;權重承諾下週07-27 權重已釋出07-31 權重 MIT 開源閉源 API
總 / 啟動參數2.4T / 95B2.8T / ~104B較小 MoE(Flash 級)未公開
上下文1,000,000 token1,048,576 token128K+(依部署)依產品線
Arena 文本(週榜初步)1496(#5)kimi-k3-max 綜合榜 #13路由榜高用量Fable 5 1509(#1)
API 定價(每百萬 token)輸入 $2 / 輸出 $6輸入 $3 / 快取 $0.3 / 輸出 $15低於多數旗艦Opus 5 約為 Qwen 輸出價數倍
辦公 Agent 產品QwenWork(同日公測)Kimi Work
典型場景長上下文文件、桌面 Agentpreserved thinking coding Agent高流量路由、成本敏感企業旗艦推理

對多數以 Terminal Agent、Xcode 或 OpenRouter 閘道為主的團隊,8 月 4 日當下仍應以 API 驗證為主;權重釋出後才進入自架、微調與資料主權規劃。Qwen 的戰略差異在於首次承諾釋出 Max 級權重,以及 Apple Intelligence 中國版已選 Qwen 作為生成式後端——這讓模型分發規模可能遠超獨立 App。

MoE 架構、QwenWork 與 Apple Intelligence 中國版

Qwen3.8-Max 建立在 Qwen 3.5 基礎上,採稀疏 MoE 與混合注意力,在 2.4 兆總參數下每請求僅啟動 950 億,目標是在旗艦智力與推理延遲之間取平衡。多模態方面支援文字、圖像與影片輸入,Vision Arena 排名第二。

  • Agent 基準:官方稱 OSWorld-Verified 86.1,高於 GPT-5.6 Sol Max(83.2)與 Fable 5(85.0);Frontend Code Arena 1668 分,距 Claude Opus 5 旗艦配置約 37 分。
  • QwenWork:同日進入 Web 與桌面公測的一站式辦公 AI Agent,對位騰訊 WorkBuddy、月之暗面 Kimi Work,整合文件、郵件與長程任務編排。
  • Apple Intelligence 中國:7 月 15 日網信辦核准 Apple Intelligence 備案,阿里巴巴確認 Qwen 將接入 iOS、iPadOS、macOS、visionOS 的生成式能力(文字與圖像理解/生成),百度負責部分搜尋與視覺功能——這是 Qwen 在消費端的最大分發通道之一,與開發者 API 互補。

「下週開源」若未附具體日期、授權與 model card,企業自架規劃應視為未完成。Poolside Laguna S 2.1 與 DeepSeek V4-Flash 同日釋權重的先例表明:可規劃的開源需要三要素齊全,而非僅有新聞稿。

六步驟:權重未到前先驗證 Qwen3.8-Max API

即使暫無 GPU 叢集,仍可在乾淨 macOS 環境完成 API 與 Agent 煙霧測試。Kimi K3 的 harness 注意事項可參考 K3 開放權重解析;以下針對 Qwen3.8-Max GA 後流程。

  1. 核對 Model Studio 帳戶與區域:確認 Alibaba Cloud Model Studio 已開通目標區域,記錄速率限制與百萬上下文計費規則。
  2. 對照授權與開源承諾:追蹤 Hugging Face / ModelScope 是否出現 Qwen/Qwen3.8-Max repo 與 license 檔,勿僅依首頁 Open-Source 標籤規劃自架。
本機 shell — 檢查權重 repo 狀態
huggingface-cli repo info Qwen/Qwen3.8-Max 2>/dev/null || echo "repo not published yet"
  1. 配置乾淨測試主機:租用 Mac mini M4,建立獨立 Python 虛擬環境,隔離 Qwen SDK 與其他 LLM 客戶端版本。
  2. 接入 OpenAI 相容 API:以 Model Studio 端點呼叫 qwen3.8-max,先跑短上下文煙霧測試再逐步放大 prompt。
qwen38_max_smoke.py
from openai import OpenAI
client = OpenAI(
    api_key="...",
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "用三句話說明 MoE 如何降低推理成本。"}],
    max_tokens=512,
)
print(resp.choices[0].message.content)
  1. 執行 Agent 對照測試:以 tool calling 或 QwenWork 公測介面跑一條真實 workflow(文件摘要、多步重構),並與 Kimi K3、DeepSeek V4-Flash 在相同 harness 下記錄延遲與 token 成本。
  2. 對照 primary source 核實 benchmark:重讀官方新聞稿與 Arena 週榜註腳,區分「初步人評」與「官方 harness」;權重釋出後再規劃本機重現。

可引用的硬核參數與來源

  • 規模:總參數 2.4 兆,每請求啟動 95B,上下文 1,000,000 token,最大輸出約 131,072 token。
  • 架構:稀疏 MoE + 混合注意力,多模態(文字/圖像/影片);基於 Qwen 3.5 訓練堆疊。
  • Arena(2026-07-27 至 08-02 週榜初步):文本綜合 1496 分全球第五,距 Fable 5 榜首 1509 分約 13 分;Vision Arena 第二,Frontend Code Arena 1668 分第四。
  • Agent 基準(官方 harness):OSWorld-Verified 86.1;內部稱 16 天自主完成軟體工程專案並開源 oh-my-cli。
  • API 定價:輸入每百萬 token 2 美元、輸出 6 美元——低於 Kimi K3 輸出端與多數 Claude 旗艦組合價。
  • 時序:2026-07-19 Preview → 2026-08-03 GA + QwenWork 公測 → 權重承諾下週(約 8 月 10 日前後)。

定價、速率限制、授權條文與 Arena 分數可能更新——以下官方連結優先於本文轉述。

阿里巴巴官方來源:

Alibaba Cloud — Qwen3.8-Max 正式發布新聞稿

第三方技術與市場分析:

VentureBeat — Qwen3.8-Max Agent 基準與開源授權待公布

SiliconANGLE — 2.4T 參數與 Frontend Code Arena 對照

TechCrunch — Apple Intelligence 中國版接入 Qwen

eesel AI — Qwen3.8-Max vs Kimi K3 權重與定價對照

常見問題 FAQ

Qwen3.8-Max 權重現在能下載嗎?

截至 8 月 4 日尚不能。GA 僅開放 API 與 QwenWork;官方承諾下週在 Hugging Face 與 ModelScope 釋出 Qwen3.8-Max 與 Qwen3.8-27B,授權條款尚未公布。

為何首頁標 Open-Source 卻有爭議?

qwen.ai 已標 Open-Source,但 repo、license 與 model card 皆空。對照 K3 已釋權重、DeepSeek V4-Flash 已 MIT 開源,社群認為在檔案上架前不應與真開源模型同列。

與 Kimi K3 該怎麼選?

若今天就要自架或審計權重,K3 已可用;若優先長上下文 API 定價與 QwenWork 生態,可先測 Qwen3.8-Max API,並等待下週授權條文再決定是否遷移自架。

Apple Intelligence 中國版會用哪個模型?

網信辦 7 月 15 日核准備案後,阿里巴巴確認 Qwen 接入中國市場 Apple Intelligence 的生成式能力;具體上線時程仍待 Apple 公告,但分發規模可能遠超獨立開發者 API。

8 月 3 日的 GA 讓 Qwen3.8-Max 站上 Arena 前五與 Agent 基準話題中心,卻未消除營運摩擦:權重未釋、授權未明、Open-Source 標籤與工程事實仍有落差——多數團隊仍應以 API 驗證為主,這是合理選擇。對 Apple Silicon 工作流而言,關鍵是一台可 wipe 重來的乾淨主機:對照 Kimi K3 與 DeepSeek 路由、記錄 Qwen Agent 呼叫、避免污染日常筆電。KVMFLUX 按天租用的 Mac mini M4 提供 Root 權限與數分鐘內 SSH 連線,在權重與 GPU 叢集就緒前是最划算的 API 對照測試場域。

在真實 Apple Silicon 上對照 Qwen API

按天租用 Mac mini M4,接入 Qwen3.8-Max API 與 Agent 客戶端,評估完成即可清空環境。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按週$52.2 /週
按月$96.7 /mo
按季$263 /季