阿里 Qwen3.8-Max 正式发布

2.4 万亿参数 · Arena 文本第五 · 千问办公 · 开源承诺 · Kimi K3 / DeepSeek V4 横比

阿里巴巴 Qwen3.8-Max 旗舰大模型 Arena 竞技场排名

2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max(GA 全量可用),总参数 2.4 万亿、激活 950 亿、上下文 100 万 token,并同步上线 Agent 产品「千问办公」。若你正纠结「开源标签是否可信」「与 Kimi K3DeepSeek V4-Flash 如何选型」,或需要把 Qwen API 接入现有 Agent 工具链,本文将用时间线、核心数据表、横向对比、六步 Runbook 与开源争议拆解给出可执行结论。数据截止:2026-08-04

01

从预览版到 GA:两周内发生了什么?

国产万亿参数模型在 2026 年 7 月进入密集发布期。Qwen3.8-Max 的正式 GA 并非孤立事件,而是与 Kimi K3、DeepSeek V4-Flash 形成直接对照——理解时间线,才能判断「全球第一梯队」说法目前有多少独立证据支撑。

  1. 01

    7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告路线。详见 Kimi K3 全面开源解读

  2. 02

    7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数、未提供跑分表,服务条款禁止自动化生产环境调用。

  3. 03

    7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源部分底层基础设施。

  4. 04

    7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变,靠架构与训练优化让智能体、代码类基准大幅超过自家 V4-Pro 预览版。

  5. 05

    8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线;阿里港股当日上涨约 7%,美股上涨约 4.5%。

  6. 06

    预计 8 月 10 日前后:官方口径「下周」开放 Qwen3.8-Max 及精简版 Qwen3.8-27B 权重至 Hugging Face 与 ModelScope,截至发稿具体日期与开源协议均未公布。

技术团队在跟进此类发布时,常陷入五重盲区:

  1. 01

    「开源」标签超前:官网已标注 Open-Source,但 Hugging Face / ModelScope 尚无对应仓库。

  2. 02

    跑分全部自测:PaperBench、RecreationBench 等多为阿里自建基准,第三方尚未复现 GA 版数据。

  3. 03

    激活参数披露滞后:预览阶段未公开,GA 才补充「950 亿」,透明度曾遭独立评测机构批评。

  4. 04

    本地部署幻想:2.4T 总参数需多节点数据中心级硬件,个人开发者应等待 Qwen3.8-27B。

  5. 05

    Agent 长任务验证局限:16 天自主编码等案例多为厂商自建评测,公开可复现程度有限。

02

Qwen3.8-Max 核心数据一览

项目Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价(国际)输入 $2/百万 token,输出 $6/百万 token
国内定价输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场(8/1 快照)第 5 名,1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代 +28.2)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

表中带「阿里自测」标注的数据均来自官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台对正式版的独立复现结果。Arena 上的 1496 分亦标注为 Preliminary(初步)。

03

六步接入 Runbook:API、推理档位与 Agent 工具链

Qwen3.8-Max API 已兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。以下为从零评估到生产的六步 Runbook:

  1. 01

    明确任务与成本边界:区分 API 调用(按激活参数计费)与本地私有化(需等待 Qwen3.8-27B 或数据中心级集群)。长上下文任务优先评估缓存命中率对账单的影响。

  2. 02

    开通 QwenCloud / 百炼账户:在阿里云 Model Studio 创建 API Key,确认速率限制与区域可用性。

  3. 03

    选择接口协议:OpenAI 兼容端点用于现有 SDK;Anthropic 兼容端点可通过 reasoning.effort 字段调用 low/medium/xhigh 三档推理强度(默认 xhigh)。

  4. 04

    配置 reasoning_effort:简单任务用 low 控制延迟与成本;复杂 Agent 长任务用 xhigh,或通过原生 enable_thinking 参数启用思考模式。

  5. 05

    接入 Agent 宿主环境:将 base URL 指向 Qwen 端点,在 OpenClaw / Claude Code 等工具中验证工具调用与多轮对话稳定性;生产环境避免在预览条款下运行。

  6. 06

    建立 A/B 基准与回退路由:用自有业务样本对比 Kimi K3、DeepSeek V4 API 的延迟、成本与成功率;配置主备模型路由,待第三方独立评测发布后再调整默认档位。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_dashscope_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "分析这段代码架构..."}],
    extra_body={"enable_thinking": True}
)
04

横向对比:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

模型厂商总/激活参数上下文定价(入/出,$/M)权重开源独立第三方评测
Qwen3.8-Max阿里巴巴2.4T / 950 亿100 万$2 / $6未开源(承诺中)暂无
Kimi K3月之暗面2.8T / ~500 亿~104.8 万$3 / $15已开源(7/27)Artificial Analysis ≈57.11
DeepSeek V4-FlashDeepSeek未变(较 V4-Pro)100 万未公开完整表已开源9 项 Agent/代码基准超 V4-Pro
Claude Opus 5Anthropic未公开100 万$5 / $25闭源Arena 前列
Claude Fable 5Anthropic未公开100 万$10 / $50闭源Arena 文本第 1

架构效率:大容量、低激活

Qwen3.8-Max 通过稀疏 MoE 把总参数做到 2.4 万亿,实际激活控制在 950 亿——推理成本更接近千亿级模型,这也是 API 定价明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)的原因。Kimi K3 与 DeepSeek 系列均更早公开激活参数量;阿里直到 GA 才补充披露,是预览阶段「透明度不足」争议的核心之一。

唯一独立盲测:与 Kimi K3 互有胜负

一家评测机构让 Qwen3.8-Max 预览版与 Kimi K3 处理同一组 269 个文件的真实项目架构设计任务(盲审打分):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于同档位、互有胜负,而非全面碾压。

「开源」标签挂得比权重早:qwen.ai 在 GA 当天已标注 Open-Source,但 Hugging Face 与 ModelScope 尚无仓库、许可证或确切上线时间。所有跑分均来自阿里自建测试框架;对比表脚注还暗示竞品 Fable 5「可能涉及 fallback」,而阿里自身测试方法论同样未公开到可第三方复现程度。

05

行业背景、硬核数据与选型收束

  • 万亿参数扩产年:2026 年 4 月 DeepSeek V4-Pro 1.6T 起步,7 月 Kimi K3 2.8T 登顶开源规模纪录,7/31 V4-Flash 证明不靠堆参数也能大幅提升 Agent 能力——参数竞赛叙事正被架构效率竞赛取代。
  • 阿里罕见回归开源:此前几代千问 Max 级模型走闭源路线,此次首次承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「集体开放权重」格局。
  • 消费端落地:千问已通过苹果合作成为国行 Apple Intelligence 核心生成式 AI 引擎(经压缩可在 iPhone 15+ 本地运行),详见 Apple Intelligence 中国版解读
  • 资本市场反应:发布当日阿里港股涨约 7%、美股涨约 4.5%,市场将其解读为阿里重掌 AI 叙事主动权。
  • 中美监管对照:同期 OpenAI、Anthropic 披露 Agent 越狱入侵真实企业系统,白宫 8/4 召集巨头商讨自愿性网络安全测试框架——中国加速开源 vs 美国收紧 Agent 监管形成鲜明反差。

Qwen3.8-Max 确实是与 Kimi K3 同档位的前沿模型,但「稳压 GPT-5.6 Sol 和 Fable 5」目前主要还是阿里的一面之词——需等权重落地与第三方跑分上线后再下结论。

纯 API 调用可接入 Qwen3.8-Max 推理,但 iOS 签名链、Xcode 本地构建、Metal 推理与 7×24 Agent 长跑仍依赖实体 macOS 节点——笔记本难以稳定常驻 OpenClaw / Claude Code 宿主,虚拟机则有性能损耗与 EULA 风险。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon、root 权限与可预测月租,可与 Qwen API 形成「云端推理 + 本地构建」互补架构。更多大模型定价背景见 GPT-5.6 API 降价解读

参考资料:阿里云官方博客 · Arena.ai 排行榜 · Apidog · TechNode · SiliconANGLE · Apple Intelligence 中国版报道。发布前请以官方最新公告、开源时间及跑分数据为准。

FAQ

常见问题

API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,官网虽标注 Open-Source,Hugging Face / ModelScope 仓库与开源协议预计 8 月 10 日前后公布,具体以官方公告为准。

目前没有权威统一评测。唯一独立盲测显示 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,互有胜负。Kimi K3 优势是已开源并有第三方数据;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。

需区分总参数与激活参数。API 调用成本接近千亿级模型;本地私有化完整版需多节点数据中心。更现实的选择是等待同期开源的 Qwen3.8-27B,或搭配 Mac Mini M4 云端租赁 作为 Agent 构建宿主。

可作为参考,不能当作定论。数据来自阿里自建框架(含 QwenSWEBench、RecreationBench 等),尚无中立平台对正式版独立复现。建议关注后续复测,或在自有业务场景做 A/B 测试。

除开发者获得更便宜的旗舰 API 外,国行 iPhone 的 Apple Intelligence 生成式能力基于经压缩的 Qwen 模型本地运行——用户无需主动选择即可在系统层面用到千问系列能力。部署细节见 帮助中心