2.4 万亿参数 · Arena 文本第五 · 千问办公 · 开源承诺 · Kimi K3 / DeepSeek V4 横比
2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max(GA 全量可用),总参数 2.4 万亿、激活 950 亿、上下文 100 万 token,并同步上线 Agent 产品「千问办公」。若你正纠结「开源标签是否可信」「与 Kimi K3、DeepSeek V4-Flash 如何选型」,或需要把 Qwen API 接入现有 Agent 工具链,本文将用时间线、核心数据表、横向对比、六步 Runbook 与开源争议拆解给出可执行结论。数据截止:2026-08-04
国产万亿参数模型在 2026 年 7 月进入密集发布期。Qwen3.8-Max 的正式 GA 并非孤立事件,而是与 Kimi K3、DeepSeek V4-Flash 形成直接对照——理解时间线,才能判断「全球第一梯队」说法目前有多少独立证据支撑。
7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告路线。详见 Kimi K3 全面开源解读。
7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数、未提供跑分表,服务条款禁止自动化生产环境调用。
7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源部分底层基础设施。
7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变,靠架构与训练优化让智能体、代码类基准大幅超过自家 V4-Pro 预览版。
8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线;阿里港股当日上涨约 7%,美股上涨约 4.5%。
预计 8 月 10 日前后:官方口径「下周」开放 Qwen3.8-Max 及精简版 Qwen3.8-27B 权重至 Hugging Face 与 ModelScope,截至发稿具体日期与开源协议均未公布。
技术团队在跟进此类发布时,常陷入五重盲区:
「开源」标签超前:官网已标注 Open-Source,但 Hugging Face / ModelScope 尚无对应仓库。
跑分全部自测:PaperBench、RecreationBench 等多为阿里自建基准,第三方尚未复现 GA 版数据。
激活参数披露滞后:预览阶段未公开,GA 才补充「950 亿」,透明度曾遭独立评测机构批评。
本地部署幻想:2.4T 总参数需多节点数据中心级硬件,个人开发者应等待 Qwen3.8-27B。
Agent 长任务验证局限:16 天自主编码等案例多为厂商自建评测,公开可复现程度有限。
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(国际) | 输入 $2/百万 token,输出 $6/百万 token |
| 国内定价 | 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元 |
| Arena 文本竞技场(8/1 快照) | 第 5 名,1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型 |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代 +28.2) |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
表中带「阿里自测」标注的数据均来自官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台对正式版的独立复现结果。Arena 上的 1496 分亦标注为 Preliminary(初步)。
Qwen3.8-Max API 已兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。以下为从零评估到生产的六步 Runbook:
明确任务与成本边界:区分 API 调用(按激活参数计费)与本地私有化(需等待 Qwen3.8-27B 或数据中心级集群)。长上下文任务优先评估缓存命中率对账单的影响。
开通 QwenCloud / 百炼账户:在阿里云 Model Studio 创建 API Key,确认速率限制与区域可用性。
选择接口协议:OpenAI 兼容端点用于现有 SDK;Anthropic 兼容端点可通过 reasoning.effort 字段调用 low/medium/xhigh 三档推理强度(默认 xhigh)。
配置 reasoning_effort:简单任务用 low 控制延迟与成本;复杂 Agent 长任务用 xhigh,或通过原生 enable_thinking 参数启用思考模式。
接入 Agent 宿主环境:将 base URL 指向 Qwen 端点,在 OpenClaw / Claude Code 等工具中验证工具调用与多轮对话稳定性;生产环境避免在预览条款下运行。
建立 A/B 基准与回退路由:用自有业务样本对比 Kimi K3、DeepSeek V4 API 的延迟、成本与成功率;配置主备模型路由,待第三方独立评测发布后再调整默认档位。
from openai import OpenAI
client = OpenAI(
api_key="your_dashscope_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "分析这段代码架构..."}],
extra_body={"enable_thinking": True}
)
| 模型 | 厂商 | 总/激活参数 | 上下文 | 定价(入/出,$/M) | 权重开源 | 独立第三方评测 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 亿 | 100 万 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T / ~500 亿 | ~104.8 万 | $3 / $15 | 已开源(7/27) | Artificial Analysis ≈57.11 |
| DeepSeek V4-Flash | DeepSeek | 未变(较 V4-Pro) | 100 万 | 未公开完整表 | 已开源 | 9 项 Agent/代码基准超 V4-Pro |
| Claude Opus 5 | Anthropic | 未公开 | 100 万 | $5 / $25 | 闭源 | Arena 前列 |
| Claude Fable 5 | Anthropic | 未公开 | 100 万 | $10 / $50 | 闭源 | Arena 文本第 1 |
Qwen3.8-Max 通过稀疏 MoE 把总参数做到 2.4 万亿,实际激活控制在 950 亿——推理成本更接近千亿级模型,这也是 API 定价明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)的原因。Kimi K3 与 DeepSeek 系列均更早公开激活参数量;阿里直到 GA 才补充披露,是预览阶段「透明度不足」争议的核心之一。
一家评测机构让 Qwen3.8-Max 预览版与 Kimi K3 处理同一组 269 个文件的真实项目架构设计任务(盲审打分):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于同档位、互有胜负,而非全面碾压。
「开源」标签挂得比权重早:qwen.ai 在 GA 当天已标注 Open-Source,但 Hugging Face 与 ModelScope 尚无仓库、许可证或确切上线时间。所有跑分均来自阿里自建测试框架;对比表脚注还暗示竞品 Fable 5「可能涉及 fallback」,而阿里自身测试方法论同样未公开到可第三方复现程度。
Qwen3.8-Max 确实是与 Kimi K3 同档位的前沿模型,但「稳压 GPT-5.6 Sol 和 Fable 5」目前主要还是阿里的一面之词——需等权重落地与第三方跑分上线后再下结论。
纯 API 调用可接入 Qwen3.8-Max 推理,但 iOS 签名链、Xcode 本地构建、Metal 推理与 7×24 Agent 长跑仍依赖实体 macOS 节点——笔记本难以稳定常驻 OpenClaw / Claude Code 宿主,虚拟机则有性能损耗与 EULA 风险。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon、root 权限与可预测月租,可与 Qwen API 形成「云端推理 + 本地构建」互补架构。更多大模型定价背景见 GPT-5.6 API 降价解读。
参考资料:阿里云官方博客 · Arena.ai 排行榜 · Apidog · TechNode · SiliconANGLE · Apple Intelligence 中国版报道。发布前请以官方最新公告、开源时间及跑分数据为准。
API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,官网虽标注 Open-Source,Hugging Face / ModelScope 仓库与开源协议预计 8 月 10 日前后公布,具体以官方公告为准。
目前没有权威统一评测。唯一独立盲测显示 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,互有胜负。Kimi K3 优势是已开源并有第三方数据;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
需区分总参数与激活参数。API 调用成本接近千亿级模型;本地私有化完整版需多节点数据中心。更现实的选择是等待同期开源的 Qwen3.8-27B,或搭配 Mac Mini M4 云端租赁 作为 Agent 构建宿主。
可作为参考,不能当作定论。数据来自阿里自建框架(含 QwenSWEBench、RecreationBench 等),尚无中立平台对正式版独立复现。建议关注后续复测,或在自有业务场景做 A/B 测试。
除开发者获得更便宜的旗舰 API 外,国行 iPhone 的 Apple Intelligence 生成式能力基于经压缩的 Qwen 模型本地运行——用户无需主动选择即可在系统层面用到千问系列能力。部署细节见 帮助中心。