Qwen3.8-Max 模型亮点数据
A小码哥
2026年08月08日 23:37

Qwen3.8-Max 是阿里巴巴于 2026年8月3日 正式发布的新一代基座大模型。作为千问系列中规模最大、性能最强的旗舰版本,本次更新在模型架构、核心能力以及商业生态上均实现了显著突破。以下是本次更新的核心亮点及对应的测试指标数据:

![](https://fastly.jsdelivr.net/gh/bucketio/img3@main/2026/08/08/1786203141759-2de5d677-ad39-467b-a994-52a8c1ee1704.png)

### 一、 本次核心更新亮点

1. 架构与参数规模跃升

模型基于 Qwen3.5 架构构建,采用前沿的稀疏混合专家(MoE)架构与混合注意力机制。**总参数量突破 2.4 万亿(2.4T),但在实际推理时仅激活 950 亿(95B)参数**。这种创新设计使模型推理效率提升 30%,推理速度加快 25%,在保持顶尖性能的同时有效控制了计算成本。

2. 支持原生多模态与超长上下文

Qwen3.8-Max 首次支持视觉理解功能,实现了多模态视觉生产力(涵盖教育解题、视频理解与三维创作等)。同时,上下文处理长度扩展至 1M Tokens,大幅提升了长文本处理与复杂多轮对话的连贯性。

3. 长周期自主编程与办公能力突破

模型的能力重心向长周期自主任务倾斜。在编程方面,实现了从零自主开发完整项目的突破,可基于空文件夹自动完成持续十余天的真实项目开发,全程无需人工干预。在专业办公方面,通过真实环境与算力的联合强化训练,模型在法律咨询、金融分析、文档处理等 200 余种高频专业任务中表现出色,能稳定输出符合生产标准的成果。

4. Max 级别模型首次开源

与历代 Max 级模型仅通过 API 提供服务不同,官方宣布 Qwen3.8-Max 将于下周正式开放源代码(权重在 Hugging Face 和 ModelScope 发布),同期还将开源 270 亿参数的 Qwen3.8-27B 版本。

### 二、 核心测试指标与基准测试数据

根据官方自测及第三方权威榜单数据,Qwen3.8-Max 在多项核心指标上表现优异:

1. 第三方权威榜单排名

* Text Arena(文本综合评测):综合性能跻身全球顶尖行列,排名第五,仅次于 Anthropic 的 Claude 系列。

* Vision Arena(视觉评测):排名全球第二。

* Frontend Code Arena(前端代码评测):排名全球第四。

* Artificial Analysis Agentic Index(智能体能力):以 55.4 分位列全球第一,超越 Claude Opus5 和 GPT5.6,首次为中国模型拿下该榜单冠军。

2. 核心基准测试(Benchmark)得分

* PaperBench(科研复现/论文能力):得分 93.0,较上代大幅提升 28.2 分,超越 Anthropic Fable 5(88.8)和 GPT-5.6 Sol(90.5)。

* IFBench(指令遵循):得分 82.8,大幅领先 Fable 5(63.5)。

* OSWorld-Verified(智能体电脑操作能力):得分 86.1,位居主流模型首位,超越 Fable 5(85.0)。

* GPQA Diamond(科学推理):取得 92.6 分。

* BabyVision(视觉推理):在无工具条件下取得 82.0 分,超出部分主流模型近两倍。

* CoWorkBench(通用协作):得分 74.8,与 Fable 5(75.9)差距极小。

* WideSearch(通用智能体评测):得分 81.9

3. 部分工程实现基准(存在差距)

* SWE-bench Pro(真实软件工程):得分 67.7,低于 Claude Fable 5 的 80.0。

* Terminal Bench 2.1:得分 86.6,低于 GPT-5.6 Sol 的 88.8。

4. 长周期任务实战指标

* 自主编程:在完全无人工干预的环境下独立运行约 16 天,留下 265 次 commit 与 127 个 PR,产出名为“oh-my-cli”的自进化智能体框架。

* 科研复现:连续工作约 125 小时、编写约 7,600 行代码、完成 33 轮 GPU 训练,先复现目标论文结论,再经四轮探索取得高于原方法 2.71 分的结果。

* 芯片设计优化:在芯片设计沙箱内历经约 500 轮交互,将硬件门数由 8,298 门精简至 678 门。

### 三、 API 定价与商业化更新

Qwen3.8-Max 的 API 服务已同步登陆千问AI平台。国内市场定价为每百万 Tokens 输入 12 元,输出 36 元,隐式缓存命中价格低至 1.5 元。国际市场定价极具竞争力,输入与输出价格分别仅为 Opus5 的 40% 和 24%,在保持相近智能水平的同时提供了更高的性价比。