
昨晚,阿里千问发布并开源 Qwen3.8-Flash,智谱发布并开源 GLM-5.3-Flash。两款模型均采用混合专家架构,覆盖多模态任务,并将推理效率与使用成本作为主要升级方向。


从双方公布的技术资料来看,两款模型在参数规模与架构设计上存在明显差异,产品方向却呈现出较高的一致性。随着大模型进入办公、编程和 Agent 场景,厂商正在同时解决能力、速度与成本问题。模型能否持续完成真实任务,开始与榜单成绩共同影响企业和开发者的选择。
千问提前展示 Qwen4 架构
千问此次开源的 Qwen3.8-Flash-Next 被官方定位为 Qwen4 架构的早期预览。完整的 Qwen4 模型家族尚未发布,部分架构调整已率先向社区开放,以便开发者测试并反馈部署结果。
Qwen3.8-Flash-Next 是一款多模态 MoE 模型,主模型拥有 1250 亿参数,另有 510 亿 N-gram Embedding 参数,每个 Token 激活约 60 亿参数。模型采用 Gated DeltaNet 与 Qwen Sparse Attention 组成的混合注意力架构。Gated DeltaNet 负责压缩历史信息,Qwen Sparse Attention 从长上下文中筛选重要内容,N-gram Embedding 则以较低的额外计算增加模型容量。
上述调整主要指向长上下文场景中的计算效率与显存占用问题。千问方面称,Qwen3.8-Flash-Next 的训练成本约为 Qwen3.7-Plus 的九分之一,同时在编程和办公任务上取得更高的官方评测成绩。

图注:Qwen3.8-Flash-Next 在多项编程、办公和工具调用评测中取得领先成绩
目前,模型权重已上线 Hugging Face 和 ModelScope。QwenWork 将其接入标准模式,Qwen Code 和 QwenCloud API 也提供相应支持。这次发布覆盖开源权重、开发工具、API 服务与办公产品,千问由此获得更广泛的架构验证和社区反馈。
智谱公布牛来模型身份
GLM-5.3-Flash 在正式发布前曾以 Ox-Alpha 的名称在 OpenRouter 和 OpenCode 进行匿名测试,并在中文社区获得“牛来”的称呼。智谱在积累一定规模的真实调用后公布了模型身份。

图注:Ox-Alpha 匿名测试期间位列 OpenRouter 模型调用量第一
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数约 3200 亿,每个 Token 激活约 180 亿参数。模型采用线性注意力与稀疏注意力结合的混合架构,支持百万 Token 上下文。与 GLM-4.5 相比,其激活参数从 320 亿降至 180 亿,模型层数从 92 层减少至 45 层。
智谱方面称,架构调整使 GLM-5.3-Flash 的注意力计算量和 KV Cache 占用在长上下文任务中明显下降。

图注:GLM-5.3-Flash 在 AA 智能指数中获得 57 分,折扣期单任务成本约为 0.045 美元
模型已接入 GLM Coding Plan 和 ZCode,主要面向编程、浏览器操作、电脑操作以及持续时间较长的 Agent 任务。
模型权重已在 Hugging Face 以 MIT 许可证开放。智谱还表示,Ox-Alpha 匿名测试阶段的推理流量全部由国产芯片承载。现阶段尚缺少完整的硬件配置与服务规模数据,实际效率仍有待更多部署案例检验。这次测试至少表明,国产算力已经开始承担直接面向真实用户的大模型推理服务。
两款模型选择了不同的效率路线
Qwen3.8-Flash-Next 更强调下一代架构预览与开发者生态,通过低激活参数、稀疏注意力和额外 Embedding 扩充模型容量。GLM-5.3-Flash 更强调原生多模态、长任务执行与低成本推理,并通过匿名测试积累实际调用数据。
两种设计最终都在降低单次任务的计算成本。普通对话通常在数轮交互后结束,Agent 则需要反复读取文件、制定计划、调用工具、检查结果,并在失败后重新执行。一次复杂任务可能持续几十分钟甚至数小时,模型价格和推理效率会被连续调用放大。
这也是两家公司集中披露激活参数、注意力效率和 API 价格的原因。企业部署模型时,单项评测可以提供能力参考,响应速度、并发水平、稳定性、显存占用和运维费用则决定产品能否规模化使用。
Flash 曾经主要代表速度更快、规模更小的模型版本。随着编程、办公和工具调用成为核心应用,高效率模型开始承担过去由高成本旗舰模型处理的工作。厂商希望通过架构优化压低推理费用,同时尽量保留复杂任务能力。
开源模型地址:
GLM-5.3-Flash:https://huggingface.co/zai-org/GLM-5.3-Flash
Qwen3.8-Flash-Next:https://huggingface.co/Qwen/Qwen3.8-Flash-Next