Grok 4.6与DeepSeek V4 Pro同日更新:模型竞争开始同时比较能力和成本
晴栀chC
2026年08月13日 11:12

8月12日,SpaceXAI旗下xAI正式推出Grok 4.6。与此同时,DeepSeek也将DeepSeek V4 Pro正式版更新至0813版本。两款模型都公布了较为亮眼的测试结果,但解读这些数据时,需要先看清测试项目和统计口径。

DeepSeek V4 发布,全网最细解读 & 技术报告拆解 | 人人都是产品经理

xAI官方数据显示,Grok 4.6 High在Artificial Analysis Intelligence Index上获得61分,与GPT-5.6 Sol Max的61分相同。该指数由多个推理、知识和编程测试组成,因此可以说明两款模型在这一综合评估中的得分相同,但不能据此认定两款模型在所有任务中的能力完全一致。

具体来看,Grok 4.6在CursorBench 3.2中获得69.9%,高于GPT-5.6 Sol Max的67.2%;在DeepSWE 1.1中获得65.9%,则低于GPT-5.6 Sol Max的73%。在其他知识工作、终端操作和编程测试中,两款模型也各有不同表现。

这说明“跑分持平”只适用于特定综合指数。用户选择模型时,还要结合编程、长任务、图像处理、响应速度、上下文长度和价格等具体需求。

Grok 4.6主要加强了长周期智能体、复杂编程及交互式项目能力。xAI表示,该模型能够在多个步骤中持续处理研究、代码分析和应用开发任务。目前,Grok 4.6已经在Cursor、Grok Build、API及部分合作平台上线。

DeepSeek V4 Pro正式版的API版本则更新为DeepSeek-V4-Pro-0813,原有调用名称保持不变。根据官方文档,新版本支持思考与非思考模式,提供100万Token上下文,最大输出长度为38.4万Token,并支持工具调用、JSON输出、Responses API及Anthropic兼容接口。

素材中提到DeepSeek V4 Pro在多项测试中的表现接近Fable 5。更准确地说,根据目前公布的数据,两者在Terminal Bench和CyberGym等部分智能体测试中差距较小,但在DeepSWE、HLE及全栈数据分析等测试中仍存在差距。因此,“部分测试接近”不能扩大为整体能力全面相当。

此外,模型开发商公布的测试结果通常使用特定推理强度、工具配置和运行环境。用户在真实业务中获得的效果,还会受到提示词、上下文长度、软件框架及任务类型影响。公开跑分可以作为参考,却不能完全代替实际测试。

两款模型的更新共同反映出,大模型市场的评价方式正在变化。企业不再只关注模型能否回答问题,而是开始比较它能否持续执行任务、调用工具、完成代码修改,并在合理成本下稳定运行。

因此,Grok 4.6与DeepSeek V4 Pro的意义,不只是榜单上多了两个新版本。真正值得观察的,是它们在实际开发、企业办公和智能体任务中的稳定性,以及高测试得分能否转化为可重复的生产效率。