2026年8月6日,SuperCLUE发布2026年7月中文大语言模型综合能力评测结果,共计12款国产主流模型参与本次评估。
在综合总分排名中,Qwen3.8-Max以71.48分位居榜首,Kimi-K3以70.68分紧随其后,两者差距仅为0.8分;豆包Doubao-Seed-2.1-pro获得65.95分,位列第三;DeepSeek-V4-Flash以65.6分排在第四;DeepSeek-V4-Pro得分为64.4分,居第五位。
本次评测对评估体系进行了重要升级,将传统代码生成任务全面转向智能体编程能力测试,该项权重提升至25%,更真实反映模型在实际软件开发场景中的表现。其余五项指标及其权重分别为:数学推理(18%)、科学推理(16%)、精确指令遵循(16%)、幻觉控制(16%)、智能体任务规划(9%)。最终得分由六大维度加权计算得出。
细分能力表现呈现明显差异化特征:在智能体编程维度,Kimi-K3以75.79分拔得头筹,展现出在工程化代码生成与多轮交互式开发中的突出优势;Qwen3.8-Max以68.42分位列第二。数学推理方面,DeepSeek-V4-Flash以78.95分领先;科学推理得分最高的是豆包Doubao-Seed-2.1-pro,达77.19分。幻觉控制与智能体任务规划两项中,Qwen3.8-Max显著领先,信息准确性高,复杂任务拆解能力更为成熟。
除综合能力外,推理效率与成本效益亦成为关键参考维度。DeepSeek-V4全系列模型整体处于高性价比区间,API调用价格合理,推理质量稳定;其中DeepSeek-V4-Flash、GLM-5.2与Hy3三款模型同时具备高效能特性,响应延迟低、计算耗时短。相较之下,综合得分位居前两位的Qwen3.8-Max与Kimi-K3虽在多项能力上表现优异,但单次推理响应时间偏长,属于低效能梯队,Kimi-K3的平均耗时甚至达到最快模型的三倍。
面向不同使用场景,模型选择建议如下:预算有限且需高频批量处理任务的开发者,可优先考虑DeepSeek系列;日常办公、内容创作及对信息真实性要求较高的用户,Qwen3.8-Max更为适配;而面向专业级工程开发、长期承担复杂编码任务的程序员,则Kimi-K3的交互体验与编程支持能力更具优势。

评论
更多评论