二零二六年八月十三日,DeepSeek于前日夜间悄然发布DeepSeek V4-Pro-0813正式版本。官方测试数据显示,该版本在多项基准指标中取得显著进步,整体表现已非常接近Fable 5模型。
这一进展引发广泛关注,部分用户称“梁圣”之名再度回归。然而,随着更多独立第三方测试结果陆续公开,V4-Pro-0813的实际表现呈现出一定落差:相较于此前的预览版本确有提升,但尚未达到用户普遍期待的高度,亦未完全复现官方测试所展示的性能水准。
据官方披露,在Terminal Bench 2.1评测中,V4-Pro-0813获得八十七点九分,仅比Fable 5低零点一分;另有若干子项甚至略胜一筹。从这一角度看,其综合能力确实已逼近Fable 5。
但实际应用层面的反馈则趋于分化。Artificialanalysis平台给出的评分为五十三分,虽属优异水平,却仅比V4-Flash-0731高出一分。值得注意的是,Flash版本参数量为两千八百四十亿,而Pro版本达一万六千亿,体量相差逾四倍。尽管参数规模增长并不必然带来同等比例的性能跃升,但当前结果仍难契合多数用户对大幅进阶的合理预期,也未能充分展现官方测试中所呈现的潜力。
多方测试反馈显示,不同用户在鹈鹕骑自行车、糖果、密码等典型场景下的体验存在明显差异,部分测试结果与旧版相当,未见明显跃升。一种较合理的推测是,该版本尚未完成全量部署——官方信息页面至今仍未更新,最新日志仍停留于V4-Flash-0731阶段。
另一种可能性在于,V4-Pro-0813的完整性能释放需依托DeepSeek官方配套工具DeepSeek Harness。业内共识表明,优质推理框架对大模型实际表现具有关键影响,而该工具对V4-Pro-0813的优化效果,极有可能是其达成最优性能的前提条件。
此外也不排除一种现实判断:V4-Pro-0813的真实能力即为此刻所见。V4-Flash-0731此前展现出的高效率与强泛化力,或属特定技术路径下的阶段性突破;而V4-Pro-0813虽参数量更大,但相较Fable 5及国产K3模型仍有一定差距,难以再现以小博大的奇迹式表现。
价格方面,V4-Pro-0813的API调用费用为Flash版本的三倍。若后续全量上线后,其性能无法稳定达到Fable 5级别,则V4-Flash-0731仍将是绝大多数用户的首选方案。该版本不仅性价比突出——即便价格翻倍,仍足以应对日常九成五以上的使用需求,包括编程开发等中高强度任务——且稳定性与成熟度经过充分验证,具备更强的实用价值。

评论
更多评论