2026年8月7日,权威测评机构SuperCLUE发布第二期XClaw龙虾智能体综合评估榜单。本次测评覆盖十款主流国产办公类人工智能产品,所有参评模型在三次重复测试中的平均得分均超过九十一分,整体能力水平显著提升。其中,百度文心助手以总分九十七点六二分位居榜首,小米MiMo Claw以九十七点四九分紧随其后,位列第二。
测评体系全面对标真实职场场景,围绕五大核心能力展开:数据处理、内容创作、记忆能力、代码开发与研究分析。为确保结果客观可靠,每项任务均独立执行三次,最终成绩取三次得分的算术平均值,有效规避偶然性因素干扰。
从整体表现看,十款产品的平均分为九十四点五三分,首尾差距仅为六点三一分;排名前四的产品得分全部突破九十六分,彼此之间竞争极为胶着。尤其值得注意的是,第二名与第三名之间仅相差零点一三分,反映出头部产品在综合能力上的高度趋同。
细分维度表现差异明显:内容创作与记忆能力两项得分普遍接近满分,表明各产品在撰写常规文案、维持长对话上下文连贯性等基础办公任务上已趋于成熟稳定;数据处理与行业调研能力次之;而代码开发则成为拉开差距的关键领域——该维度行业平均分仅为八十六点九九分,最高分与最低分相差达十七点五九分。小米MiMo Claw在此项中表现突出,获得九十七点二二分,大幅领先其余产品。
稳定性作为本次测评的重要考察维度,通过三次测试分数的标准差进行量化评估。腾讯WorkBuddy与MaxClaw在该指标上表现最优,输出一致性高,结果可预期性强;而部分总分靠后的模型则存在较大波动,同一指令多次执行结果差异显著,实际办公中易引发操作风险。
当前,国产办公AI已跨越基础功能验证阶段,进入比拼细节处理精度、系统运行稳定性及垂直领域专业能力的新阶段。日常文档撰写、简易表格运算等通用任务,多数产品均可胜任;但在高频数据处理、复杂程序编写等高要求场景下,文心助手、MiMo Claw等头部产品展现出更强的适配性与可靠性,更契合企业级办公的实际需求。

评论
更多评论