中关村在线

热点资讯

Hermes Index发布:聚焦性能与成本双维度的大模型评测新标准

2026年10月7日,全球已涌现出多个大型语言模型评测榜单,多数侧重于模型的基础能力表现。然而对于熟悉OpenCalw、Hermes等开源生态的用户而言,仅关注性能指标显然不够全面。为此,Hermes团队推出了全新评估体系——Hermes Index榜单。

该榜单在衡量模型时兼顾两项核心维度:一是综合性能水平,分数越高代表能力越强;二是单任务执行成本,数值越低说明单位效率越高。排名以性能为首要依据,同时将成本作为关键参考。

当前榜单中,Opus 5.5位居首位,单任务成本为4.99美元;GPT-6 Astra紧随其后,位列第二,但单任务成本高达11.61美元,是参评模型中价格最高的一个。榜单前列主要由Anthropic与OpenAI研发的模型占据。国产模型中表现最佳的是GLM-5.3,排名第六;其余八个席位也均由国内团队开发的大模型包揽。

DeepSeek V4.1 Flash在综合排名中并不靠前,但单任务成本仅为0.259美元,显著低于多数竞品。若进一步考察性价比,GPT-6 Luna更具优势:其单任务成本不足V4.1 Flash的一半,性能却几乎持平。目前性价比最优的模型是蚂蚁集团发布的Ling 3.0 Flash,单任务成本低至0.054美元,尽管性能得分相对偏低。该模型在Hermes平台提供免费使用服务,每日有一定调用额度限制。

整体来看,预算充裕的用户可优先选择Opus 5.5;若需兼顾成本与实用性,国内场景下V4.1 Flash仍是优选;海外用户则可重点关注GPT-6 Luna。对零成本需求明确的用户,Ling 3.0 Flash免费版是理想选择;其升级版本Ling 3.1 Flash已正式发布,基准测试成绩已超越V4.1 Flash,官网当前仍提供一定期限的免费试用机会。

展开全文
人赞过该文 赞
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具