中关村在线

热点资讯

RTX 5090显卡推理快但显存受限,M5 Max大内存长上下文更优

博主Alex Ziskind近期发布了一组本地人工智能推理性能对比测试结果,涉及两款高端设备:配备RTX 5090移动版显卡(24GB显存)的雷蛇灵刃18笔记本,以及搭载苹果M5 Max芯片、具备128GB统一内存的设备。

在中小规模语言模型(参数量为12B至35B)的常规推理任务中,RTX 5090展现出显著性能优势。以Gemma 4 12B模型为例,其推理速度达到4110 tokens/秒,比M5 Max的1762 tokens/秒高出约133%;在Qwen3.5 27B模型中,领先幅度达109%;即便在参数量达35B的Qwen3.6 35B A3B模型下,RTX 5090仍保持32%的速度优势。

然而,当测试转向超大规模模型或超长上下文场景时,格局发生明显变化。在Qwen3 4B模型配合26万token上下文长度的测试中,RTX 5090受限于24GB显存容量,推理速度急剧下滑至25.28 tokens/秒;而M5 Max凭借其大容量统一内存,维持了181.40 tokens/秒的稳定输出,速度约为前者的近七倍。

同一硬件平台的上下文长度敏感性也十分突出:当上下文扩展至68K token时,RTX 5090尚可实现160.36 tokens/秒的处理速度;但当上下文进一步增至262144 token时,受显存物理上限制约,其吞吐量暴跌84.2%,最终仅维持在21至25 tokens/秒区间。

综合来看,若应用场景以高频、短文本生成为主,RTX 5090仍是更具效率的选择;但若任务涉及超长文档理解、多轮深度分析等对内存容量高度依赖的场景,则显存规模的重要性或将超越峰值算力本身。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具