2026年10月2日,Linux内核7.4版本正式集成一项面向AMD平台的性能优化机制,代号PerfOpt。该机制专为搭载Radeon集成显卡的APU设计,允许其在本地运行大语言模型时,绕过IOMMU硬件地址翻译单元,直接读写系统主内存,从而显著提升内存访问效率。
此项优化由IOMMU子系统核心维护者于9月24日合并入主线代码。系统启动过程中,AMDGPU驱动将自动识别APU是否运行于Identity Domain模式,并据此启用PerfOpt;该机制对独立显卡无影响,仅作用于集成显卡场景。
实测数据显示,集成显卡通过GTT(Graphics Translation Table)区域访问动态分配的系统内存时,原始延迟约为固定预留显存的两到三倍;启用PerfOpt后,GTT访问延迟压缩至预留显存延迟的十分之一以内。
在大语言模型推理任务中,受限于轻薄本有限的显存容量,模型权重与激活数据往往无法全部驻留于预留显存,大量计算需依赖GTT映射的系统内存。正因如此,PerfOpt在AI负载下展现出突出收益。
基于Linux 7.3内核叠加相关补丁构建的测试环境,对三款不同定位的APU进行了全面验证:锐龙AI 9 365平台实现最高23%的AI吞吐量提升,首Token响应速度亦同步改善;锐龙AI 5 340搭载Radeon 840M核显,各项指标提升幅度均不低于18%;而旗舰级锐龙AI Max+ 395平台在Framework Desktop整机上配备64GB LPDDR5-8000内存,典型场景提升幅度收窄至2%—4%,个别测试项甚至出现未启用优化时性能略优的情况。
当前验证范围限定于采用Zen 5 CPU架构与RDNA 3.5核显的APU组合。针对前代产品如锐龙7040系列或Steam Deck所用Van Gogh定制芯片,是否支持该机制尚无明确结论。
该补丁共新增341行代码,分布在8个源文件中,其最终整合方式及在后续稳定版内核中的呈现形态,仍有待进一步确认。

评论
更多评论