中关村在线

热点资讯

CPU反优化实验发现x86最慢指令fxrstor64,单次执行耗时62秒

2026年8月9日,硬件研究者克里斯托弗·多马斯近日推出一项名为“CPU反优化”的实验计划,旨在系统性发掘x86架构中执行延迟最高的单条原生指令。目前该项目确认最慢指令为fxrstor64,单次执行耗时约62秒,对应约1980亿个CPU周期。

不同于常规性能优化路径,该计划反向聚焦于指令执行效率的极限下限,通过深入探查底层硬件行为,定位并放大特定指令的延迟特性。通常,指令延迟分析服务于处理器微架构改进或软件性能调优,而此项工作则刻意构建极端低效场景,以揭示硬件设计中的隐性边界条件。

fxrstor64本用于恢复SIMD运算所需的寄存器上下文,常规情况下从内存读取512字节状态数据仅需数十个周期。其延迟激增的关键在于数据来源路径的选择。研究人员首先借助自主开发的工具mmiotic,在处理器内部PCIe互连结构中精准识别出具有极高访问延迟的物理地址区域;随后强制fxrstor64从此类区域加载全部512字节数据,仅此一步即消耗约740亿个CPU周期,耗时逾23秒。

为进一步延长执行时间,实验引入多核协同干扰机制:若干核心持续轮询另一组高延迟内存地址,有效占满PCIe根复合体的数据通路,导致fxrstor64的状态恢复请求被迫进入长队列等待,最终将总执行时间推升至62秒。

后续阶段拟在搭载Sapphire Rapids微架构的平台上线测试xrstor64指令。该指令支持AMX扩展,状态数据区容量扩展至8KB。基于当前延迟增长趋势推演,单次执行周期有望突破1万亿。

榜单评定遵循严格标准:仅计入指令自身完成所需时间,排除可被中断的指令;不采纳仿真环境下的模拟执行结果;所有测量值均按CPU标称基础频率归一化处理;严禁任何形式的硬件物理改装。

该项目下一步将延伸至ARM与RISC-V指令集架构,建立跨平台、同标准的反优化指令延迟基准体系。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具