2026年8月9日,硬件研究者克里斯托弗·多马斯近日推出一项名为“CPU反优化”的实验计划,旨在系统性发掘x86架构中执行延迟最高的单条原生指令。目前该项目确认最慢指令为fxrstor64,单次执行耗时约62秒,对应约1980亿个CPU周期。
不同于常规性能优化路径,该计划反向聚焦于指令执行效率的极限下限,通过深入探查底层硬件行为,定位并放大特定指令的延迟特性。通常,指令延迟分析服务于处理器微架构改进或软件性能调优,而此项工作则刻意构建极端低效场景,以揭示硬件设计中的隐性边界条件。
fxrstor64本用于恢复SIMD运算所需的寄存器上下文,常规情况下从内存读取512字节状态数据仅需数十个周期。其延迟激增的关键在于数据来源路径的选择。研究人员首先借助自主开发的工具mmiotic,在处理器内部PCIe互连结构中精准识别出具有极高访问延迟的物理地址区域;随后强制fxrstor64从此类区域加载全部512字节数据,仅此一步即消耗约740亿个CPU周期,耗时逾23秒。
为进一步延长执行时间,实验引入多核协同干扰机制:若干核心持续轮询另一组高延迟内存地址,有效占满PCIe根复合体的数据通路,导致fxrstor64的状态恢复请求被迫进入长队列等待,最终将总执行时间推升至62秒。
后续阶段拟在搭载Sapphire Rapids微架构的平台上线测试xrstor64指令。该指令支持AMX扩展,状态数据区容量扩展至8KB。基于当前延迟增长趋势推演,单次执行周期有望突破1万亿。
榜单评定遵循严格标准:仅计入指令自身完成所需时间,排除可被中断的指令;不采纳仿真环境下的模拟执行结果;所有测量值均按CPU标称基础频率归一化处理;严禁任何形式的硬件物理改装。
该项目下一步将延伸至ARM与RISC-V指令集架构,建立跨平台、同标准的反优化指令延迟基准体系。

评论
更多评论