【ZOL中关村在线原创】如果要用一个关键词去定义2026年已经过去的这段时间里,AI行业发生的巨变,那么"智能体AI"当之无愧。
就在刚刚举办的2026英特尔技术创新与产业生态大会上,英特尔数据中心集团副总裁、中国区总经理陈葆立分享了几组耐人寻味的数字:预计到2026年底,超过80%的企业应用将至少嵌入一个AI智能体;IDC预测,到2031年,中国企业场景中的活跃智能体数量将达到3.5亿个;中国大模型每天的Token调用量已增至2024年初的5000倍,且仍在持续增长。基础设施层面,预计2026年全球AI优化型IaaS支出将增长96%,美银证券则预计到2029年,中国AI数据中心的固定资产投资规模将超过2.2万亿元人民币。
从年初全民“养虾”,到桌面办公智能体软件的瞬间爆火与流行,智能体正在以肉眼可见的速度渗透进每个人的工作和生活之中。但在这些火爆的应用背后,是一次又一次的软件工程创新,以及一场正在数据中心深处发生的算力架构变革。
·软件工程创新,让AI从"对话"走向"执行"
不久之前,AI还只是一个对话框——你问一个问题,它回答一个问题。
而智能体AI的演进,则是由三层软件机制来推动:
首先是Context Engineering(上下文工程):这是AI能够利用更多上下文信息的基础。意味着大模型不再像一个没有记忆的天才,它可以结合长上下文和多轮对话,更好地理解用户的背景,给出更精准的答案。
其次是Harness(工具调用):简单来说,就是给AI配上工具、装上手臂,让它除了出主意之外,还能真正帮你干活、做事。
再来就是Loop Engineering(循环工程):就像一名好学生,拿到题目之后不仅写出答案,还会一次次验证、检查、改进,让答案越来越好。
这一层又一层的软件机制听起来简单,但其中大量工作恰恰适合由CPU来执行。这也正是过大半年时间里,智能体AI兴起带来的对CPU巨大需求的根本原因。当然,市场的反应也极为直观:针对2030年CPU市场规模的预估,在短短半年内就从2026年2月预测的590亿美元上调至8月预测的2100亿美元,达到原预测值的3.6 倍!
与此同时,数据中心AI负载占比预计将从2025年的40%提升至2030年的80%——整个数据中心的架构都将因AI而彻底改变。
·重构数据中心,从Token工厂到AI工厂
面向智能体时代,英特尔把未来的数据中心划分为三类服务器或集群:
其一是CPU服务器/集群负责AI智能体的执行与工作编排;
其二是智算中心(GPU服务器)配备AI加速卡,成为传统意义上的Token 工厂;
其三则是高性能存储集群来承接智能体产生的大量新数据,包括新的分析、资料、文档、合同,以及长对话记录。
这三类集群有一个重要的共同点,就是都需要CPU来做数据调度。
因此,当Token工厂的概念升级为AI工厂时,其核心就不再是一座工厂能生产多少Token,而是整个AI大系统如何以更低的资源消耗、更高的效率,帮助客户完成更多工作。这是一种以任务为导向的思维,也是一个完全不同的新视角。
·至强6+,为智能体而生的CPU
今年6月,英特尔发布了全新至强6+处理器,采用Intel 18A先进制程,拥有业界领先的288个内核;同期推出的智能体套件,能够在单颗288核至强处理器上部署近1000个智能体。
规模之外,英特尔的客户还提出了更高要求,让智能体不仅要装得多,更要跑得快。为此,英特尔更新了衡量指标,从两个维度衡量智能体的运行:一是单颗CPU能承载多少个智能体,二是每个智能体的性能到底如何。通过微架构和软件层面的优化,两组与客户实测的数据颇具说服力:
在SWE-bench基准测试中,客户选定的一组工作负载下,至强6+的单智能体平均性能领先竞品15%;
而针对云端大规模启动沙箱的需求,10分钟内启动1万甚至10万个沙箱、单个沙箱启动时间200ms的SLA,至强6+在满足200ms SLA的条件下可支持350个沙箱并发,约为某一竞品的1.46倍。
在本次技术创新与产业生态大会上,我们对英特尔相关技术专家进行了访谈。英特尔技术专家进一步拆解了至强6+与智能体沙箱场景的契合点:沙箱本质上是一个轻量化虚拟机(Micro-VM),需要快速拉起、用完即毁,对高并发、低延时要求极高。至强6+在系统重载下不跳频,两百多个核心同时工作时频率也不下降,性能几乎线性交付,密度与性能兼得;同时一个CPU核心上可部署4个甚至更多智能体,分时复用系统资源。此外,从第四代至强开始集成的IAA、QAT、DSA等硬件加速器,对内存数据的压缩/解压缩、加密/解密、搬运等操作不占用CPU或GPU资源,恰好命中智能体场景数据类型多、碎片化严重的痛点。
"智能体时代,CPU不仅要跑得更快,还要跑得更稳。"英特尔专家如是说。“至强的RAS特性与TDX加密隔离能力,在大模型越狱等安全事件频发的当下,为高密度部署的智能体提供了强隔离保障。”
·机架级协同,重新定义CPU基础设施
单颗芯片之外,更大的变革发生在机架层面。面对CPU核心越来越多、智能体越来越多的趋势,英特尔的OEM与液冷合作伙伴提出了共同命题:要不要一起做一些新架构的尝试?
过去几个月,这一设想有了实质进展。英特尔正与众多业界伙伴共同制定相关标准,根据可预见的AI智能体性能需求,综合考虑CPU性能、网络、存储、散热与供电,打造一套平衡的、全新的面向AI智能体的CPU机架方案。这套方案将很快与国内合作伙伴一起推向市场,为行业提供更高质量、更高性能的新一代CPU机架设计。
·加速数据通路,不让算力空等
在GPU百花齐放的国内市场,一个常被忽略的事实是“GPU服务器同样需要CPU来完成数据预处理和传输”。
英特尔至强处理器是中国主流计算服务器中的机头CPU,靠的不只是性能、带宽与可靠性这些基本功,还有独具特色的加速能力。
以数据预处理为例,当你让智能体每天搜集前一夜的全球财经新闻并发送邮件,它需要抓取网页、视频、PDF 报告等各种格式的资料并提取文字,这些预处理工作其实更适合由CPU而非GPU执行。借助至强内置的AMX加速能力,向量化和重排序性能分别达到对比基准的2倍和4倍,国内已有多家互联网客户在使用这套方案。
在当下非常火热的存储领域同样如此。数据中心存储架构就像一个三角形,越接近GPU算力的存储成本越高,离得越远成本越低、速度也越慢。英特尔的思路是缩短数据访问路径,即通过CXL实现内存池化,让服务器使用更多内存;通过软件创新和智能网卡,让远端存储访问更高效。过去一个月,英特尔与国内软件合作伙伴基于至强6处理器和MRDIMM内存打造的高性能存储系统,在MLPerf Storage v3.0的Llama3检查点读写和3D-Unet训练两项测试中取得全球第一。"让存储跑得更快,避免数据访问成为瓶颈,昂贵的CPU、GPU 才不必空等。"
·KV Cache智能加速套件,给智能体一张更大的"草稿纸"
如果说智能体的思考速度已不是最大挑战,那么记忆无疑正在成为新的瓶颈。
大模型在推理、规划与对话过程中,需要把工作记忆留存在"草稿纸"上,而这张稿纸就是我们所说的KV Cache。随着问题越来越复杂、上下文越来越长,"草稿纸"的数量正在爆炸式增长。百万Token上下文已成为一些开源大模型的重要卖点,而一个标准的35B模型在100万Token上下文下所产生的KV Cache就高达300GB,已超过不少GPU内置HBM的基础容量。更棘手的是,当成千上万的智能体协同工作时,它们没有把更多时间用于思考,而是耗费在存储、查找和管理"草稿纸"上,这显然是不合理。
为此,英特尔发布了KV Cache智能加速套件,并已形成覆盖KV Cache全生命周期的全套方案,包括KV Infinity、KV Cascade、KV Shrink、KV Fuse,从扩展、压缩、聚焦到复用一应俱全。这其中,KV Shrink对于控制KV Cache成本有着颇多亮点,其核心是分层存放与三大加速组件:
数据搬运(KV Cache Copy):将显存中的KV Cache卸载到系统内存,或由系统内存解压后搬回。借助DSA硬件加速,数据拷贝无需GPU资源参与,数据搬运可实现9.66倍加速,且不影响关键路径延时。部署上支持两种模式,直接卸载到AI服务器头节点的系统内存,或通过RDMA传送到远程至强服务器。
压缩:KV Cache命中率高达50%~70%,以存代算的价值巨大。通过QAT进行无损压缩,300GB的KV Cache可在落盘前压缩掉200GB,显著节省存储空间与I/O通道压力。
系统优化与调度:通过前置流水线调度,让每一层KV Cache在处理时就知道下一层的需求并提前预取(prefetch),使解压与上一层计算并行重叠,把延迟藏进流水线,最终不仅节省显存,还能提升速度。
其本质目标则是突破HBM容量边界,提高推理效率、支撑更多用户、降低TCO。
同时值得一提的是,该项目已在GitHub上开源,延续英特尔向生态回馈技术的传统。
·Crescent Island GPU,为大显存推理而来
面向AI推理和智能体AI应用场景,英特尔还发布了新一代GPU Crescent Island。这款基于全新Xe-3P架构的产品以大显存为显著特性,它借助LPDDR5x技术,可配备128GB、256GB乃至480GB的超大容量显存,为AI推理和KV Cache存储提供更多冗余空间。软件层面,英特尔持续投入打造完整的工具箱和软件栈,目标是在第一时间支持主流的全新开源大模型。更多产品消息将在今年晚些时候公布。
·CPU与GPU的再度平衡
智能体时代,CPU与GPU究竟该如何配比?是近一年来行业里探讨的最多的话题。
英特尔专家在接受媒体访谈时给出了一个生动的比喻:人的大脑大约1秒钟想出一个字,而把这个字敲进电脑只需1毫秒。这意味着电脑稍微卡顿,人就会觉得该换新了。而当这个"1秒想1个字的大脑"被"1秒能想1000个甚至10000个字的AI"替代时,承接和处理结果的键盘(也就是基础设施)很快就会被打爆。
过去几年,"想字的大脑",也就是大模型本身的进步是飞快的。但"敲字的键盘",也就是承接执行的基础设施的发展速度却有点跟不上了。这正是英特尔判断CPU算力将出现巨大需求缺口、数据中心CPU与GPU配比将逐步提升至1:1的逻辑起点。
传统大模型是"思想上的巨人、行动上的矮子",而智能体真正开始会自动执行任务了,一个智能体会启动多个子智能体,子智能体调用技能,技能再拉起一堆沙箱快速执行、快速销毁,这些执行与调度全部落会在CPU上,其增长速度随场景普及而飞快攀升。
在技术路线选择上,英特尔强调"帕累托前沿"的系统性视角,其坐标轴象限的横轴是每个用户感知到的效果,纵轴是整机利用率与总产出。云计算时代业界对横轴并不敏感,而智能体时代两者都敏感,因为跑慢一点,GPU就等不到工具返回;部署密度又极高,挑战被进一步放大。这也是至强6+及下一代CPU设计的核心考量。
·x86的积淀,是最深的护城河
过去20多年,数据中心的发展始终与开源软件社区紧密相连。从早期的Linux到后来的Kubernetes,英特尔始终保持大量投入;而面向AI时代,在PyTorch、vLLM、SGLang等耳熟能详的开源项目中,英特尔同样贡献良多,推动包括智能体AI在内的新功能更好地适配不同硬件。
与此同时,x86生态的深厚积淀在智能体时代更显现出独特价值。陈葆立举了一个例子:当"小龙虾"接到抠图任务却不具备该能力时,它会自己上网找到PyTorch社区里如何抠图的代码,下载到本地写出程序来完成任务。而这些沉积在网络上的代码,极大可能是基于x86架构写就的。过去一二十年社区贡献的海量功能大多构建于x86之上,这让x86成为运行智能体负载的天然优势平台。而且其存量数据非常可观,全球在网运行的约7000万台服务器中,80%基于x86架构打造,因此在智能体AI时代,x86架构依然能打,依然是核心架构。
·结语
回到大会开场的那组数字,无论是3.5亿个活跃智能体的预期,还是2.2万亿元的基础设施投入,它们都指向同一个事实,那就是智能体AI时代才刚刚开始。从288核至强6+处理器与智能体套件,到KV Cache智能加速套件、Crescent Island GPU,再到面向AI智能体的全新CPU机架方案,英特尔正以技术+硬件双重创新的动力,推动AI工厂从概念走向现实。
正如本届大会主题"开放、合作、创新"所蕴含的意义,以及那句老话"独行快、众行远"。在智能体AI这条充满机会与挑战的道路上,底层算力的每一次进步,都将与生态伙伴一起完成。而英特尔的方式一如既往,当客户的问题出现时,用技术的积累和手段,帮助他们更快地完成想做的事,毕竟帮助客户成功,同时也是帮助自己成功,这几天英特尔股价的蹿升,正是最好的体现。

评论
更多评论