英特尔Optane挽歌:生不逢时

作者: CBINEWS

责任编辑: 邹大斌

来源: 电脑商情在线

时间: 2026-07-29 10:30

关键字: CXL AI推理 3D Xpoint 英特尔Optane KV缓存

历史长河中,不乏因过于超前而夭折的技术,英特尔的Optane(傲腾)存储与内存产品无疑是其中之一。价格昂贵、被严重误解、定位尴尬——这项技术在市场上苦苦挣扎,仅存活了五年便被英特尔叫停。

如果它在今天推出,结局或许截然不同。AI行业从训练向推理的转型,催生了对DRAM和NAND闪存的巨大需求。事实上,几年前让Optane沦为小众产品的那些特性,恰好使其极其适合当今这些写入密集型的AI工作负载。

Optane的兴衰

英特尔与美光联合开发了Optane——更准确地说,是3D XPoint内存——并于2015年首次对外公布。它承诺弥合固态硬盘所用传统NAND闪存与DDR4(以及后来的DDR5)所用DRAM之间的鸿沟。

与NAND一样,3D XPoint是非易失性的,这意味着数据在断电后依然保留,使其适合存储应用。但与NAND不同的是,3D XPoint不依赖捕获电子来存储数据,而是采用相变材料,速度极快(可实现低于10微秒的延迟,后来的PMem模块延迟更低),写入耐久性也极为惊人。

英特尔倒数第二代Optane固态硬盘宣称拥有每天100次全盘写入的耐久性和200万小时的平均故障间隔时间——这些规格至今仍无对手。当然,这些数字是根据3D XPoint读写数据原理推算得出的,但即便如此,英特尔的宣称可能还是保守了。

耐久性与延迟的双重优势——尤其是在随机读写方面——意味着它可以作为系统内存的第二层级使用。Optane固态硬盘作为存储级内存确实延迟极低,但与可达100纳秒甚至更低的DRAM相比,仍然相差数个数量级。需要指出的是,英特尔的PMem DIMM延迟约为350纳秒。

英特尔Optane持久内存的另一优势是每DIMM容量可达512GB,而当时DDR4单条最高也就在128GB左右——且价格不菲。这些持久内存DIMM可以当作主内存使用(此时标准DDR4充当巨大的L4缓存),也可以作为存储池,或者在应用感知内存模式下将Optane内存直接暴露给特定应用。

尽管Optane优势众多,其定价却颇为尴尬。同等密度下,3D XPoint始终比NAND贵,虽然比DRAM便宜,但性能又明显不如。结果就是,用户几乎找不到选择Optane比直接买更多NAND或更少但容量更大的DIMM更划算的场景。

更糟的是,TechInsights当时指出,尽管3D XPoint有其优点,但在存储密度上的进步速度不足以跟上NAND闪存。到2021年,美光终于忍无可忍,宣布终止3D XPoint产品的开发。没了新芯片来源,Optane固态硬盘和持久内存产品的命运已成定局。

英特尔时任CEO帕特·基辛格于2022年正式叫停Optane,终止了该品牌新产品的研发。P5810X和P5811X作为最后一批Optane产品,于2022年底下线。

过于超前的技术

就在英特尔停掉Optane的同一年,一种新的工作负载正在兴起,它将彻底颠覆数据中心格局,也极有可能成为证明3D XPoint持续开发价值的杀手级应用。

2022年11月,当时还相对默默无闻的AI初创公司OpenAI揭开了ChatGPT的面纱,由此引爆了AI军备竞赛,大量资本涌入科技行业。大语言模型是全球资源消耗最密集的工作负载之一,但直到2025年之前,大部分算力都用于训练更大、更智能、幻觉更少的模型。

2025年初DeepSeek的出现,标志着行业向推理的转型。推理既需要大量算力,也需要海量内存和存储。

现代推理引擎针对效率进行了深度调优。一种方式是通过缓存用于追踪模型状态的键值对(KV)来实现。聊天机器人和Agent本质上是迭代式的。在多轮会话中,每条提示不仅包含新信息,还包含之前所有的请求和响应。每次新请求到来时重新计算所有这些内容是极其浪费的,因此这些信息被计算、缓存并复用。

问题在于,在大上下文窗口和高并发场景下,这些KV缓存会变得非常庞大。在DeepSeek R1这样的模型中,一条64,000个Token的序列就能消耗4GB的GPU显存。乘以成百上千的用户,总量会迅速膨胀。

现代GPU显存有限,且已有显存大多被模型权重占用。因此,许多推理引擎支持KV缓存卸载——无论是原生支持还是通过插件实现。当GPU显存耗尽或聊天会话闲置过久时,较早的会话会被驱逐到系统内存中。但DRAM价格昂贵、供应紧张,甚至可能还不够用。事实上,据报道NVIDIA正在削减其Vera Rubin平台配套的LPDDR5X内存数量。

正因如此,对于用户已离开且会话闲置超过一小时的KV缓存,可能会被卸载到闪存阵列进行长期存储。问题在于,KV缓存是写入密集型工作负载,而NAND的写入次数是有限的。虽然业界正在进行大量工作来缓解这一问题,但事实仍然是:如果你向NVMe存储写入足够多的数据,它最终会磨损。

Optane超凡的写入耐久性和低延迟——尤其是在KV缓存中占主导地位的小型随机写入方面——使其成为这一工作负载的完美选择。

Optane的后继者

Optane棺材上的又一颗钉子,是CXL(Compute Express Link)已近在眼前。如果采用Optane的主要目的是获得一大池性能尚可的类DRAM内存,那么CXL提供了所有好处却没有妥协。早期CXL实现的本质,就是一个远程内存控制器,你可以连接任何选择的内存——DDR4或DDR5。需要超过CPU支持上限的内存?只需将CXL内存扩展器插入空闲PCIe插槽即可。后续版本的内存一致性协议还增加了池化和共享支持。

然而,CXL并未改变DDR5价格昂贵这一事实,而当前我们正处在DRAM价格最糟糕的时期。(话虽如此,即使CPU仅支持DDR5,CXL控制器仍可能使用DDR4。这正是Meta通过定制CXL ASIC重复利用旧服务器内存来提升系统内存容量的做法。)

在没有Optane的情况下,内存厂商试图用自己的写入优化型NAND填补空白。铠侠的XL-Flash就是存储级内存(SCM)的一例——通过使用SLC(每个单元1比特)闪存,提供许多与Optane相似的优点,包括宣称低于10微秒的写入延迟和每天60次全盘写入的耐久性。此外,XL-Flash还可以作为CXL设备暴露,以简化内存分层。

三星也曾尝试用Z-NAND技术复制Optane的诸多特性,但该技术仍远不及3D XPoint。据报道三星正在重做这一技术,目标是将性能提升到传统NAND的15倍。

遗憾的是,无论哪个继任者都难以企及Optane的高度。这项技术实在是太超前了。假若英特尔和美光再多等几年,它或许就能乘着AI的浪潮一路走向胜利。

ToB最前沿

ToB最前沿抖音号

CBI科技在线

地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 商务内容合作QQ:2291221 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除
京ICP备:2022009079号-3
京公网安备:11010502051901号
ICP证:京B2-20230255