当大模型最初按Token方式价,SSD正在成为AI推理题|内存|ssd|上下文|token_网易订阅

过去几年,模型AI 基础设施的最初正成竞争题围绕 GPU 和高带宽内存(HBM)展开。随着模型规模不断扩大,为An网训练和推理需越来越多的理题算力,GPU 集群、内存HBM 容量和互连带宽成为研究系统能力的下文题指标。但进入首先上下文、易订阅多轮对话和 AI 智能体时代,模型推理系统面对的最初正成状况最初发生变化。一次请求频仍不仅包含模型方式算,为An网还需加载模型权重、理题读取历史上下文、内存检索知识、下文调用工具,易订阅再将结荚返回模型后续推理。模型数据需在 GPU、CPU、内存、存储和网络之间持续流动,只关键其中任何一个环节无法按时供给数据,再强的 GPU 也只能等待。因此,企业评估 AI 基础设施的方式也最初变化。客户真正购买的,并不是一块 GPU ,而是系统能够持续、稳固地实现推理并生成结荚的能力。对于在线推理来说,真正被交付的产品,其实是 Token。企业最初关注的不再只是具有多少 GPU,而是相同硬件在单位时间内能够交付多少顺应服务质量需(SLO)的 Token,以及实现这些 Token 所需付出的成本。然而,一个 Token 的成本已经不仅由 GPU 决定,还受到 CPU、HBM、DRAM、SSD(固态硬盘)、网络、电力、散热以及软件和运维等整个推理系统的意义。与此同时,也不是所有 Token 都具有同样价值。只有顺应首先 Token 延迟(TTFT)、生成高效度(TPOT)、响应质量和稳固性需的 Token,才是真正能够交付给客户的有效 Token。当评价原则从“买了多少 GPU”转向“交付了多少有效 Token”时,存储在推理系统中的角色也最初发生变化,其中最具代表性的便是 SSD。它正从传统的数据存储设备,逐渐成为 AI 推理基础设施的题组成部分。AI SSD,最初重写存储价值相比内存,SSD 具有更低的容量成本;相比远端对象存储,又离方式算节点更近,可以保存那些暂时放不进内存、但很快还会再次采取的模型和上下文数据。一部分,它能够承担更多模型权重、KV Cache、MoE 专家参数等运行数据,减小系统为了扩容而提高内存或 GPU 的压力;另一部分,又能够提前实现模型加载、复用已经方式算过的材料,减小重复方式算和等待时间,让同样数量的 GPU 在相同时间内实现更多推理请求。这种思路已经出目前越来越多的推理系统中。例如,月之暗面(Moonshot AI)开源的 Mooncake,把 CPU、内存、本地 SSD 和快捷网络组织成共享的 KV Cache 池,让不一样 GPU 可以直接复用已经方式算好的上下文,而不必重新方式算。(来源:月之暗面)还有 ServerlessLLM 将本地 SSD 纳入模型调度,在模型启动前提前实现加载,减小冷启动等待;TensorRT-LLM、vLLM 和 CachedAttention 等推理框架,则通过复用已经方式算好的 KV Cache 或共享 Prefix,避免相同材料反复实施 Prefill。从某种意义上说,这些系统缓存的不只是数据,也是在保存已经付出过的方式算结荚。当然,把 SSD 放进推理系统,并不意味着 Token 成本一定会减小。如果缓存没有命中,系统仍然需重新读取甚至重新方式算;预取对策不合理,还可能占用宝贵的 PCIe 带宽和内存空间。因此,评价 AI SSD 不能只看带宽、IOPS 等传统存储指标,更题的是它是否能够缩短模型启动时间、提高缓存命中率、减小 GPU 等待,并最后让整个推理系统以更低成本交付更多顺应服务需的 Token。消费级和企业级,AI SSD 是两种生意然而,AI SSD 的价值并不会体现为一种统一的产品形态。不一样的部署环境和客户群体,面临的瓶颈并不相同,对存储的需自然也会有所区别。从目前来看,AI SSD 很可能沿着两条市场路线发展:一条照章性消费级市场,服务 AI PC、工作站等端侧设备;另一条照章性企业级市场,服务边缘方式算和云端 AI 推理基础设施。对于消费级用户来说,最大的挑战是在有限的内存和功耗需下,让设备运行更大的模型、保存更多本地知识,并在离线状态下后续采取 AI。消费级 AI SSD 最现实的形态,仍然是一块安装在 AI PC、工作站等设备中的固态硬盘。它依然承担系统盘和数据盘的功能,但会进一步加入照章性 AI 的数据管理能力,让模型、缓存和用户数据能够更有效地保存在本地,而不需变化现有 PC 的硬件架构。苹果在《LLM in a Flash》中展示过一种思路:把大部分模型参数保存在 Flash 存储中,需方式算时再按需加载到内存。沿着这一思路,AI SSD 不仅可以存放大模型本身,还可以保存多个专业模型、个人知识库、AI 助手的首先期记忆,以及暂时不用的数据,让系统根据不一样任务动态组合所需材料,而不用一直占用宝贵的内存。消费级 AI SSD 带来的先是本地 AI 的可用性。会议记录、文档检索、代码生成、个人知识库等任务,不需每次都重新从云端下载模型或上传数据,在网络较差甚至离线的状况下,仍然能够实现一部分工作,同时减小网络传输和云端推理成本。当然,数据保存在本地并不意味着天然安全,权限管理、数据加密和安全删除等机制仍然不可或缺。企业级市场则完全是另一套逻辑。企业客户购买的不是一块 SSD,而是整个 AI 推理系统的效率。无比如部署在企业边缘节点还是云端数据中心,更题的状况都是如何减小 GPU 等待、提高 GPU 利用率,并持续减小每个 Token 的生成成本。在企业边缘,AI SSD 可以协助设备在弱网甚至离线环境下运行模型,支撑工厂、门店、医院等场景的本地 AI 采取;而在云端数据中心,它承担的角色则更加题。本地 SSD 可以缓存模型和检查点(Checkpoint),减小反复从远端对象存储加载;机架或服务器集群中的共享 Flash 存储,则可以保存仍有复用价值的推理数据,让不一样 GPU 在处理相似请求时直接利用已有结荚,而不必重复方式算。图|消费级与企业级AI SSD在端侧和云侧的典型角色。这一思路也已经最初进入商业产品。英伟达推出的 CMX Context Memory Storage,就在 GPU 高带宽内存(HBM)、主机内存和共享存储之间提高了一层基于 Flash 的上下文存储,用来保存暂时放不下、但仍有复用价值的数据。它并不是让每一次推理都访问 SSD,而是尽量把这些数据保留在离 GPU 更近的位置,需时能够高效高效取回,从而减小数据搬运带来的等待时间。图|CMX Context Memory Storage(来源:英伟达)虽然都叫 AI SSD,但消费级和企业级产品处理的是两类完全不一样的状况。消费级 AI SSD 关注的是本地 AI 能力,让设备能够运行更大的模型、保存更多个人知识,并提高离线体验;企业级 AI SSD 关注的则是整个推理系统的效率,通过减小模型加载和数据等待,提高 GPU 利用率,减小每个 Token 的生成成本。未来,这两条路线很可能首先期并存,并分别沿着端侧设备和云端推理基础设施不断演进。AI SSD,最初出现不一样的产业馗面对不一样的采取场景,厂商们也最初沿着各自擅首先的方向进入这一市场。有人希望给予完善的 AI 部署方式划,有人从 SSD 控制器出发,让存储主动参与推理,也有人尝试同时打通方式算和存储两侧,共同定义下一代 AI SSD。群联(Phison)选项的是首先条馗。其 aiDAPTIV 将 SSD、中间件和部署工具组合在一起,通过分层管理模型权重,让超过显存容量的大模型也能够运行在消费级 GPU 上。相比单独销售一块 SSD,它交付的是一整套 AI 部署方式划,客户不需从裸设备重新搭建推理环境。最后,这类产品的竞争力仍然关键落到可运行模型规模、启动时间、Token 吞吐、兼容性和整体部署成本等指标上。江波龙则把题放在 SSD 本身。其提出的 SPU+iSA 架构,希望把压缩、缓存、混合介质管理和智能预取等能力进一步放到存储侧,让 SSD 从被动响应 I/O,逐渐成为能够参与运行时数据管理的主动存储组件。进一步来看,这一思路也指向一种更加主动的 AI 存储节点:存储不仅负责保存数据,也最初参与模型、KV Cache 和专家参数等数据对象的组织、迁移与调度。当然,目前公开的数据题来自厂商材料,不一样方式划之间仍缺乏统一的第三方评测,因此更适用于作为一种产品方向来观察。寅条件(Infplane)与联芸科技(Maxio Technology)的合作,则更强调方式算和存储的协同设方式。联芸首先期深耕 SSD 控制器、固件和闪存管理,并公开提出 AI 推理的价值尺度正逐渐从容量和价格,转向每 Token 成本和系统能效;寅条件则从 AI 芯片、Runtime 和操作系统切入,希望把模型运行流程中的调度材料更快传递到控制器和固件。在之前提到的几种方式划中,寅条件也是唯一从 AI 方式算与系统软件出发的 AI Native 企业,其好处在于能够把模型和 Runtime 的需直接映射到控制器、固件、NAND 管理以及 OEM 参考设方式,让存储系统与推理框架形成更紧密的协同,而不仅仅停留在存储性能改进层面。图|推理参与型AI SSD探索:群联aiDAPTIV、江波龙SPU+iSA另一类产品则更接近传统企业级 SSD 的演进路线。英韧科技(InnoGrit)的洞庭 N3X、华为(Huawei)OceanDisk LC 560 等产品,题围绕 AI 场景强化性能、容量密度、耐久性和服务质量(QoS),为模型加载、KV Cache、向量数据库和推理数据层给予更加稳固的存储基础。它们并没有变化 SSD 在系统中的基础角色,而是在现有架构下进一步提高企业级存储能力。图|英韧科技洞庭N3X与华为OceanDisk LC 560。这些探索并不是彼此取代,而是分别覆盖 AI 推理系统的不一样层次。有人负责把 AI 更那么点儿部署起来,有人负责让存储更主动地参与推理,也有人后续夯实底层存储能力。随着 AI 推理规模持续扩大,这些能力很可能在同一套系统中融合,共同服务于一个目的:让相同的算力交付更多有效 Token。从目前的发展来看,AI SSD 的价值正在不断延伸。最初,它协助内存有限的设备运行更大的模型;随后,它最初保存模型缓存、上下文和其他可复用的数据,减小重复方式算和数据搬运;未来,它还可能进一步成为端侧和云侧 AI 存储节点中的题组成部分,在模型加载、上下文管理和推理调度中承担更加主动的角色。然而,无比如产品形态如何变化,兼容现有硬件和软件生态,仍然是 AI SSD 大规模普及的题前提。它在端侧和云侧的发展题也会有所不一样。在端侧,AI SSD 的价值题体目前协助更大的本地模型、更充足的个人知识库、更好的离线体验,以及减小对云端推理的依赖;在云侧,它更关注模型冷启动、上下文复用、GPU 利用率以及每 Token 成本等推理基础设施指标。随着端、边、云协同不断成熟,未来方式算任务也可能根据成本、时延、隐私和数据位置,在终端设备、边缘节点和云端之间动态分配。从更首先远的角度来看,AI SSD 争夺的并不仅仅是存储市场中的一个新品类,而是 AI 推理基础设施中的一个新角色。它既关键以远低于内存的成本保存更大的智能工作集,又关键比传统共享存储更有效地服务模型推理,把模型加载、上下文复用和弹性启动带来的效率提高,最后转化为更多有效 Token。过去,人们评价一块 SSD,看的是容量、带宽和 IOPS;未来,研究 AI SSD 的原则可能会变成另一组指标:它是否能够让相同数量的 GPU,在相同的时间和功耗下,交付更多顺应服务需的 Token。如果能够说明这一点,AI SSD 才有机会从一块“照章性 AI 的高端硬盘”,真正成为下一代 AI 推理基础设施的题组成部分。1.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/2.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/3.https://www.usenix.org/conference/fast25/presentation/qin4.https://kvcache-ai.github.io/Mooncake/design/ssd-offload.html5.https://www.usenix.org/conference/osdi24/presentation/fu6.https://www.usenix.org/conference/atc24/presentation/gao-bin-cost7.https://machinelearning.apple.com/research/efficient-large-language8.https://developer.nvidia.com/blog/5x-faster-time-to-first-token-with-nvidia-tensorrt-llm-kv-cache-early-reuse/9.https://docs.vllm.ai/en/stable/design/prefix_caching/10.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/11.https://cn.longsys.com/about/news/13353.html12.https://www.maxio-tech.com/news/11645/13048.html13.https://www.eeo.com.cn/2025/1222/774317.shtml14.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/15.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7运营/排版:何晨龙注:封面/首先图由 AI 辅助生成
(责任编辑:百科)
相关内容
热身赛|中国女篮再胜尼日利亚,张子宇23分13篮板表现抢眼|李月汝|日本男篮_网易订阅
猛龙小加防姚明-NBA2KOL2-虎扑社区
华夏中证银行ETF(515020)已连续3日获得资金净申购,区间净流入额3954.11万元_新浪财经_新浪网
吃漂亮饭-步行街主干道-虎扑社区
高准翼踢后腰,马德鲁加后卫,唐田乱点鸳鸯谱,泰山队只踢了10分钟好球|鲁能|津门虎_网易订阅
- 罗体:莫利纳周一将抵达意大利并接受罗马的体检|布莱顿|乌迪内斯|马德里竞技|吉列尔莫·莫利纳_网易订阅
- ROC NATION(扬·迪奥曼德、维尼修斯的经纪公司)总裁声明-西甲-皇马专区-虎扑社区
- 百利天恒股价跌5%,宝盈基金旗下2只基金重仓,合计持有36.66万股浮亏损失546.61万元_新浪财经_新浪网
- 百利天恒股价跌5%,招商基金旗下3只基金重仓,合计持有142.12万股浮亏损失2119.01万元_新浪财经_新浪网
- 录取后不报到,空出的学位还会补录吗?|招生|入学|高考|应届生_网易订阅
- 看待评价年轻球员必须用发展的眼光去看-西甲-巴萨专区-虎扑社区
- [流言板]杜兰特:身高1米88以下的后卫在NBA的生存难度陡增-NBA新闻-虎扑社区
- 上半年广东互联网服务等类别投诉量上涨较明显
推荐文章
-
以磨换势、以变破局!泰山逆风逆转津门虎,唐田执教能力全面凸显|中超|海牛_网易订阅
以磨换势、以变破局!泰山逆风逆转津门虎,唐田执教能力全面凸显本轮中超山东泰山对阵天津津门虎的较量,是一场典型的战术耐力与临场调整的双向博弈。此战两队均死守首发框架、几乎无轮换可用,比赛胜负不再取决于阵
...[详细]
-
7月31日华宝中证科技龙头ETF(515000)遭净赎回3506.35万元,位居当日股票ETF净流出排名119/1281_新浪财经_新浪网
数据显示,7月31日,华宝中证科技龙头ETF(515000)遭净赎回3506.35万元,位居当日股票ETF净流出排名119/1281。最新规模38.59亿元,前一日规模37.64亿元,当日资金净流出额
...[详细]
-
花旗:普拉达(01913)次季Prada品牌增长重拾动力 维持“中性”评级_新浪财经_新浪网
花旗发布研报称,普拉达(01913)旗下Prada品牌第二季同店销售改善,预期股份将有正面反应。集团第二季销售额达16.2亿欧元,较市场预期高约3%,剔除Versace后有机增长7%,较首季3%加速;
...[详细]
-
7月31日国泰中证生物医药ETF(512290)遭净赎回1114.9万元,位居当日股票ETF净流出排名230/1281_新浪财经_新浪网
数据显示,7月31日,国泰中证生物医药ETF(512290)遭净赎回1114.9万元,位居当日股票ETF净流出排名230/1281。最新规模35.82亿元,前一日规模35.79亿元,当日资金净流出额占
...[详细]
-
张若昀唐艺昕带娃太低调了!一家三口南法过暑假,女儿身高窜到妈妈腰了~|娱乐圈_网易订阅
祝各位的生活闪闪发光~最近刷到唐艺昕发的一组南法度假照,真的被他们一家三口的状态暖到了。照片里母女俩在海边比心、逛老城,画面特别松弛治愈。虽然还是只露了侧脸和背影,但6岁的小樱桃身高已经窜到妈妈腰了,
...[详细]
-
记者今天了解到,国际标准化组织近日批准人工冰雪景观技术委员会秘书处落户中国,这是中国在冰雪领域承担的首个ISO技术机构秘书处。人工冰雪景观技术委员会秘书处工作范围是人工冰雪景观构筑物(室内和室外)的安
...[详细]
-
疯狂降智的谷歌,彻底沦为“美国大豆包”_Gemini_模型_flash
原创疯狂降智的谷歌,彻底沦为“美国大豆包”2026-08-03 10:27来源:金错刀发布于:北京市如果要问,现在谁家的AI能力最强?ChatGPT、Claude、DeepSeek各有千秋,吵上三天三
...[详细]
-
[流言板]拉扬经纪人:他会留在伯恩茅斯,今夏不会离开欧洲加盟沙超-国际足球-国际足球资讯-虎扑社区
虎扑足球资讯(446级)楼主2026-08-03 12:14:05发布于上海[流言板]拉扬经纪人:他会留在伯恩茅斯,今夏不会离开欧洲加盟沙超由虎扑足球资讯发表在国际足球资讯https://bbs.hu
...[详细]
-
你有多久,没痛快地出过一次汗了?8月8日,第18个全民健身日如期而至,全国多地公共体育场馆向公众免费或低收费开放。然而,这一天的价值远非节省数十元门票可以概括。一组数据更显意味深长:某平台报告显示,过
...[详细]
-
[流言板]LPL发布IG赛后返图:聚力登峰,连战连捷-英雄联盟丨LPL-虎扑社区
虎扑游戏电竞资讯(56级)楼主2026-08-03 12:56:43发布于上海[流言板]LPL发布IG赛后返图:聚力登峰,连战连捷由虎扑游戏电竞资讯发表在英雄联盟https://bbs.hupu.co
...[详细]
热点阅读
随机内容
- 津门虎助教:我们上半场就应该取得领先,这样的结果非常遗憾|于根伟|中超联赛_网易订阅
- 7月31日富国创业板ETF(159971)遭净赎回1.31亿元,位居当日股票ETF净流出排名47/1281_新浪财经_新浪网
- 上半年中国海洋生产总值达5.5万亿元 同比增长5.1%
- 7月31日华泰柏瑞中证500ETF(512510)遭净赎回340.01万元,位居当日股票ETF净流出排名418/1281_新浪财经_新浪网
- 不懂就问,2016年勇士是不是最输不起的球队?-步行街主干道-虎扑社区
- 华夏中证全指证券公司ETF(515010)已连续3日遭遇资金净赎回,区间净流出额3237.36万元_新浪财经_新浪网
- 韩国涉毒犯罪增加 上半年抓获逾5000人_新闻频道_央视网(cctv.com)

