国产算力从单点性能走向系统协同:星流计算 NovuWing 跑通多 Agent 新架构

2026-08-12 23:31:24
分享
AIME

问财摘要

1、企业级全栈AI基础设施公司星流计算发布《Agent Native Compute:面向企业Agent时代的新一代AI计算基础设施》白皮书,披露NovuWing技术架构。ShareKV双组件已跑通:KV Cache命中率超80%,中位TTFT降至基线20%以下。 2、星流计算自主开发ShareKVConnector与ShareKVSidecar,建立HBM、DDR、CXL.mem(或NVMe)之间的数据通路,减少额外拷贝与迁移开销。相关能力已在玄矩A1与SerpMind产品体系中完成贯通。
免责声明 内容由AI生成
文章提及标的
周期--
Enterprise--
Benchmark--
查看股票机会下载客户端

2026年8月7日,企业级全栈AI基础设施公司星流计算(NovuInfra)正式发布《Agent Native Compute:面向企业Agent时代的新一代AI计算基础设施》白皮书,系统披露NovuWing技术架构。目前,ShareKV双组件已跑通:KV Cache命中率超80%,中位TTFT降至基线20%以下。

它关注的不是如何再提升一次模型推理的峰值性能,而是一个更现实的问题:当企业同时运行几十个、上百个Agent,如何让它们长期保持上下文、频繁唤醒与协同,又不让GPU、HBM和整体成本失控?从“计算墙”走向“内存墙”

Agent在Active、Idle、Deep-Idle和Recovering等状态之间不断切换,并持续保存上下文、KV Cache与可恢复运行状态。若这些数据长期驻留HBM,昂贵的高带宽资源会被低活跃状态占用;若直接释放,Agent再次唤醒时又要重新计算。为此,NovuWing构建三级智能内存:L0HBM承载活跃KV Cache;L1DDR保存短期闲置、可能快速复用的状态;L1.5CXL.mem/NVMe承载低活跃KV Cache、上下文快照与暂停Agent状态。数据随生命周期(883436)分层流动,Agent激活时再按需预取和恢复。关键不只是分层,而是理解Agent

传统缓存调度通常依据访问热度或显存压力。NovuWing进一步引入Agent语义:系统判断数据属于哪个Agent与Session、当前处于什么状态,以及迁移、加载或重算的恢复成本。Agent Runtime通过agent-id、session-id与tier hint把策略传递给推理框架和内存体系,使缓存管理从“显存不够再换出”转向“依据Agent状态主动迁移与预取”。

为把这套机制落到工程系统,星流计算自主开发ShareKVConnector与ShareKVSidecar。前者运行在vLLM推理实例侧,衔接GPU/HBM与L1+L1.5共享内存,并执行KV Cache迁移、预取与恢复;后者作为宿主机共享服务,统一管理DDR共享内存池与CXL.mem(或NVMe)池,为多个推理实例提供共享KV服务。两者通过共享内存和异步I/O建立HBM、DDR、CXL.mem(或NVMe)之间的数据通路,减少额外拷贝与迁移开销。

阶段性基线结果进一步验证了这条技术路径:在当前企业Agent场景测试中,KV Cache命中率超过80%,中位首Token时延(TTFT)降至基线的20%以下。前者减少了可复用上下文的重复计算,后者直接缩短首Token等待时间,表明Agent语义调度与ShareKV分层机制已开始转化为可感知的效率收益。从白皮书到产品:关键链路跑通,效率收益开始显现

目前,相关能力已在玄矩A1与SerpMind产品体系中完成贯通。玄矩A1提供计算与三级内存底座,Agent Runtime负责生命周期(883436)和资源调度,SerpMind Enterprise(EFSC) Agent OS提供Agent的创建、运行与治理。围绕核心机制,星流计算已提交发明专利申请《基于Agent语义的三级分层KV缓存智能调度方法及系统》,申请号:202611065591.X。让算力从“可用”走向“经济可用”

星流计算将这一逻辑称为算力经济学:企业不应只比较峰值FLOPS和采购价格,还要考察Agent Throughput、KV Cache效率、Cost per Agent、Cost per Task与TCO。把带宽留给HBM、把容量放到更合适的层级,再由Agent语义决定数据何时流动,本质上是让每一份昂贵算力投入承载更多有效智能。

对国产算力而言,这意味着创新正从芯片、板卡和服务器的单点性能,扩展到CPU、GPU、内存、推理框架与Runtime的系统级协同。只有“算得起、跑得久、管得住”,多Agent才能真正进入企业生产。上述两项数据为当前企业Agent场景的阶段性基线结果;完整模型、上下文长度、并发规模、硬件配置及标准化Benchmark(BHE)与TCO数据,将在完成可重复验证后独立发布。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME