Token工厂涌现,下个风口“卖Token”?

2026-07-24 12:33:09
分享
文章提及标的
人工智能--
算力租赁--
软通动力--
粤港澳大湾区--
摩尔线程-U--
英伟达--
查看股票机会,下载客户端

“下一个风口,卖Token。”这句印在展商海报上的醒目标语,道出了本届WAIC(世界人工智能(885728)大会)的商业预言。

Token(词元)原本是AI模型消耗和产出的最小计量单位。从WAIC2026看,Token正演变为衡量AI生产力的核心单位。

随着产业重心逐渐从集中训练向规模化推理延伸,算力服务也开始从按卡时出租,向按Token交付演进。作为连接底层算力与上层应用的AI生产层,Token工厂正在超越单纯算力租赁(886050)的范畴,成为大模型时代新的商业形态。

“大厂的Token只支持他们的模型,无法通用。”有Token工厂展商告诉21世纪经济报道记者,一方面,用户在Token工厂通过单一API接口即可调用国内外所有主流大模型,根据任务匹配最优模型;另一方面,工厂能屏蔽市场算力波动风险,为用户提供更稳定、成本更优的兜底服务体验。竞逐Token工厂

走进WAIC展厅,几乎每一家算力厂商的展台都有一面“Token工厂”的主题墙。但各家打法和定位并不相同。

软通动力(301236)在WAIC上展出了北京壹号Token工厂,一期规划每日Token产能达1.4万亿个,由软通智算承建的粤港澳大湾区(885521)公共算力服务平台及韶关Token工厂与北京壹号Token工厂形成战略协同。

九章云极目前在全球计划部署覆盖10余个智算中心,平台总算力规模约30EFLOPS,日产超过500亿Token。其“AI工厂”构建了“训练工厂”与“Token工厂”双引擎闭环,前者以强化学习为底座解决“造模型难”,后者将大模型封装为标准化Token服务,将AI生产从依赖个别专家的研发模式,推向可复制的标准化流水线。

也有厂商通过回收GPU算力卡,实现Token的规模化生产。天罡智算展台工作人员介绍道,该公司整合已退役但仍有利用价值的冗余算力,为客户提供低成本算力。“针对老化显卡算力产出衰减的问题,我们通过算力调优技术提升其性能——例如将原仅剩20%性能的显卡恢复至40%甚至60%。”

相较于建数据中心、回收算力卡这样的重资产(IaaS/硬基建派)模式,还有厂商选择了轻资产(MaaS/软服务派)模式。

硅基流动展台工作人员告诉记者,其Token供应平台从上游租赁算力,生产Token卖给下游。其已累计支持超170个主流AI模型,兼容英伟达(NVDA)华为昇腾(886058)、沐曦与摩尔线程(688795)等多元算力,日均Token吞吐量超万亿。

调度闲时算力也是Token工厂的秘密武器。厂商通过算力调度系统,深夜连接到处于负载低谷期的超算中心。当企业用户在北京时间凌晨两点发送大批量文档处理请求时,Token工厂并不会启动自家的昂贵机组,而是将任务以极低价格交由此时闲置的算力资源处理。

无论是自建、回收还是租赁,Token工厂的最终出口只有一个:将算力通过统一的标准接口,封装成明码标价的Token,卖给企业和应用开发者。Token变现

曾经,用户被锁定在模型各自的Token套餐中,不得不应对参差不齐的定价和各有侧重的模型能力。

而Token工厂改变了游戏(881275)规则:它聚合了GLM、DeepSeek等开源大模型,也提供OpenAI、Anthropic兼容接口。这使得用户能够通过单一API入口使用多家大模型,按需切换、按量付费。

在WAIC上,有Token工厂旗帜鲜明地喊出:“比云厂商更便宜,比OpenAI更通用。”

所谓“便宜”,源于Token工厂对算力供给侧的极致压缩。不同于云厂商通用化的标准化服务,Token工厂往往自建或深度运营低成本算力中心。它们通过大规模回收高性能显卡、调度“闲时”算力资源,将原本高昂的推理边际成本压缩了数倍。没有了云厂商的中间商差价和品牌溢价,Token工厂得以以低于市场的价格输出Token。

中邮证券表示,传统算力租赁(886050)商业模式下,服务商收益存在刚性天花板。Token工厂通过平台级调度、算力软硬件融合与模型推理优化,将其核心指标从单纯的算力规模转向每瓦Token吞吐量和能效比;在Token工厂模式下,企业有望获得远超传统租赁模式的净利率。

而“通用”,则归功于多源聚合。Token工厂构建了一个开放的“模型超市”,通过标准化兼容接口,打破了不同厂商间的技术壁垒。

这能够实现从“人找模型”到“任务找模型”的转变。天罡智算展台工作人员告诉记者,该公司即将推出“智能路由”产品:面对需要同时生成文本、图片、视频的综合需求,由于不同模型在各领域表现各异,传统方式需人工切换调度。智能路由可以自动拆解任务,精准匹配最优模型,如将文本需求指向DeepSeek,图片生成则调用豆包,实现多模型协同作业。

开源证券研报认为,当前节点“Token=算力=营收”逻辑已得到充分验证,算力需求侧持续旺盛,供给侧国产替代突破算力卡瓶颈,政策规划前景明朗。对AIDC公司而言,Token工厂/分发平台的落地意味着算力利用率和计费效率提升,利好具备核心城市指标、绿电配套和上架率提升的第三方IDC及智算中心运营商,商业模式有望向“算力运营+Token变现”升级。从生产Token到经营Token

由于Token吞吐量直接决定了Token工厂的收入能力和资本回报率(ROI),如何高效利用有限资源、最大化单位GPU和单位功耗所产生的Token数量,正在成为竞争焦点。

是石科技在WAIC上展出了“国产Token优化工(850102)厂”。展台工作人员告诉记者,Token优化工(850102)厂通过优化算子与模型性能,提升Token生产速度——例如将单位时间产出Token从30个提升至35、40甚至50个。

长江证券(000783)研报指出,GPU性能决定了Token工厂的理论生产能力上限,而真正决定既定的算力资源能够释放多少价值的,则是包括调度平台、推理引擎、编译器和模型优化在内的AI系统软件栈。

硅基流动展台工作人员也告诉记者,该公司自研了推理加速引擎,对模型推理过程进行深度优化,在相同硬件条件下显著提升单位GPU的Token产出效率。

九章云极则根据Token的能力层级,将Token分为消费(883434)级、专业级和前沿级三类:消费(883434)级Token适合大众场景,量大管饱;专业级Token封装了行业知识与业务逻辑,适合金融、制造等高要求场景;前沿级Token面向复杂任务自动化与科研探索,适合需要深度推理、多步规划的高端场景。其Token工厂将大模型封装为消费(883434)级、专业级、前沿级三类标准化Token服务,分别定价。

随着Token工厂模式的兴起,行业目前仍面临一个核心痛点——标准的缺失。

在计量层面,九章云极提出了度算力(DCU)这一计量单位。展台工作人员告诉记者,1DCU=312TFLOPS×1小时,把英伟达(NVDA)、昇腾、海光等不同芯片的算力统一折算到了同一把尺子上。算力投入用DCU度量,智能产出用Token计量——中间的差值,就是AI工厂“变魔术”创造价值的地方。

在评测层面,软通动力(301236)则聚焦于算力集群的真实服务能力,发布了“软通动力(301236)Token工厂性能基准”。这是全球首个面向智能体长时运行、以混沌负载刻画为核心、包含三类测试方法和分领域数据集的完整算力评测体系。

一个更深层的共识逐渐浮现:竞争逻辑正从“拥有多少GPU”转向“如何让GPU生产更多Token”以及“谁能把Token转化为真正的生产力”。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME