2026年的AI赛道,大模型厂商还在激烈拼参数、卷迭代,但有一批公司已经悄悄开始“印钞”了。Menlo Ventures合伙人Deedy不久前在社交平台X上发布了一张AI训练数据公司全景图,图中收录的28家创业公司合计年收入约85亿美元,总估值接近1000亿美元。仅从收入规模看,训练数据已经成为继AI算力和大模型之后,AI产业第三大的细分赛道。
数字本身比任何分析都更有说服力。根据Stratistics MRC的数据,2026年全球人工智能(885728)训练数据市场规模预计达到55亿美元,到2034年将增长至227亿美元,复合年增长率达19.3%。数据标注服务市场同样可观,研究机构估算2025年全球AI数据标注服务市场估值在42亿至72亿美元之间。而更具前瞻性的“数据合同”市场——也就是为AI模型建立数据质量、合规和交付标准的契约化服务——据The Business Research Company报告预计将从2025年的12.8亿美元增长到2030年的36.4亿美元,年复合增长率达23.3%。
爆发式增长从何而来
这个市场的爆发并非偶然。数据在大模型训练中的角色发生了根本性转变——从一次性投入的原材料,变成了持续消耗的燃料。早期大模型实验室在训练开始前备好数据集,跑完一轮训练就等下一代模型再采购,中间往往隔着一年半载。但到了2026年,模型迭代节奏已经快得令人目不暇接——OpenAI的GPT-5.4在3月推出,GPT-5.5在4月跟进,间隔仅约七周;Anthropic在5月底发布Opus4.8后,仅过12天又推出旗舰模型Claude Fable5。迭代越快,实验室发现的能力缺口就越多,对新增的高价值数据需求也就越频繁。
需求频次在上升,单位需求的数据体量也在同步膨胀。以代码智能体为例,早期模型仅覆盖12个Python仓库的SWE-bench基准测试;到2025年9月,Scale AI发布的SWE-bench Pro基准测试范围已扩张到41个仓库、4种编程语言。一条训练样本也从“改几行代码”变成了一整套包含需求理解、多文件定位、跨文件修改的完整数据包,单条样本的容量从几百个词元(token)涨到了几万个词元。采购频次更高、场景更多、每条数据更重——三个因素叠加,训练数据的总需求量被大幅推高。
谁在闷声发大财
头部公司的增长数据堪称惊人。Mercor在2025年9月的年化收入约5亿美元,到2026年6月已突破20亿美元(注:此数据为年化毛收入,扣除专家付款后净收入约6亿至8亿美元)。Handshake的增长更夸张——这家原本做了12年大学生招聘的平台,2025年初才切入AI训练数据业务,起步时年化毛收入仅500万至1000万美元,到2026年4月已接近11亿美元(注:扣除专家付款后净收入约4.5亿美元,数据来源:Sacra),一年翻了整整100倍。据东吴证券(601555)研报,Scale AI预计2025年收入达到20亿美元,2026年销售额接近40亿美元。这还是一个高度集中的赛道——Scale AI、Surge AI、Mercor和Handshake四家公司拿走了全行业超过四分之三的收入。
资本也在加速涌入。具身智能数据平台觅蜂科技2026年2月才成立,几个月内就完成了数亿元天使+轮战略融资,投资方包括国方创投(885413)、孚腾资本等机构。景联文科技近期完成近亿元A轮融资,投资方覆盖地方国资、产业资本和数据安全(885942)企业。AI数据基础设施正在成为一级市场争相布局的新方向。
商业模式的进化
这已经不再是传统意义上“卖劳动力”的生意。深度科技研究院院长张孝荣在接受《中国经营报》采访时指出,数据标注行业的商业模式正在从“卖劳力”转向“卖资产”——不再按数据量“一口价”卖数据,而是转向卖API调用、卖全栈解决方案,甚至探索“词元(Token)交易”和数据订阅制。
交付模式也在同步升级。Scale AI已经从按月打包升级为API按需交付——客户发起标注任务,最快一小时就能拿到生产级的标签数据。数据服务商与客户之间的关系从外包服务逐步转向长期协作。利润率的变化反映了这一转变——据QYResearch统计,2025年全球人工智能(885728)训练数据服务毛利率约49%。数据公司赚的已经不再是标注的人工费,而是深度参与模型研发所产生的服务溢价。
硬币的另一面:成本与合规
然而,高增长的另一面是同样高昂的门槛和风险。
首先是数据获取成本。昆仑万维(300418)董事长方汉在WAIC2026上指出,具身智能要实现可用水平,需要至少1000万小时的多模态数据。高质量数据的清洗和标注成本同样不菲,尤其是在医疗、法律等高精度需求领域。我国训练数据面临“质量低、数量少、分布散”的突出问题,优质中文语料积累不足、公共数据流通不畅、垂直行业数据标注成本高企。
其次是法律风险。2023年12月,《纽约时报(NYT)》对OpenAI提起版权侵权诉讼,指控其非法使用数百万篇文章训练AI模型。2025年5月,美国联邦法院签发保护令,要求OpenAI保存所有ChatGPT对话日志,波及全球超4亿用户。OpenAI抗辩称,仅合规技术成本就需耗费数月工程周期(883436)及数百万美元的基础设施支出。Anthropic也曾就类似版权集体诉讼达成15亿美元和解协议——该协议于2026年7月20日获美国联邦法院最终批准,创下美国版权案件和解金额历史纪录。这些标志性案件正在重塑全球AI企业的合规路径。
再者是行业标准化的缺失。目前头部数据企业普遍面临60%至70%的数据利用率,大量采集数据沦为“一次性资源”。真实世界数据的采集与标注至今仍高度依赖人工经验,距离标准化的工业品(850100)生产仍有相当距离。大部分高质量数据集的生产仍处于“作坊式”阶段,大模型公司大多“自采自用”。
好生意,但不是所有人都能做的生意
回到最初的问题:AI数据是一门好生意吗?
从市场规模和增长速度来看,答案是肯定的。全球AI训练数据市场以近20%的年复合增长率扩张,头部公司年收入从几亿美元到几十亿美元只用了不到两年时间。国家数据局数据显示,2025年全国高质量数据集数量超11万个,同比增长61.13%。市场呈现出“有多少买多少”的卖方市场状态。
但“好生意”并不等于“容易的生意”。高增长背后是高门槛——数据采集的百亿级成本、专业标注的人才稀缺、版权诉讼的巨额罚单、跨境数据传输的合规迷宫。这条赛道真正的分水岭,不在于谁拥有更多标注员或采集基地,而在于谁率先将“专家经验”转化为“数据流水线”。资本可以烧出采集网络和标注团队,但烧不出行业知识的工业化生产体系。
AI数据这门生意,注定属于那些能同时驾驭技术、成本和合规三重挑战的玩家。对多数人而言,它是一道高墙内的风景;但对少数已经翻墙而入的公司来说,风景确实不错。
