AI数据是一门好生意吗?

2026-07-27 15:31:23
来源:证券之星
分享
AIME

问财摘要

1、2026年,AI训练数据已成为继AI算力和大模型之后,AI产业第三大细分赛道。全球人工智能训练数据市场规模预计达到55亿美元,到2034年将增长至227亿美元,复合年增长率达19.3%。 2、市场规模和增长速度都表明AI数据是一门好生意。但高增长背后是高门槛,包括数据采集成本、专业标注的人才稀缺、版权诉讼的巨额罚单、跨境数据传输的合规迷宫等。 3、商业模式从“卖劳力”转向“卖资产”,交付模式也同步升级,数据服务商与客户之间的关系从外包服务逐步转向长期协作。
免责声明 内容由AI生成
文章提及标的
人工智能--
东吴证券--
创投--
数据安全--
昆仑万维--
纽约时报--
查看股票机会,下载客户端

2026年的AI赛道,大模型厂商还在激烈拼参数、卷迭代,但有一批公司已经悄悄开始“印钞”了。Menlo Ventures合伙人Deedy不久前在社交平台X上发布了一张AI训练数据公司全景图,图中收录的28家创业公司合计年收入约85亿美元,总估值接近1000亿美元。仅从收入规模看,训练数据已经成为继AI算力和大模型之后,AI产业第三大的细分赛道。

数字本身比任何分析都更有说服力。根据Stratistics MRC的数据,2026年全球人工智能(885728)训练数据市场规模预计达到55亿美元,到2034年将增长至227亿美元,复合年增长率达19.3%。数据标注服务市场同样可观,研究机构估算2025年全球AI数据标注服务市场估值在42亿至72亿美元之间。而更具前瞻性的“数据合同”市场——也就是为AI模型建立数据质量、合规和交付标准的契约化服务——据The Business Research Company报告预计将从2025年的12.8亿美元增长到2030年的36.4亿美元,年复合增长率达23.3%。

爆发式增长从何而来

这个市场的爆发并非偶然。数据在大模型训练中的角色发生了根本性转变——从一次性投入的原材料,变成了持续消耗的燃料。早期大模型实验室在训练开始前备好数据集,跑完一轮训练就等下一代模型再采购,中间往往隔着一年半载。但到了2026年,模型迭代节奏已经快得令人目不暇接——OpenAI的GPT-5.4在3月推出,GPT-5.5在4月跟进,间隔仅约七周;Anthropic在5月底发布Opus4.8后,仅过12天又推出旗舰模型Claude Fable5。迭代越快,实验室发现的能力缺口就越多,对新增的高价值数据需求也就越频繁。

需求频次在上升,单位需求的数据体量也在同步膨胀。以代码智能体为例,早期模型仅覆盖12个Python仓库的SWE-bench基准测试;到2025年9月,Scale AI发布的SWE-bench Pro基准测试范围已扩张到41个仓库、4种编程语言。一条训练样本也从“改几行代码”变成了一整套包含需求理解、多文件定位、跨文件修改的完整数据包,单条样本的容量从几百个词元(token)涨到了几万个词元。采购频次更高、场景更多、每条数据更重——三个因素叠加,训练数据的总需求量被大幅推高。

谁在闷声发大财

头部公司的增长数据堪称惊人。Mercor在2025年9月的年化收入约5亿美元,到2026年6月已突破20亿美元(注:此数据为年化毛收入,扣除专家付款后净收入约6亿至8亿美元)。Handshake的增长更夸张——这家原本做了12年大学生招聘的平台,2025年初才切入AI训练数据业务,起步时年化毛收入仅500万至1000万美元,到2026年4月已接近11亿美元(注:扣除专家付款后净收入约4.5亿美元,数据来源:Sacra),一年翻了整整100倍。据东吴证券(601555)研报,Scale AI预计2025年收入达到20亿美元,2026年销售额接近40亿美元。这还是一个高度集中的赛道——Scale AI、Surge AI、Mercor和Handshake四家公司拿走了全行业超过四分之三的收入。

资本也在加速涌入。具身智能数据平台觅蜂科技2026年2月才成立,几个月内就完成了数亿元天使+轮战略融资,投资方包括国方创投(885413)、孚腾资本等机构。景联文科技近期完成近亿元A轮融资,投资方覆盖地方国资、产业资本和数据安全(885942)企业。AI数据基础设施正在成为一级市场争相布局的新方向。

商业模式的进化

这已经不再是传统意义上“卖劳动力”的生意。深度科技研究院院长张孝荣在接受《中国经营报》采访时指出,数据标注行业的商业模式正在从“卖劳力”转向“卖资产”——不再按数据量“一口价”卖数据,而是转向卖API调用、卖全栈解决方案,甚至探索“词元(Token)交易”和数据订阅制。

交付模式也在同步升级。Scale AI已经从按月打包升级为API按需交付——客户发起标注任务,最快一小时就能拿到生产级的标签数据。数据服务商与客户之间的关系从外包服务逐步转向长期协作。利润率的变化反映了这一转变——据QYResearch统计,2025年全球人工智能(885728)训练数据服务毛利率约49%。数据公司赚的已经不再是标注的人工费,而是深度参与模型研发所产生的服务溢价。

硬币的另一面:成本与合规

然而,高增长的另一面是同样高昂的门槛和风险。

首先是数据获取成本。昆仑万维(300418)董事长方汉在WAIC2026上指出,具身智能要实现可用水平,需要至少1000万小时的多模态数据。高质量数据的清洗和标注成本同样不菲,尤其是在医疗、法律等高精度需求领域。我国训练数据面临“质量低、数量少、分布散”的突出问题,优质中文语料积累不足、公共数据流通不畅、垂直行业数据标注成本高企。

其次是法律风险。2023年12月,《纽约时报(NYT)》对OpenAI提起版权侵权诉讼,指控其非法使用数百万篇文章训练AI模型。2025年5月,美国联邦法院签发保护令,要求OpenAI保存所有ChatGPT对话日志,波及全球超4亿用户。OpenAI抗辩称,仅合规技术成本就需耗费数月工程周期(883436)及数百万美元的基础设施支出。Anthropic也曾就类似版权集体诉讼达成15亿美元和解协议——该协议于2026年7月20日获美国联邦法院最终批准,创下美国版权案件和解金额历史纪录。这些标志性案件正在重塑全球AI企业的合规路径。

再者是行业标准化的缺失。目前头部数据企业普遍面临60%至70%的数据利用率,大量采集数据沦为“一次性资源”。真实世界数据的采集与标注至今仍高度依赖人工经验,距离标准化的工业品(850100)生产仍有相当距离。大部分高质量数据集的生产仍处于“作坊式”阶段,大模型公司大多“自采自用”。

好生意,但不是所有人都能做的生意

回到最初的问题:AI数据是一门好生意吗?

从市场规模和增长速度来看,答案是肯定的。全球AI训练数据市场以近20%的年复合增长率扩张,头部公司年收入从几亿美元到几十亿美元只用了不到两年时间。国家数据局数据显示,2025年全国高质量数据集数量超11万个,同比增长61.13%。市场呈现出“有多少买多少”的卖方市场状态。

但“好生意”并不等于“容易的生意”。高增长背后是高门槛——数据采集的百亿级成本、专业标注的人才稀缺、版权诉讼的巨额罚单、跨境数据传输的合规迷宫。这条赛道真正的分水岭,不在于谁拥有更多标注员或采集基地,而在于谁率先将“专家经验”转化为“数据流水线”。资本可以烧出采集网络和标注团队,但烧不出行业知识的工业化生产体系。

AI数据这门生意,注定属于那些能同时驾驭技术、成本和合规三重挑战的玩家。对多数人而言,它是一道高墙内的风景;但对少数已经翻墙而入的公司来说,风景确实不错。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME