数据不是护城河,稀缺数据才是

大模型训练数据供应链的价值重构与三种终局

最近看了不少关于数据产业的资料,但我感兴趣的是:当高质量公开语料逼近枯竭,数据从免费资源变成稀缺生产资料,产业链上的钱和壁垒正在往哪去?一个直观的信号来自资本。Meta以约143亿美元入股Scale AI,零融资运营五年的Surge AI在首轮融资中被估值至约240亿美元,成立不到三年的Mercor估值冲到约100亿美元。数据服务商的估值逻辑正在被重写,而重写的核心,是稀缺性。

顺着这个问题,本文回答三个方向:

  • 数据竞争的主战场,是否已经从预训练语料转向后训练数据?
  • 合成数据能不能替代人工标注?
  • 中国的数据产业与美国头部公司之间,差的到底是几年时间,还是一整套结构?

价值重构:当数据从免费变成稀缺

大模型训练数据供应链,指从原始数据一路加工到"模型可用数据"的全流程。沿着这条链观察附加值,一个清晰的结构浮现:价值正在向两端集中。上游握有稀缺数据资产的持有者,下游做专家数据和评测服务的高附加值玩家,都在向上走;夹在中间的通用标注环节,正被自动化标注技术侵蚀,同时承受被替代和价格战的双重挤压。

当预训练语料的边际价值下降,真正决定模型能力差异的,已转移到后训练环节。这些数据的共同特征是:稀缺且难以替代

监督微调(SFT)数据每个新版本都需要,但大量取自ChatGPT、Claude的输出,导致模型趋同、缺乏多样性。人类反馈强化学习(RLHF)数据需要专家对模型输出做偏好排序,主观且依赖文化背景,是目前最难规模化的瓶颈——中文场景还多一层张力,国内标注者的价值观取向与模型出海需要的多元价值观并不一致。推理链(CoT)数据生产成本是普通SFT的2—5倍,需要专家撰写或验证推理过程。多模态对齐数据单条成本可达纯文本的5—10倍,是当前增速最快的方向。

专家数据(法律、医疗、金融、代码)的壁垒不在技术,而在专家网络的规模和一致性。合成数据的壁垒则是质量、多样性、可靠性的三重门槛,且有明确的适用边界:在隐私敏感和罕见场景中有效,但在事实型知识、价值观对齐、前沿推理场景中难以替代真人。实验研究显示,少量人工数据(占比2.5%—10%)带来的性能提升,需要数量级更多的合成数据才能追平。因此,合成数据是必要补充,但核心场景仍离不开人工——尤其是在价值观对齐和专家推理环节。

这个"两端厚、中间薄"的价值分布,是理解后续竞争格局的坐标。


蒸馏数据:高信息密度的价值与合规

行业常把"蒸馏数据"笼统归入合成数据,但它是一个特殊类别——数据由更强的"教师模型"生成,本质属于模型生成数据。按生产方式,合成数据可分为三类:规则/算法合成、模型生成(蒸馏)、对抗/增强合成。三者的合规风险不在一个量级,但价值属性也不同。

蒸馏数据的价值是真实的。用GPT-4或Claude的输出训练小模型,信息密度远高于原始语料,成本也远低于从头采集专家数据。对预算有限又想快速追赶的模型厂而言,这是一条"低成本获取高能力"的捷径。DeepSeek-V3的部分能力就来自这种路径——用强模型的输出压缩知识,再用自己的架构重新训练。

但合规风险正在收紧。2026年初,Anthropic公开指控DeepSeek和阿里通过批量虚假账号获取其模型输出,用于训练竞争模型。OpenAI、Google、Meta等头部实验室已联手收紧服务条款,明确禁止将模型输出用于训练竞争性产品。中国315晚会曝光的数据投毒案例、国家标准对蒸馏数据合规性的推进,都指向同一个趋势:蒸馏数据正从"灰色地带"变为"合规红线"。

在数据分类与采购决策中,宜将蒸馏数据单独列为一类,或明确标注为"合成数据(模型生成)",以区分合规等级。它仍然可用,但用之前要清楚自己站在灰色地带的哪一侧。


竞争格局:为什么中国出不了Surge AI

三个案例可以把全球格局说清。

Scale AI被Meta以143亿美元入股后,OpenAI、Anthropic等核心客户出于数据机密性顾虑收缩合作,转向Surge、Mercor。被单一大客户深度绑定的数据公司,会失去其他客户信任。

Surge AI零融资、仅百余名正式员工,专注高端任务,收费为Scale的2—5倍。2024年收入 reportedly 已超过Scale同期。数据服务的价值可以来自专业度,而非人力规模。

Appen曾是全球数据标注龙头,市值一度超40亿澳元。但Google(占其收入约30%)在2023年终止合同后,收入断崖式下跌,股价回落逾九成。客户集中度是命门。

三个案例呈现了一个事实:全球数据公司正在分化为不同命运。而中国的问题更具体——为什么复制不了一个Surge AI?

从营收看,美国头部(8—14亿美元)与中国头部(约0.5亿美元)相差约20倍。但比数字更本质的是生态位与商业模式的不同。原因有四个,缺一不可。

第一,需求端缺少愿意为高端认知数据支付高溢价的客户。Surge能收取数倍溢价,前提是OpenAI、Anthropic愿意为一条法律推理数据付出5—10美元;而国内头部模型厂在采购时更看重规模交付与性价比。没有出得起价的甲方,就难以支撑起这样的乙方。

第二,供给端的人力成本优势,反而构成劣势。中国律师、医生、金融分析师的时薪明显低于美国同行,这本应是成本优势,却恰恰压缩了"专家精标"相对"规模众包"的溢价空间——当普通标注足够便宜,甲方更倾向于"多人众包加质检",而非"少数专家精标"。

第三,合规与出海的双重挤压。国内数据公司既难以直接服务海外前沿实验室(出口管制,且这些实验室本就不服务中国),又因监管导向偏保守,中文对齐数据难以支撑模型出海。两端的高价值需求都难以触及。

第四,资本市场的估值逻辑不同。美元市场容得下"高毛利、慢增长",因而Surge能够零融资、不扩张、只做高端;A股与新三板更奖励营收增速,促使国内公司走"上规模、压毛利"的路线——海天瑞声营收增长59%、毛利率却下降18个百分点,正是这一逻辑的产物。

这个结构差异体现在中国头部公司的财报里。海天瑞声2025年营收3.77亿元、同比增长59%,但综合毛利率同比下降约18个百分点,前五大客户占比约46.2%,暴露出定制化服务占比上升、行业竞争加剧的双重压力。数据堂2025年营收3.62亿元、同比增长约49%,净利润同比增长约217%,其以1500余个版权数据集为核心的授权模式,在数据资源入表政策下具备资产重估空间。版权数据集授权收入稳定、边际成本低、毛利高;项目制定制收入波动大、难以规模化;平台与SaaS订阅技术壁垒高、依赖生态。三类的毛利差异,决定了各自不同的估值逻辑。

由此推断,中国更可能的突破路径,是放弃在全领域与海外头部正面竞争,转而在某个高价值垂直领域(具身智能、金融、医疗)做深做透,同时绑定一个愿意付高价的头部甲方。


新的高价值方向:具身智能与评测数据

具身智能数据是当前增速最快的方向。全球市场从2024年约2.42亿美元(同比增长约181%),增长至2025年约5亿美元,预计2030年达52.5亿美元,年复合增速超过50%。目前全球高质量真实物理交互数据总量仅约50万小时,供给缺口巨大。供应上分为两条路径:光轮智能以仿真合成数据成为该领域首个独角兽,成本约为真实数据的百分之一;觅蜂科技、鹿明机器人等则主打真实场景采集。2026年6月工信部、国资委联合启动的人形机器人实景实训专项行动,将进一步放大这一方向的数据需求。

评测数据正从学术竞赛演变为独立业务,评测基准本身成为产品。以Humanlaya联合多家机构构建的$OneMillion-Bench为例,其以"人类专家成本"为任务定价、以"经济价值"衡量模型能力,代表了评测数据商业化的一种新范式。

与此同时,AI预标注的渗透率持续走高,基础标注的自动化程度从2020年的约20%升至2025年的约75%。但医疗、法律、推理链等复杂场景仍离不开人工。可预见的长期趋势是人机协同,而非纯自动化替代。


如何判断一家数据公司的数据质量

这是采购方与投资人最关心的问题。综合行业实践,可归纳为五个评估维度:准确性、一致性、多样性、难度/价值、可溯源。

验证手段从弱到强有三种:人工抽检成本低但覆盖有限;黄金标准集比对是行业通用做法;模型验证驱动最强——直接以数据训练模型、观测能力提升幅度,是唯一能验证"数据是否真正有用"的手段。中国2026年3月的高质量数据集国家标准征求意见稿提出的"模型验证驱动迭代"机制,正是这一手段的标准化尝试。

对采购方而言,比"标注准确率"更可靠的判断依据,是供应商在采购方自有模型上的验证结果,以及其数据来源授权链的完整性。前者验证价值,后者规避合规风险。


三种终局

在判断终局之前,先看两条正在收紧的链条:蒸馏数据的合规边界,和数据倒卖的风险。前者是模型输出的二次使用争议,后者是保密期内二次售卖、爬虫非法采集、暗网交易。海外实验室联手限制蒸馏、中国国家标准推进,客观上都对合规数据公司构成利好。技术替代方面,模型自标注能力五年内完全替代的概率不高;市场方面,头部模型厂自建团队、云厂商入局、价格战会挤压利润。但这些风险不改变终局判断,只影响速度。

拉长时间看,数据公司大概率不会齐头做大,而是分化为三种命运。

第一种,被内化。只服务单一大客户、又缺乏独立数据资产的纯外包公司,最可能被模型厂自建团队取代,或被压至微利。Scale AI被Meta收编,可视为这种命运的预演。

第二种,被平台化。技术工具型公司会成为模型厂数据流水线上的一个SaaS环节,天花板受限于工具本身的价值。

第三种,成为基础设施。只有握有稀缺认知数据资产(专家网络或版权数据)、且客户足够多元的公司,才可能升级为不可替代的"AI数据基础设施",获得长期溢价。

判断一家数据公司的价值,本质是判断它会落在三种终局中的哪一种。以下四个变量,会显著改变终局的落地节奏:大模型的自监督能力有没有质变;合成数据在推理、对齐场景能否达到人工质量;头部模型厂继续外采还是全面内化;中国是否出现愿意付高溢价的头部甲方及绑定的垂直玩家。


需要说明的是,本文基于公开信息整理,部分数据未经审计,宜用于判断趋势而非作为精确结论。


科里(Coralyx),发表于「边界层」2026.07