艺恩
endato
INDUSTRY WHITE PAPER·LLM DATA
全球大模型数据市场白皮书
The Global Data Market for Large Models
当算力见顶,数据成为 AI时代的价值坐标。本白皮书系统呈现全球大模型数据市场的规模、价值链、资本、合
规与多模态前沿。
艺恩数据·ENDATA·NEEQ 871430 2026年版
艺恩
endata
INDUSTRY WHITE PAPER ·LLM DATA
全球大模型数据市场白皮书
The Global Data Market for Large Models
当算力见顶,数据成为AI时代的价值坐标。本白皮书系统呈现全球大模型数据市场的规模、价值链、资本、合
规与多模态前沿。
艺恩数据·ENDATA·NEEQ871430 2026年版
艺恩
endata
CONTENTS·目录
四个章节,读懂数据市场
01 市场与拐点 Market &Inflection
规模口径·增速共识·峰值数据
04
02 09价值链与资本 Value Chain&Capital
八层结构·质量溢价·估值与授权
合规与监管03 14
版权诉讼·出海风险·欧盟法案
Compliance &Regulation
全球格局·中美双核·未来04
多模态前沿·中美生态·趋势判断
Global·US-China·Outlook 18
02/31艺恩数据·全球大模型数据市场白皮书2026
艺恩 CONTENTS·目录
endata
四个章节,读懂数据市场
01
市场与拐点 Market&Inflection
04
规模口径·增速共识·峰值数据
02
价值链与资本 Value Chain&Capital
09
八层结构·质量溢价·估值与授权
03
合规与监管
Compliance & Regulation
14
版权诉讼·出海风险·欧盟法案
全球格局·中美双核·未来
04 Global Us-China · Outlook 18
多模态前沿·中美生态·趋势判断
艺恩数据·全球大模型数据市场白皮书2026 02/31
艺恩
endata
EXECUTIVE SUMMARY·核心摘要
数据,正成为大模型时代的稀缺生产要素
进入2025-2026年,随着算力竞赛逼近边际、公开互联网语料趋于枯竭,数据已从「可廉价获取的原
料」转变为决定模型上限的稀缺生产要素。市场的核心命题,正由「数据规模」转向「数据质量、
专业度与合规性」。
20-35%
全球AI训练数据相关市场年复
合增速区间(多家机构口径)
2026-32
Epoch AI测算的公开人类文本
语料耗尽窗口(中位约2028)
143亿s
Meta入股数据公司Scale Al金
额,估值达290亿美元
15zs
Anthropic版权和解额——美国
史上最大版权和解
三个结构性信号
①峰值数据逼近—公开语料趋于枯竭,价值向高质量、专家级、合规与合成数据迁移;②资本空前涌入——数据与专家
公司估值集体飙升,内容授权走向规模化;③合规成为护城河——诉讼频发叠加欧盟透明度义务,合规数据获显著溢价。
本白皮书为对外发布的行业研究,不构成投资建议;前瞻性表述以「预计/预测」标识,完整来源见末页。
03/31艺恩数据·全球大模型数据市场白皮书2026
艺恩 EXECUTIVESUMMARY·核心摘要
endata
数据,正成为大模型时代的稀缺生产要素
进入2025-2026年,随着算力竞赛逼近边际、公开互联网语料趋于枯竭,数据已从「可廉价获取的原
料」转变为决定模型上限的稀缺生产要素。市场的核心命题正由「数据规模!转向「数据质量、
专业度与合规性」。
20-35% 2026-32 143亿s 15亿s
全球AI训练数据相关市场年复 EpochAl测算的公开人类文本 Meta入股数据公司ScaleAl金 Anthropic版权和解额一 一美国
合增速区间(多家机构口径) 语料耗尽窗口(中位约2028) 额,估值达290亿美元 史上最大版权和解
三个结构性信号
①峰值数据逼近一一公开语料趋于枯竭,价值向高质量、专家级、合规与合成数据迁移;②资本空前涌入一一数据与专家
公司估值集体升,内容授权走向规模化;③合规成为护城河一一诉讼频发叠加欧盟透明度义务,合规数据获显著溢价。
本白皮书为对外发布的行业研究,不构成投资建议;前瞻性表述以「预计/预测」标识,完整来源见末页。
艺恩数据·全球大模型数据市场白皮书2026 03/31
01
PART 01· MARKET & INFLECTION
市场与拐点
规模口径分歧·增速共识·峰值数据理论
ENDATA艺恩数据·全球大模型数据市场白皮书2026
01
PARTO1· MARKET&INFLECTION
市场与拐点
规模口径分歧·增速共识·峰值数据理论
ENDATA艺恩数据·全球大模型数据市场白皮书2026
艺恩
endata
MARKET SIZE ·市场规模
狭义口径,显著低估真实市场
常被引用的「AI训练数据集」狭义口径仅约28-32亿美元(2024-25),只统计打包数据集+标注软
件。但本白皮书采用广义口径(B)=数据集+采集标注+RLHF/专家数据+合成数据:自下而上测算
2024约60-90亿、2025约100-160亿美元(毛口径买方支出)。
全球大模型数据市场规模(广义B口径)·中美拆分(亿美元) 毛□任买方支出·24-2010预X
一全球 -美国 一中国
金球=420
400
100
200
美国=200
100
中国=59
2024 2025 2026 2627 2028 2029 200
为何狭义口径失真
钱在服务里:真实支出多在标注与RLHF/专家
数据服务,而非打包数据集。
三家即超全市场:Scale(约20亿)+Surge(约14
亿)+Mercor(约亿)2025毛收入合计约42
亿美元,已超「训练数据集」狭义全球值。
|口径关系:训练数据集C采集与标注C数据
服务;狭义是子集而非全貌。
来源狭义口径MarketsandMarkets( view(321Z/2025;广义区间为自下而上加总(Scale/Surge/MercorTuring/Appen/nnodat/海天/数据堂等2025营收)与GVR〔数据
采集与标注」(亿/2025)交叉验证。头部厂商多为毛口径(含承包商支付)。2030为预测值。
艺恩数据·全球大模型数据市场白皮书2026 05/31
艺恩 MARKETSIZE·市场规模
endata
狭义口径,显著低估真实市场
常被引用的「AI训练数据集」狭义口径仅约28-32亿美元(2024-25),只统计打包数据集+标注软
件。但本白皮书采用广义口径(B=数据集+采集标注+RLHF/专家数据+合成数据:自下而上测算
2024约60-90亿、2025约100-160亿美元(毛口径买方支出)。
全球大模型数据市场规模(广义B口径)·中美拆分(亿美元) 为何狭义口径失真
全球420
钱在服务里:真实支出多在标注与RLHF/专家
数据服务,而非打包数据集。
三家即超全市场:Scale(约20亿)+Surge(约14
亿)+Mercor(约亿)2025毛收入合计约42
亿美元,已超「训练数据集」狭义全球值。
■口径关系:训练数据集C采集与标注C数据
服务;狭义是子集而非全貌。
2025 2026
来源:狭义口径MarketsandMarkets(亿/2024)、GrandView(32亿/2025);广义区间为自下而上加总(Scale/Surge/Mercor/Turing/Appen/Innodata/海天/数据堂等2025营收)与GVR「数据
采集与标注」(亿/2025交叉验证。头部厂商多为毛口径(含承包商支付)。2030为预测值
艺恩数据·全球大模型数据市场白皮书2026 05/31
艺恩
endato
SUB-MARKETS· 细分赛道
各细分赛道,高速增长共振
DATA COLLECTION &
采集与标注
2024:亿→
CAGR %GVR
LABELING
2030:171亿美元
大厂入局合成数据
NVIDIA于2025年以约亿美元收购合成数据公司
,标志头部算力厂商正式将合成数据纳入战略版
图。
ANNOTATION TOOLS
标注工具
2025:32亿→
CAGR %
Precedence
2035:亿美元
SYNTHETIC DATA
合成数据(最快)
2023:亿→
CAGR % GVR
2030:亿美元
增长的底层逻辑
Stanford HAI《2025 Al Index》:训练计算量每5个月翻
倍,数据集规模每8个月翻倍——数据需求的指数级膨
胀,是各赛道高增速的根本驱动。
DATA-AS-A-SERVICE
DaaS(泛企业级)
2023:亿→
CAGR %
GVR·全行业
2030:768亿美元
来源:GVR、Precedence、TBRC、Stanford HAl。注:DaaS为泛企业业级数据服务(覆盖全行业数据交付),口径远大于P05TAI训练数据集」的狭义市场,二者非同口径、不可直接相加比较。
06/31艺恩数据·全球大模型数据市场白皮书2026
艺恩 SUB-MARKETS·细分赛道
endata
各细分赛道,高速增长共振
DATACOLLECTION& ANNOTATIONTOOLS SYNTHETICDATA DATA-AS-A-SERVICE
LABELING
标注工具 合成数据(最快) DaaS(泛企业级)
采集与标注
2025:32亿→ 2023:亿→ 2023:亿→
2024:亿→
2035:亿美元 2030:亿美元 2030:768亿美元
2030:171亿美元
CAGR % % GVR CAGR %
CAGR % GVR
Precedence GVR·全行业
大厂入局合成数据 增长的底层逻辑
NVIDIA于2025年以约亿美元收购合成数据公司 StanfordHAl《2025AlIndex》:训练计算量每5个月翻
,标志头部算力厂商正式将合成数据纳入战略版 倍,数据集规模每8个月翻倍一一数据需求的指数级膨
图。 胀,是各赛道高增速的根本驱动。
来源:GVR、Precedence、TBRC、StanfordHAl。注:DaaS为泛企业级数据服务(覆盖全行业数据交付),口径远大于PO5『AI训练数据集」的狭义市场,二者非同口径、不可直接相加比较。
艺恩数据·全球大模型数据市场白皮书2026 06/31
艺恩
endata
PEAK DATA· 峰值数据
公开语料枯竭,价值范式转移
Epoch AI(经ICML2024同行评审)测算:可用人类公开文本存量约300万亿 token,若当前趋势持续,
训练数据集规模将在2026-2032年间与之持平,中位数预测约2028年。
训练数据集规模(指数增长)
1000万5亿
耗尽窗口·中位-2028
经开文态态盟中位7-10052
00万亿
167亿
2022 2024 2026 202# 2030 2032
来源:Epoch AI《Will we run out of data?》(ICML2024);Stanford HAI《2025Al Index》。
「数据墙」三重证据
存量有限分层。CommonCrawl约130万
亿、索引网络约510万亿 token,高质量部分
远小于此。
1 过度训练加速耗尽。Llama 3过度训练约10
倍;若转向100倍,数据触顶更早。
多轮训练放大3-15倍有效存量,但难以根本解
决枯竭。
07/31艺恩数据·全球大模型数据市场白皮书2026
艺恩 PEAKDATA·峰值数据
endata
公开语料枯竭,价值范式转移
EpochAl(经ICML2024同行评审)测算:可用人类公开文本存量约300万亿token,若当前趋势持续,
训练数据集规模将在2026-2032年间与之持平,中位数预测约2028年。
「数据墙」三重证据训练数集规模(指数增长)
1000万
耗尽窗口·中位-2028 ■存量有限分层。CommonCrawl约130万
公开文本存量中位数-300万价
C
亿、索引网络约510万亿token,高质量部分
100万亿
远小于此。
过度训练加速耗尽。Llama3过度训练约10
倍:若转向100倍,数据触顶更早。
多轮训练放大3-15倍有效存量,但难以根本解
2022 2024 2026 2028 2030 2032
决枯竭。
来源:EpochAI《Willwerunoutofdata?》(ICML2024);StanfordHAl《2025AlIndex》
艺恩数据·全球大模型数据市场白皮书2026 07/31
艺恩
endato
PARADIGM SHIFT·范式转移
从「更多数据」到「更对的数据」
行业领袖判断
「人类知识的累积总和,已基本在AI训练中被耗尽—
大体上去年就发生了。」
—Elon Musk,2025/1(via The Guardian)
真正的问题
「如果训练模型的最佳方式是生成一千万亿 token合成
数据再喂回去,那会很奇怪」——核心是「如何从更少的
数据中学到更多」。
—Sam Altman,2024/6(述要,via The Decoder)
四条出路
多模态扩容。引入图像/视频/音频可使训练数据约增3
倍(Epoch)。
合成数据。以模型生成数据反哺训练,成为缓解数据墙主
路径。
■数据效率与策展。更少但更优质数据获更强能力,「数据
中心化Al」兴起。
高质量/专家数据。通用语料见顶,稀缺的专业、垂直、
合规语料价值凸显。
本章要点
公开人类文本趋于枯竭(中位约2028),迫使行业从「数
据规模」转向「质量、专业度与多模态扩容」—这是
后续所有市场变化的根本动因。
08/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 PARADIGMSHIFT·范式转移
endatc
从「更多数据」至 到「更对的数据」
四条出路行业领袖判断
「人类知识的累积总和,已基本在AI训练中被耗尽 多模态扩容。引入图像/视频/音频可使训练数据约增3
大体上去年就发生了。」 倍(Epoch)。
ElonMusk,2025/1(viaTheGuardian) 合成数据。以模型生成数据反哺训练,成为缓解数据墙主
路径。
真正的问题 数据效率与策展。更少但更优质数据获更强能力,「数据
「如果训练模型的最佳方式是生成一千万亿token合成 中心化AI兴起。
数据再喂回去,那会很奇怪」 核心是「如何从更少的 高质量/专家数据。通用语料见顶,稀缺的专业、垂直、
数据中学到更多」。 合规语料价值凸显。
SamAltman,2024/6(述要,viaTheDecoder)
本章要点
公开人类文本趋于枯竭(中位约2028).迫使行业从「数
据规模」转向「质量、专业度与多模态扩容」一一这是
后续所有市场变化的根本动因。
艺恩数据·全球大模型数据市场白皮书2026 08/31
02
PART 02 · VALUE CHAIN & CAPITAL
价值链与资本
八层结构·质量溢价·估值狂飙与内容授权
ENDATA艺恩数据·全球大模型数据市场白皮书2026
02
PARTO2· VALUECHAIN&CAPITAL
价值链与资本
八层结构·质量溢价·估值狂飙与内容授权
ENDATA艺恩数据·全球大模型数据市场白皮书2026
艺恩
endata
VALUE CHAIN·数据价值链
八层结构,价值层层递进
① 预训练语料(web/书籍/代码) 规模化基础,边际价值随枯竭下降
② SFT指令微调数据 对齐任务格式,塑造可用性
③ RLHF/偏好数据 对齐人类偏好,决定「好用」程度
④ RLAIF/AI反馈数据 降低人工成本的规模化对齐
⑤ 专家/领域数据(PhD级) 突破专业能力天花板,溢价最高的人工数据
⑥ 评测/基准数据 能力度量与迭代方向的标尺
⑦ 合成数据 缓解数据墙、增速最快的新供给
⑧ 多模态数据(图像/视频/4D) 最稀缺、溢价最高的层级
注:价值排序为相对定性概括,实际溢价随任务、领域与稀缺度浮动。
核心规律
越靠近「专家级、多模态、可验证」的一端,单
位价值越高、可复制性越低。当通用网络语料
见顶,价值链上半部(⑤-⑧)的稀缺溢价持续抬
升。
70%+
业界观察:模型性能提升中归因于数据质量(而非架构)的比例
(Technavio,数据中心化Al)
10/31艺恩数据·全球大模型数据市场白皮书2026
本报告来源于三个皮匠报告站(),由用户Id:1181721下载,文档Id:1262447,下载日期:2026-06-02
艺恩7 VALUECHAIN·数据价值链
endata
八层结构,价值层层递进
预训练语料(web/书籍/代码) 规模化基础,边际价值随枯竭下降
核心规律
?
越靠近「专家级、多模态、可验证」的一端,单
SFT指令微调数据 对齐任务格式,塑造可用性
位价值越高、可复制性越低。当通用网络语料
RLHF/偏好数据 对齐人类偏好,决定「好用」程度
见顶,价值链上半部(③-③)的稀缺溢价持续
升。
RLAIF/AI反馈数据 降低人工成本的规模化对齐
专家/领域数据(PhD级) 突破专业能力天花板,溢价最高的人工数据
70%+
业界观察:模型性能提升中归因于数据质量(而非架构)的比例
评测/基准数据 能力度量与迭代方向的标尺
(Technavio,数据中心化Al)
合成数据 缓解数据墙、增速最快的新供给
多模态数据(图像/视频/4D) 最稀缺、溢价最高的层级
注:价值排序为相对定性概括,实际溢价随任务、领域与稀缺度浮动。
艺恩数据·全球大模型数据市场白皮书2026 10/31
艺恩 QUALITY PREMIUM·质量溢价
endata
同一份标注,价差可达数十倍
标注单价随专业度上升·通才→专家可达数十倍价差
$200-500
每小时
$100-350
每小时
~$100
每对比
$+
$
每任务
每对比对
一般偏好标注 领域专家标注 高质量RLHF专家 PhD/工程师专家 医生/资深专家
艺恩数据·全球大模型数据市场白皮书2026 11/31
艺恩 QUALITYPREMIUM·质量溢价
endata
同一份标注,价差可达数十倍
标注单价随专业度上升·通才→专家可达数十倍价差
$200-500
每小时
$100-350
每小时
~$100
每对比
$+
每任务
$
每对比对
一般偏好标注 领域专家标注 高质量RLHF专家 PhD/工程师专家 医生/资深专家
艺恩数据·全球大模型数据市场白皮书2026 11/31
艺恩
endata
CAPITAL ·资本图谱
估值狂飙,资本以真金确认数据稀缺
估值/交易规模(亿美元)
Scale AI 290
Meta的正143亿元
Surge Al 250
诈描250亿然开
Mercor 100
一年翻58
openAI-News Corp 25
5年部共25亿基天
内容授权早期累计 29
34道·朔再亿/年
“内描抑校为多年票计/单口程身习向靖德口提不两止上月收享部量源。
头部交易
Scale Al:2025/6 Meta投资143亿美元获
49??投票权股份,估值290亿。
Surge Al:2025/7洽谈以≥250亿美元估值
融资;ARR至8月达14亿美元。
Mercor:2025/10估值100亿,较2月翻5
倍;管理3万+专家。
连锁反应:中立性即资产
Meta入股Scale Al后,因数据机密性顾虑,Google、OpenAl、xAI等削减或暂停与Scale的合作,为 Surge、Mercor让出空
间——印证数据供应行业「中立性」本身即核心资产。
来源:Bloomberg、CNBC、TechCrunch、Sacra、PitchBooka
12/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 CAPITAL·资本图谱
endata
估值狂,资本以真金确认数据稀缺
估值/交易规模(亿美元) 头部交易
Scale Al 290
ScaleAl:2025/6Meta投资143亿美元获
Surge Al
250
49%无投票权股份,估值290亿。
Mercor 100
年租5低 SurgeAl:2025/7洽谈以≥250亿美元估值
OpenAl-News Corp
25 融资;ARR至8月达14亿美元。
内容授权早期累计 29
■Mercor:2025/10估值100亿,较2月翻5
倍;管理3万+专家。
连锁反应:中立性即资产
Meta入股ScaleAl后,因数据机密性顾虑,Google、OpenAl、xAl等削减或暂停与Scale的合作为Surge、Mercor让出空
间 印证数据供应行业「中立性」本身即核心资产。
来源:Bloomberg、CNBC、TechCrunch、Sacra、PitchBook。
艺恩数据·全球大模型数据市场白皮书2026 12/31
艺恩
endota
LICENSING·内容授权
从「抓取」到「付费授权」
当公开语料枯竭、版权诉讼频发,模型厂商转向授权协议。据Media &the Machine追踪,早期34
笔交易总承诺约亿美元(约亿/年)。
OpenAI-News Corp(2024/5) 5年最高亿美元·出版史最大
Reddit-Google 约6,000万美元/年
Reddit-OpenAl 估约7,000万美元/年
Shutterstock-多家 2024AI授权营收约亿
News Corp-Meta(2026/3) 5,000万/年×3年=亿
Disney-OpenAl(2025/12) 授权角色+入股OpenAI 10亿
来源:Media&the Machine、Yahoo Finance、Bloomberg。部分金额为推算。
Reddit:数据资产价值重估
据Reddit 2025Q2股东信引用Profound(分析40
亿+次AI引用):在截至2025/6/30三个月
中,Reddit 占全部AI引用为
Wikipedia(
被引来源,推动「固定费→使用量→动态定价」演
进。
13/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7
LICENSING·内容授权
endata
从「抓取」到「付费授权」
当公开语料枯竭、版权诉讼频发,模型厂商转向授权协议。据Media&theMachine追踪,早期34
笔交易总承诺约亿美元(约亿/年)。
OpenAl-NewsCorp(2024/5) 5年最高亿美元·出版史最大 Reddit:数据资产价值重估
据Reddit2025O2股东信引用Profound(分析40
Reddit - Google 约6,000万美元/年
亿+次A/引用):在截至2025/6/30三个月
Reddit-OpenAl 估约7,000万美元/年 中,Reddit占全部Al引用%,为
Wikipedia(%)两倍多一一成为Al模型第一大
Shutterstock-多家 2024AI授权营收约亿 被引来源,推动「固定费一使用量一→动态定价」演
进。
NewsCorp-Meta(2026/3) 5,000万/年×3年=亿
Disney-OpenAi(2025/12) 授权角色+入股OpenAl10亿
来源:Media&theMachine、YahooFinance、Bloomberg。部分金额为推算。
艺恩数据·全球大模型数据市场白皮书2026 13/31
艺恩
endata
FINANCING TABLE ·融资汇总
一张图看懂全球数据玩家版图
美国前沿数据公司估值已达软件级,中国玩家则多为「盈利但体量小」的上市/挂牌企业。
●美国·前沿数据公司
Scale Al ≈290亿
2025/6 Meta投143亿S·通用标注+RLHF+政企
Surge Al ≈250亿$(洽谈)
2025/7融资洽谈中(未完成)·高端 RLHF·自举
Mercor ≈100亿
2025/10C轮亿S已完成·专家人才市场/RL
Turing ≈22亿
2025/3E轮亿$·工程/编程专家数据
Snorkel Al ≈13亿
2025/5D轮1亿$·程序化数据+评测
来源:各公司2025年报/公告(NEEQ/STAR/ASX)、Bloomberg、36氪。
中国·数据/标注厂商
海天瑞声 A股688787
2025营收¥亿(+59?语音+多模态
数据堂 新三板831428
2025营收¥3,62亿(+
澳鹏中国Appen ASX:APX中国区
2025中国营收≈¥亿(+
曼孚科技
2026/4数亿元(五源资本领投)·AI数据生成/标注
Pre-C轮
艺恩ENDATA
2025营收+
新三板871430
14/31艺恩数据·全球大模型数据市场白皮书2026
艺恩
FINANCINGTABLE·融资汇总
endata
一张图看懂全球数据玩家版图
美国前沿数据公司估值已达软件级,中国玩家则多为「盈利但体量小」的上市/挂牌企业。
美国·前沿数据公司 中国·数据/标注厂商
Scale Al ~290亿 海天瑞声 A股688787
2025/6Meta投143亿S·通用标注+RLHF+政企 2025营收¥亿(+59%)·语音+多模态
Surge Al ~250亿(洽谈) 数据堂 新三板831428
2025/7融资洽谈中(未完成)·高端RLHF:自举 2025营收¥亿(+%)·拟北交所辅导
Mercor ~100亿$ 澳鹏中国Appen ASX:APX中国区
2025/10C轮亿S已完成·专家人才市场/RL 2025中国营收~?亿(+%):多模态标注
Turing ~22亿$ 曼孚科技 Pre-C 轮
2025/3E轮亿S·工程/编程专家数据 2026/4数亿元(五源资本领投)·AI数据生成/标注
Snorkel Al ~13亿$ 艺恩ENDATA 新三板871430
2025/5D轮1亿S·程序化数据+评测 2025营收+%·垂类视频多模态
来源:各公司2025年报/公告(NEEQ/STAR/ASX)、Blo0mberg、36氪。
艺恩数据·全球大模型数据市场白皮书2026 14/31
艺恩
endata
PLAYER QUADRANT·厂商象限
价值前沿,正向「专家×多模态」迁移
数据模态
1多模态 价值息地:专家*多模态
Toloka
Mercor
数施堂
读鹏中国 Turing
Snorkel
Labelbox
Appen
IMerit
单横态
价值链位置→通用标注·走向·专家/前沿/自有数据
美国厂 中arm 作统众制单田
三大梯队
价值高地(右上):Surge、Mercor、Scale、
Turing、Toloka——以专家人工判断与多
模态数据获取软件级溢价。
平台/工具(中部): Labelbox、Snorkel—
程序化标注与评测工具。
传统众包(左下·承压): Appen、iMerit——
通用单模态标注被自动化与合成数据挤压。
中国厂商卡位
海天瑞声(语音/多模态·已上市)、澳鹏中
国/曼孚科技(自动驾驶·标注)、艺恩(垂类
数据)正集中卡位多模态与垂直象限,与全
球价值迁移方向一致。
15/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 PLAYERQUADRANT·厂商象限
endata
价值前沿,正向 』「专家×多模态」迁移
数摇模态
价值真地:专家X×多楼态 三大梯队1多模态
艺界ENDATA
曼孕科技 ■价值高地(右上):Surge、Mercor、Scale、
海天瑞湾 icale Al
Surge Al Turing、Toloka—一以专家人工判断与多
OToloka 模态数据获取软件级溢价。
OMercor
数据堂
■平台/工具(中部):Labelbox、Snorkel
澳中国
程序化标注与评测工具。
O Snorkel
■传统众包(左下·承压):Appen、iMerit:
Appen 通用单模态标注被自动化与合成数据挤压。
OiMeri
中国厂商卡位
单模态
价值链位置→+通用标注·走向·专家/前沿/自有数据 海天瑞声(语音/多模态·已上市)、澳鹏中
O美国广型 ●传缆众创承压)
国/曼孚科技(自动驾驶·标注)、艺恩(垂类
数据)正集中卡位多模态与垂直象限,与全
球价值迁移方向一致。
艺恩数据·全球大模型数据市场白皮书2026 15/31
艺恩
endata
FLAGSHIP CASES· 旗舰案例
四条赛道,四个范式样本
①通用标注/ RLHF
Scale Al
营收3年×11
2021年8,000万→2024
年亿美元;Meta 143
亿入股引发中立性裂变,
客户外流反成对手红
利。
②专家/前沿数据
Surge Al/Mercor
ARR 14亿/
Surge零融资自举至超
亿$
10亿营收;Mercor3万
专家、日付150万$、时
薪~85$——瞄准5万亿
$知识劳动市场。
③内容授权
Reddit
AI引用#1
18个月市值至~390亿
$;Google 6,000万/年+
OpenAI 7,000万/年;引
用量达Wikipedia 3倍,
首创动态定价。
④垂直/具身多模态
智元AgiBot World
百万真机片段
开源百万级真机数据集,
长程任务规模约为
Google Open X-
Embodiment的10
倍、场景覆盖100倍;中
国具身数据供应链成
型。
范式启示
价值正从「规模化通用标注」流向「专家判断、独家授权与具身多模态」。谁掌握稀缺合规数据,谁就掌握定价权。
16/31
来源:Inc.、CNBC、Bloomberg、澎湃新闻、智元机器人。Surge营收为第三方追踪,Scale 2025营收为预测。
艺恩数据·全球大模型数据市场白皮书2026
艺恩7 FLAGSHIPCASES·旗舰案例
endata
四条赛道,四人范式样本
①通用标注/RLHF ②专家/前沿数据 ③内容授权 ④垂直/具身多模态
Scale Al Surge Al / Mercor Reddit 智元AgiBotWorld
营收3年×11 ARR14亿/ AI 引用 #1 百万真机片段
亿$2021年8,000万→2024 18个月市值至~390亿 开源百万级真机数据集,
年亿美元;Meta143
Surge 零融资自举至超
$;Go0gle6000万/年+ 长程任务规模约为
亿入股引发中立性裂变, OpenAl7,000万/年;引 Google Open X-10亿营收:Mercor3万
客户外流反成对手红 用量达Wikipedia3倍, Embodiment 的10专家、日付150万S、时
利。 首创动态定价。 倍、场景覆盖100倍;中薪~85S一瞄准5万亿
国具身数据供应链成知识劳动市场。
型。
范式启示
价值正从「规模化通用标注」流向「专家判断、独家授权与具身多模态」。谁掌握稀缺合规数据,谁就掌握定价权。
16/31
03
PART 03 ·cOMPLIAN CE & REGULATION
合规与监管
版权诉讼·出海风险·欧盟AI法案
ENDATA艺恩数据·全球大模型数据市场白皮书2026
03
PARTO3 COMPLIANCE®ULATION
合规与监管
版权诉讼·出海风险·欧盟AI法案
ENDATA艺恩数据·全球大模型数据市场白皮书2026
艺恩
endata
LITIGATION·法律战
从诉讼频发,到「合规即护城河」
截至2025年10月,全球追踪到的AI版权诉讼达51-166起。法院核心分野正在形成:「合法获取」
可能构成合理使用,「盗版内容」则明确不被宽宥——这直接抬高合规数据溢价。
标志性诉讼与和解(亿美元/阶段)
Anthropic版权和解 15亿
20259·温插书認
UMG等 31亿5
2026/1·举(诉潮
NYT 审
202
(德) 判
2025/11·欧诉
Disney等 开
2026/5遮入并示
来源:AILawsuit Tracker、McKool Smith、OpenAI及各法院文书。
核心启示
美国已有3位法官就AI训练合理使用裁决
(2支持训练方、1反对),均强调训练「高度
转化性」,但严格区分内容获取来源是否合
法。合规由此从「成本项」转为「定价
项」。
18/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7
LITIGATION·法律战
endata
从诉讼频发,到「合规即护城河」
截至2025年10月,全球追踪到的AI版权诉讼达51-166起。法院核心分野正在形成:「合法获取」
可能构成合理使用,「盗版内容」则明确不被宽有一 一这直接抬高合规数据溢价。
标志性诉讼与和解(亿美元/阶段)
核心启示
Anthropic版权和解 15亿$
2025/9-盗版书籍 美国已有3位法官就AI训练合理使用裁决
UMG等v. Anthropic 31亿$
(2支持训练方、1反对),均强调训练「高度
2026/1-音乐(求)
NYT v, OpenAI 转化性」,但严格区分内容获取来源是否合
2026/4即决事列
法。合规由此从「成本项」转为「定价
(德)
项J。2025/11·股诉
Disney等v. MiniMax 开
2026/5进入开示
来源:AlLawsuitTracker、McKoolSmith、OpenAl及各法院文书。
艺恩数据·全球大模型数据市场白皮书2026 18/31
艺恩
endata
CROSS-BORDER·出海风险
海外视频版权风险· MiniMax/海螺案
Disney等
原告:迪士尼、环球、华纳兄弟探索等12家(2025/9/16,
加州中区联邦法院)。
指控:大规模盗用版权角色;复诉引述海螺自标榜「口袋
里的好莱坞工作室」。
诉求:每件作品最高15万美元法定赔偿+禁令。
最新:2026/5/23法官驳回撤案动议,进入证据开示
(Reuters)。
提示:此为程序性裁决,尚未认定侵权,无赔偿/和解;15万美元为法定上限索赔额。
中国AIGC版权裁决·态度已确立
北京互联网法院李某案(2023/11):首例Al生成图片版
权案,认定可版权性,判赔5,000元。
■广州互联网法院奥特曼案(2024/2):全球首例GenAI输
出侵权裁决,判赔1万元,要求关键词过滤。
杭州互联网法院LoRA案(2024):认定平台帮助侵权判
赔3万元;区分训练与生成阶段责任。
来源:、Wolters Kluwer、KWM等。
19/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 CROSS-BORDER·出海风险
endata
海外视频版权风险·MiniMax/海螺案
Disney等 中国AIGC版权裁决·态度已确立
■原告:迪士尼、环球、华纳兄弟探索等12家(2025/9/16, ■北京互联网法院李某案(2023/11):首例AI生成图片版
加州中区联邦法院)。 权案,认定可版权性,判赔5,000元。
■指控:大规模盗用版权角色:复诉引述海螺自标榜「口袋 ■广州互联网法院奥特曼案(2024/2):全球首例GenAl输
里的好莱坞工作室」。 出侵权裁决,判赔1万元,要求关键词过滤。
■诉求:每件作品最高15万美元法定赔偿+禁令。 杭州互联网法院LoRA案(2024):认定平台帮助侵权判
■最新:2026/5/23法官驳回撤案动议,进入证据开示 赔3万元;区分训练与生成阶段责任。
(Reuters)。
来源:Reuters、Variety、WoltersKluwer、KWM等。
提示:此为程序性裁决,尚未认定侵权,无赔偿/和解;15万美元为法定上限索赔额。
艺恩数据·全球大模型数据市场白皮书2026 19/31
艺恩
endato
EU AI ACT·欧盟法案
训练数据透明度,成为硬约束
欧盟《AI法案》2024/8/1生效,GPAI义务2025/8/2适用,2026/8/2全面适用。其对训练数据的透
明度要求,正把「合规」从自愿变为法定义务。
ARTICLE 53(1)(d)
训练内容摘要披露
须按AI Office模板公开训练内容
「充分详细摘要」(含受版权数据),
披露数据类型、来源及公开数据集
前10?名。
CODE OF PRACTICE
GPAI行为准则
2025/7/10发布,含透明度、版权、
安全三章;系统性风险门槛1025
FLOP(全球约5-15家公司适用)。
TRANSITION
过渡安排
2025/8前已上市模型,有至
2027/8/2宽限期;模板自2025/7/24
起强制使用。
合规如何转化为定价能力
诉讼频发、监管趋严下,可审计、可溯源的合规授权数据获结构性溢价。内容/肖像/音乐版权的多层授权链条与可披露来源
证明,已成为高端供应商区别于「爬虫式」供给的核心壁垒——合规转化为议价筹码。
20/31
来源:European Commission、Jones Day、Skadden、WilmerHale等。
艺恩数据·全球大模型数据市场白皮书2026
艺恩7 EUAIACT·欧盟法案
endata
训练数据透明度,成为硬约束
欧盟《Al法案》2024/8/1生效.GPAl义务2025/8/2适用2026/8/2全面适用。其对训练数据的透
明度要求,正把「合规」从自愿变为法定义务。
ARTICLE53(1)(d) CODEOFPRACTICE TRANSITION
训练内容摘要披露 GPAI行为准则 过渡安排
须按AlOffice模板公开训练内容 2025/7/10发布,含透明度、版权、 2025/8前已上市模型,有至
「充分详细摘要」(含受版权数据) 安全三章;系统性风险门槛1025 2027/8/2宽限期;模板自2025/7/24
披露数据类型、来源及公开数据集 FLOP(全球约5-15家公司适用)。 起强制使用。
前10%域名。
合规如何转化为定价能力
诉讼频发、监管趋严下,可审计、可溯源的合规授权数据获结构性溢价。内容/肖像/音乐版权的多层授权链条与可披露来源
证明,已成为高端供应商区别于「爬虫式」供给的核心壁垒一 一合规转化为议价筹码。
来源:EuropeanCommission、JonesDay、Skadden、WilmerHale等。
艺恩数据·全球大模型数据市场白皮书2026 20/31
04
PART 04 · GLO BAL · US-CHINA · OUTL00K
全球格局·中美双核·未来
多模态前沿·中美生态·趋势判断
ENDATA艺恩数据·全球大模型数据市场白皮书2026
04
PARTO4· GLOBAL US-CHINA OUTLOOK
全球格局·中美双核·未来
多模态前沿·中美生态·趋势判断
ENDATA艺恩数据·全球大模型数据市场白皮书2026
艺恩
endata
MULTIMODAL ·多模态
最稀缺、溢价最高的层级
当文本语料见顶,竞争前沿转向视频与多模态。视频生成与世界模型对「高质量、合法授权、富标
注」语料的渴求,使这一层级成为整个数据市场中最稀缺、单位价值最高的部分。
视频生成:竞争白热化
OpenAI Sora 2、Google Veo 3、快手可灵、Vidu、海
螺、Runway同台竞技。Google Veo的4K真实感与
原生音频优势,直接来自YouTube训练数据——印证
独家高质量视频语料的决定性价值。
「黄金数据」稀缺
可灵团队论文明确指出:视频生成严重依赖同时具备高
视觉质量(VQ)与高运动质量(MQ)的「黄金数据」;此
类数据集稀少且获取昂贵,是规模化的主要限制。
来源:NVIDIA、Kling(arxiv)、信通院等研究。
4D/多视角空间数据与世界模型
世界模型(NVIDIA定义:理解真实世界动态、含物理与
空间属性的生成式AI)面临「配对多视角数据严重稀
缺」。具身数据「稀缺、采集困难、高维」,被视为机
器人达到「GPT时刻」的关键瓶颈。
中国进展
合成灵巧抓取数据集DexGraspNet 达10亿规模;头
部具身公司部署百台机器人,日产真机数据上万条(信通
院)。路径正从「真机采集」走向「合成引擎+真机精
调」。
22/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7
MULTIMODAL·多模态
endate
最稀缺、溢价最高的层级
当文本语料见顶,竞争前沿转向视频与多模态。视频生成与世界模型对「高质量、合法授权、富标
注」语料的渴求,使这一层级成为整个数据市场中最稀缺、单位价值最高的部分。
视频生成:竞争白热化 4D/多视角空间数据与世界模型
OpenAlSora2、GoogleVeo3、快手可灵、Vidu、海 世界模型(NVIDIA定义:理解真实世界动态、含物理与
螺、Runway同台竞技。GoogleVeo的4K真实感与 空间属性的生成式A)面临「配对多视角数据严重稀
原生音频优势,直接来自YouTube训练数据一一印证 缺」。具身数据「稀缺、采集困难、高维」,被视为机
独家高质量视频语料的决定性价值。 器人达到「GPT时刻」的关键瓶颈。
「黄金数据」稀缺 中国进展
可灵团队论文明确指出:视频生成严重依赖同时具备高 合成灵巧抓取数据集达10亿规模;头
部具身公司部署百台机器人,日产真机数据上万条(信通
视觉质量(VQ)与高运动质量(MQ)的1黄金数据」;此
院)。路径正从「真机采集」走向「合成引擎+真机精
类数据集稀少且获取昂贵,是规模化的主要限制。
调』。
来源:NVIDIA、Kling(arXiv)、信通院等研究
艺恩数据·全球大模型数据市场白皮书2026 22/31
艺恩
endata
CHINA MARKET·中国市场
「数据要素」国家战略驱动的独特生态
120亿元 7
信通院测2024中国数据标注产
业规模,核心企业超600家
已建成国家数据标注基地,赋能
121个国产大模型(商务部)
三大政策支柱
■「数据要素×」三年行动(2024-2026):聚焦12行
业,2026年底打造300+示范场景,数据产业年均增速超
20??
■数据资源入表:财政部《暂行规定》2024/1/1施行,数据
从费用化转为资产负债表内显性化。
数据标注产业专项:国家发改委2024/12实施意见,目标
2027年产业规模大幅跃升。
来源:国家发改委、财政部、国家数据局、商务部、信通院公开文件。
140万亿 万亿
日均Token消耗(2026/3,国家数
据局),较2024初增千倍
2030年我国数据产业规模预测
(国家数据局,元)
Token消耗爆发
中国日均Token消耗·两年增长约干倍(对数轴)
140万亿/目
100n2
加列候
152
100
24 2024中 20265 02 20963
23/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 CHINAMARKET·中国市场
endata
「数据要素」 国家战略驱动的独特生态
120亿元 7 140万亿 万亿
信通院测2024中国数据标注产 已建成国家数据标注基地,赋能 日均Token消耗(2026/3国家数 2030年我国数据产业规模预测
业规模,核心企业超600家 121个国产大模型(商务部) 据局),较2024初增千倍 (国家数据局,元)
三大政策支柱 Token消耗爆发
「数据要素×」三年行动(2024-2026):聚焦12行 中国日均Token消耗·两年增长约千倍(对数轴)
140万亿/日
业,2026年底打造300+示范场景,数据产业年均增速超
20%
数据资源入表:财政部《暂行规定》2024/1/1施行,数据
从费用化转为资产负债表内显性化。
数据标注产业专项:国家发改委2024/12实施意见,目标
2027年产业规模大幅跃升。 20244 2024末 2025中 2026/3
来源:国家发改委、财政部、国家数据局、商务部、信通院公开文件。
艺恩数据·全球大模型数据市场白皮书2026 23/31
艺恩
encata
CHINA MODELS ·中国大模型
大模型数量全球第一
中国已发布大模型1509个、数量居全球首位(占全球约40?AI企业超5,300家(中国信通
院,2025)。在开源社区HuggingFace趋势榜上,2025年7月前10名开放权重模型中国占9席(智谱
GLM、阿里Qwen等);GPT、Claude、Gemini等闭源模型不在该开源榜内。
中国主流大模型·代表厂商与定位
字节豆包Doubao
实有路六新增
阿盟通文Qwen
开3-B-理
DeepSeek 18%
367班+即质nssn
西度文心ERNIE 12%
A55时·424at
腾讯温元Hunyuan 8%
多相急全指
快手可奥Kling 6%
81度·Gim约iae
需hu有大地盟090c地力,
市场体量
据信通院测算,中国AI大模型相关市场规模
快速扩张,垂类应用加速落地。
DeepSeek V3671B参数,末次训练成本约
万美元(不含前期研发)。
Omdia预测中国生成式AI市场到2029年达
98亿美元。
竞争特征
区别于美国「少数寡头」格局,中国呈「多
头并进」一—通用、视频、多模态多赛道
24/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 CHINAMODELS·中国大模型
endata
大模型数量全球第一
中国已发布大模型1509个、数量居全球首位(占全球约40%).AI企业超家(中国信通
院,2025)。在开源社区HuggingFace趋势榜上,2025年7月前10名开放权重模型中国占9席(智谱
GLM、阿里Qwen等);GPT、Claude、Gemini等闭源模型不在该开源榜内。
中国主流大模型·代表厂商与定位 市场体量
字节豆包Doubao
■据信通院测算,中国AI大模型相关市场规模
阿黑通文Qwe
快速扩张,垂类应用加速落地。
DeepSeek
DeepSeekV3671B参数,末次训练成本约
百度文心ERI
万美元(不含前期研发)。
腾讯混元Hunyu
Omdia预测中国生成式Al市场到2029年达
快手可买KI 98亿美元。
竞争特征
区别于美国「少数寡头」格局,中国呈「多
头并进」一 通用、视频、多模态多赛道
艺恩数据·全球大模型数据市场白皮书2026 24/31
艺恩
endota
CHINA vs US·中美对比
两套逻辑,两种数据生态
中美数据市场由两套不同逻辑驱动:美国前沿实验室拉动、专家数据溢价、软件级估值;中国「数据
要素」国家战略+垂类模型驱动。
中美关键指标对比·双色分组条形 ■ 面中国 头部粼据厂商估值里吸·中美对比(对欺随,亿美元) 1199
大模整数量占比 44%
00C
A1企业占比 34%
2024投资 641亿
悠
数据标注市场 =3422
586忆V60Z) k Lp o erse yH B
模型断调用2026/2 万亿
美国·前沿驱动 前沿实验室拉动+专家数据溢价+VC催化;头部数据公司估值高出中国约1-2个数量级。
中国·战略统筹「数据要素」国家战略+7大标注基地+数据资源入表;要素流通市场2024约¥1,662亿。
来源:Stanford HAl、信通院、iResearch、OpenRouter、GVR(完整来源见末页)。
25/31艺恩数据·全球大模型数据市场白皮书2026
艺恩 CHINAVSUS·中美对比
endata
两套逻辑,两种数据生态
中美数据市场由两套不同逻辑驱动:美国前沿实验室拉动、专家数据溢价、软件级估值;中国「数据
要素」国家战略+垂类模型驱动。
中美关键指标对比·双色分组条形 类汉 ■中国
,中美对比对数鞋,亿美元
大模型数量占比
AI企业占比
2024AI投资 641亿
55亿5
数据标注市场 5420 .
86亿(609亿
模型周调用2026/2
美国·前沿驱动前沿实验室拉动+专家数据溢价+VC催化;头部数据公司估值高出中国约1-2个数量级。
中国·战略统筹 「数据要素」国家战略+7大标注基地+数据资源入表;要素流通市场2024约¥1,662亿。
来源:StanfordHAl、信通院、iResearch、OpenRouter、GVR(完整来源见末页)。
艺恩数据·全球大模型数据市场白皮书2026 25/31
艺恩
endata
OUTLOOK·未来展望
全球趋势:从「规模」到「质量与专业化」
①合成数据走向主导(前瞻)
Gartner预测合成数据占比将于
2030年全面超越真实数据。
④从规模转向质量专业化
垂直领域数据溢价上升:要的不
是更大模型,而是更专业数据。
②专家/前沿人类数据崛起
RL环境、agentic data、可验证
奖励成新焦点,专家数据公司估
值飙升印证。
⑤具身Al与世界模型成增长极
世界模型既消耗数据,也生成未
来训练的合成数据。
>50%
合成数据占比
③数据飞轮成护城河
「交互→数据→模型改进」闭环
⑥中美双核·两套路径
美国前沿实验室+专家数据溢价;
中国数据要素战略+垂类落地。
合成数据 真实数据
Gartner:2030合成数据将超真实数据
成最难复制壁垒。
结语
胜负手正从「更多算力」转向「更优质、更合规的数据」;公开语料枯竭非终点,而是价值化的起点。
来源:Gartner、Omdia及前述客章。「预测/前睢丁为前雌性推演。
艺恩数据·全球大模型数据市场白皮书2026 26/31
艺恩7
OUTLOOK·未来展望
endata
全球趋势:从「规模」至 到「质量与专业化」
①合成数据走向主导(前瞻) ④从规模转向质量专业化
Gartner预测合成数据占比将于 垂直领域数据溢价上升:要的不
2030年全面超越真实数据。 是更大模型,而是更专业数据。
②专家/前沿人类数据崛起 5具身AI与世界模型成增长极
>50%
合成数据占比
RL环境、agentic data、可验证 世界模型既消耗数据,也生成未
奖励成新焦点,专家数据公司估 来训练的合成数据。
值升印证。 ③中美双核·两套路径
③数据飞轮成护城河 美国前沿实验室+专家数据溢价 ■合成数据 ■真实数据
「交互→数据→模型改进」闭环 中国数据要素战略+垂类落地。
Gartner:2030合成数据将超真实数据
成最难复制壁垒。
结语
胜负手正从「更多算力」转向「更优质、更合规的数据」;公开语料枯竭非终点,而是价值化的起点。
来源:Gartner、Omdia及前述各章。f预测/前瞻丁为前瞻性推演。
艺恩数据·全球大模型数据市场白皮书2026 26/31
05
PART 05 · END ATA PRO DU CTS
艺恩核心产品
数据集业务·Video Feeds·ENBASE数据魔方
ENDATA艺恩数据·全球大模型数据市场白皮书2026
05
PARTO5· ENDATAPRODUCTS
艺恩核心产品
数据集业务·VideoFeeds·ENBASE数据魔方
ENDATA艺恩数据·全球大模型数据市场白皮书2026
艺恩
endata
ENDATA PRODUCTS ·核心产品
高质量、合规、垂直的数据弹药库
服务头部通用大模型、垂直多模态模型、Al Infra与MaaS平台。提供数据集授权+全链路定制:清
洗·结构化·标注·向量化·合规审计·场景化定制。
PRE-TRAINING
预训练数据集
120+语言方言
TB级多语种垂类语料
ALIGNMENT
SFT/RLHF
高质量指令对·多轮·
偏好对齐
CoT与偏好对齐
MULTIMODAL
多模态对齐
视频·图像·文本三模
V-T/I-T/A-V
态自然对齐语料
CUSTOM
定制化数据
按训练目标的端到端处
私有化·合规
理与交付
VIDEO FEEDS·面向视频原生AI与具身智能
以「影视综+社媒+电商」累积全球级视频资产,配套元数据Schema与多任务标签,为视频生成、理解、世界模型与VLA训
练提供持续、合规的数据流。+视频片段沉淀·800TB+日均交付带宽·120+任务族覆盖。
28/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7
ENDATAPRODUCTS·核心产品
endata
高质量、合规、垂直的数据弹药库
服务头部通用大模型、垂直多模态模型、AlInfra与MaaS平台。提供数据集授权+全链路定制:清
洗·结构化·标注·向量化·合规审计·场景化定制。
PRE-TRAINING ALIGNMENT MULTIMODAL CUSTOM
预训练数据集
SFT / RLHF
多模态对齐 定制化数据
TB级多语种垂类语料 高质量指令对·多轮· 视频·图像·文本三模 按训练目标的端到端处
CoT 与偏好对齐 态自然对齐语料 理与交付
120+语言方言
偏好对齐 V-T / I-T / A-V 私有化·合规
VIDEOFEEDS·面向视频原生AI与具身智能
以「影视综+社媒+电商」累积全球级视频资产,配套元数据Schema与多任务标签为视频生成、理解、世界模型与VLA训
练提供持续、合规的数据流。+视频片段沉淀·800TB+日均交付带宽·120+任务族覆盖。
艺恩数据·全球大模型数据市场白皮书2026 28/31
艺恩
endata
ENBASE ·数据魔方
ENBASE数据魔方,AI数据副驾驶
不再只是查数工具——enbase是客户决策层桌面上的AI数据副驾驶。自然语言发起复杂查询,同
步返回结构化数据、关联视频片段、趋势图谱与生成式洞察摘要。
与客户同行的三条承诺
QUALITY·只交付「对的数据」
多维质量评估·合规过滤·人工
复核,共同构成交付质量底线。
01· AI检索
对话式发现
自然语言对话式发现,重构数据接入
方式。
02· 生成式分析
洞察自动生成
洞察摘要·趋势归因·对比解读
自动生成。
TRANSPARENCY·透明可追溯
每条数据有清晰来源链路与授权状
态,可审计、可溯源、可验证。
03·三模态调取
一站式调用
视频·图像·文本一站式调用与关
联检索。
PARTNERSHIP·长期伙伴
共同规划数据路线图,持续迭代、
持续优化、共同进步。
29/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7
ENBASE·数据魔方
endata
ENBASE数据魔方.AI数据副驾驶
不再只是查数工具一一enbase是客户决策层桌面上的Al数据副驾驶。自然语言发起复杂查询,同
步返回结构化数据、关联视频片段、趋势图谱与生成式洞察摘要。
01·AI检索 02·生成式分析 03·三模态调取
对话式发现 洞察自动生成 一站式调用
自然语言对话式发现,重构数据接入 洞察摘要·趋势归因·对比解读 视频·图像·文本一站式调用与关
方式。 自动生成。 联检索。
与客户同行的三条承诺
QUALITY·只交付「对的数据』 TRANSPARENCY·透明可追溯 PARTNERSHIP·长期伙伴
多维质量评估·合规过滤·人工 每条数据有清晰来源链路与授权状 共同规划数据路线图,持续选代、
复核,共同构成交付质量底线。 态,可审计、可溯源、可验证。 持续优化、共同进步。
艺恩数据·全球大模型数据市场白皮书2026 29/31
艺恩
endota
sOURCES·研究方法与来源
可核实、区间呈现、区分事实与预测
本白皮书基于公开可核实的权威研究机构报告、监管文件、主流财经媒体与学术论文综合编撰。所
有市场规模数据均标注来源与年份;口径分歧者以区间呈现;前瞻性预测均以「预计/预测」标识。本
白皮书为行业研究,不构成投资建议。
01 Epoch AI—Will we run out of data?(ICML2024)
02 Stanford HAI—2025AI Index Report
03 MarketsandMarkets/Grand View Research/Straits Research/FBI/GMI
04 Precedence Research/The Business Research Company/Technavio
05 Bloomberg/CNBC/TechCrunch/Reuters
06 Sacra/PitchBook
07 Media&the Machine/Search Engine Land/Yahoo Finance
09 European Commission/Jones Day/Skadden/WilmerHale
10 Wolters Kluwer/Linklaters/KWM/Digital Watch
11 信通院/国家发改委/财政部/国家数据局/商务部
12 信通院/头豹研究院/沙利文/人民日报/IDC
13 arxiv(Kling、TesserAct、Embody4D等)/Gartner/Omdia
08 AILawsuit Tracker/Sustainable Tech Partner/McKool Smith
30/31艺恩数据·全球大模型数据市场白皮书2026
艺恩7 SOURCES·研究方法与来源
endata
可核实、区间呈现、区分事实与预测
本白皮书基于公开可核实的权威研究机构报告、监管文件、主流财经媒体与学术论文综合编撰。所
有市场规模数据均标注来源与年份;口径分歧者以区间呈现;前瞻性预测均以「预计/预测」标识。本
白皮书为行业研究,不构成投资建议。
01 EpochAl-Will werunoutofdata?(ICML2024) 08 AlLawsuitTracker/SustainableTechPartner/McKoolSmith
02 StanfordHAI-2025Al IndexReport 09 EuropeanCommission/JonesDay/Skadden/WilmerHale
03 MarketsandMarkets/GrandViewResearch/StraitsResearch/FBI/GMI 10 WoltersKluwer/Linklaters/KWM/DigitalWatch
04 PrecedenceResearch/TheBusinessResearchCompany/Technavio 11 信通院/国家发改委/财政部/国家数据局/商务部
05 Bloomberg/CNBC/TechCrunch/Reuters 12 信通院/头豹研究院/沙利文/人民日报/IDC
06 Sacra/PitchBook 13 arXiv(Kling、TesserAct、Embody4D等)/Gartner/Omdia
07 Media&theMachine/SearchEngineLand/YahooFinance
艺恩数据·全球大模型数据市场白皮书2026 30/31
让数据,成为AI时代的价值坐标
无论你是大模型厂商寻找「对的数据」,还是出海品牌寻找「懂中国也懂全球」的数据伙伴——艺恩都已准备
好下一程。
BUSINESS·商务合作
cs@
TEL·电话
+86-010-85899985
SERVICE·服务热线
400-052-9966
北京艺恩世纪数据科技股份有限公司·NEEQ871430·北京/杭州/上海/海外CA
全球大模型数据市场白皮书
2026年版·第一版
让数据,成为AI时代的价值坐标
无论你是大模型厂商寻找「对的数据」,还是出海品牌寻找「懂中国也懂全球」的数据伙伴 艺恩都已准备
好下一程。
BUSINESS·商务合作 TEL·电话 SERVICE·服务热线
cs@ +86-010-85899985 400-052-9966
北京艺恩世纪数据科技股份有限公司·NEEQ871430·北京/杭州/上海/海外CA
全球大模型数据市场白皮书
2026年版·第一版
艺恩数据
ENDATA
产品矩阵·2026
PRODUCT PORTFOLIO·三条产品线
三条产品线
一个数据底座
艺恩数据以数据集业务/AIDATA/enbase数据魔方三条产品线,覆盖大模型训练
数据、Al专项数据集与营销决策SaaS的全场景需求。
数据集业务 AIDATA专线 enbase SaaS 全链路合规
艺恩数据
产品矩阵,2026
ENDATA
PRODUCTPORTFOLIO·三条产品线
三条产品线
一个数据底座
艺恩数据以数据集业务/AIDATA/enbase数据魔方三条产品线,覆盖大模型训练
数据、AI专项数据集与营销决策SaaS的全场景需求。
数据集业务 AIDATA专线 enbaseSaas 全链路合规
一 DATASETS·数据集业务
100%
授权合规
高质量·合规·垂直
数据弹药库
服务大模型厂商与 Al Infra平台。4,000+成品数据集,三模态全覆盖。
4000
成品 SKU
3
模态覆盖
4
垂直领域
视频数据集
VIDEO DATASETS
剧集·短视频·直播全品类,VLA Ready,支持RLDS
/LeRobot v3格式。
VLA Ready RLDS LeRobot
回
图像数据集
IMAGE DATASETS
海报·KOL·SKU·电商多模态对齐,美妆/服饰/食
饮/3C全品类。
多模态对齐 高精度标注
文本数据集
TEXT DATASETS
对话SFT/偏好RLHF/RAG 知识库,覆盖多场景,支
SFT
持30+语言。
RLHF RAG 多语宫
?
版权合规体系
COPYRIGHT CHAIN
三层版权审计,每份数据集附完整授权链路文件,满足
iSO 27701
ISO 27701要求。
三层合规
DATASETS·数据集业务
高质量·合规·垂直
数据弹药库
服务大模型厂商与AlInfra平台。4,000+成品数据集,三模态全覆盖。
4000* 3 4 100%
成品SKU 模态覆盖 垂直领域 授权合规
视频数据集 文本数据集
VIDEO DATASETS TEXTDATASETS
剧集·短视频·直播全品类,VLAReady,支持RLDS 对话SFT/偏好RLHF/RAG知识库,覆盖多场景,支
/LeRobotv3格式。 持30+语言。
VLAReady RLDS LeRobot SFT RLHF RAG 多语言
图像数据集 版权合规体系
IMAGEDATASETS COPYRIGHT CHAIN
海报,KOL,SKU,电商多模态对齐,美妆/服饰/食 三层版权审计,每份数据集附完整授权链路文件,满足
饮/3C全品类。 ISO27701要求。
多模态对齐 高精度标注 ISO27701 三层合规
一 AIDATA·AI数据专线
面向LLM/具身智能
出海Al的专属数据
为大模型厂商、具身智能公司、跨境AI平台提供高质量合规内容数据集,覆盖海外电商与社媒数据。
艺恩AIDATA专线
以海外电商+社媒数据集为核心产品,对接国际大模型厂商与出海AI公司的训练数据需求,涵盖跨境
电商及海外主流社媒平台,30+语言覆盖。
LLM预训练语料
TB级中文/多语言语料,去重·去噪·质检全流程
· VLA具身智能数据
动作序列+语言指令对齐,RLDS/LeRobot格式
●海外电商数据集
跨境平台多语种语料,支持SFT/RAG场景
●社媒数据集
海外主流平台内容,30+语言,含情感标注
AIDATA·AI数据专线
面向LLM/具身智能
出海 AI 的专属数据
为大模型厂商、具身智能公司、跨境AI平台提供高质量合规内容数据集,覆盖海外电商与社媒数据。
艺恩AIDATA专线
以海外电商+社媒数据集为核心产品,对接国际大模型厂商与出海AI公司的训练数据需求,涵盖跨境
电商及海外主流社媒平台,30+语言覆盖。
LLM预训练语料 VLA具身智能数据
TB级中文/多语言语料,去重·去噪·质检全流程 动作序列+语言指令对齐,RLDS/LeRobot格式
海外电商数据集 社媒数据集
跨境平台多语种语料,支持SFT/RAG场景 海外主流平台内容,30+语言,含情感标注
一 SAAS·ENBASE 数据魔方
从"查数工具"升级为
AI数据副驾驶
enbase 以自然语言为入口,整合三模态数据调取与 Al分析,是决策层的一站式数据工作台。
enbase 数据魔方 ·Al Co-pilot
把数据资产
封装为决策入口
无需 SQL,自然语言直接返回多维数据洞察;视频/图像/文本三模态一键调取;内置品牌声量实时监测与
竞品追踪。
Q
AI自然语言检索
输入问题直接返回洞察
三模态调取
视频·图像·文本
品牌声量追踪
实时监测竞品动态
API开放接入
私有化部署支持
◎ ◎ 北京市专精特新国家高新技术企业 日 ISO 20000·27001·27701 ◎ AI数据标注能力评估
⊙数据安全管理认证
SAAS·ENBASE数据魔方
从查数工具升级为
AI数据副驾驶
以自然语言为入口,整合三模态数据调取与Al分析,是决策层的一站式数据工作台。
一 enbase数据魔方 -AlCo-pilot
把数据资产
封装为决策入口
无需SQL,自然语言直接返回多维数据洞察;视频/图像/文本三模态一键调取;内置品牌声量实时监测与
竞品追踪。
飞
AI自然语言检索 三模态调取 品牌声量追踪 API开放接入
输入问题直接返回洞察 视频·图像·文本 实时监测竞品动态 私有化部署支持
?国家高新技术企业 北京市专精特新 日1S020000·27001·27701 AI数据标注能力评估
数据安全管理认证
知识星球 行业与管理资源
知识星球 行业与管理资源