DataHubDataNav
返回数据导航

AI Dataset Sources

AI 数据集导航

DataHub AI 数据集导航整理机器学习、NLP、语音、计算机视觉、标注与合成数据资源入口,适合模型训练、评测、数据增强和 AI 应用调研。

适合搜索 AI 数据集、机器学习数据集、NLP 数据集、计算机视觉数据集、语音数据集、标注数据和合成数据的用户。

AI 数据集的价值不只取决于数量,还取决于任务定义、标签质量、数据许可、更新方式和是否能与模型训练流程衔接。DataHub 将 NLP、语音、计算机视觉、标注平台、合成数据和数据增强资源放在同一专题,便于从任务类型出发做筛选。

本页适合模型训练前的资源调研,也适合产品团队判断某类 AI 应用是否已有公开数据基础。对于 Hugging Face Datasets、Papers with Code、OpenML、Roboflow、COCO、ImageNet、LibriSpeech 等资源,建议同时查看原站说明、数据许可、论文引用方式和样本偏差。

如果你的目标是做中文 AI 应用或行业模型,建议把本页与中国数据平台、研究数据仓库和 DataHub AI 行业岗位数据一起使用:前者帮助找训练和评测素材,后者帮助理解市场正在招聘哪些 AI 能力。

适合哪些场景

  • 寻找 NLP、语音、视觉、标注和合成数据资源。
  • 为模型训练、评测、数据增强和 benchmark 对比建立来源清单。
  • 判断某个 AI 应用方向是否已有可复用公开数据。

代表资源入口

从 DataHub 数据导航中抽取的高相关数据平台

12
IM
ImageNet image-net.org

计算机视觉领域里程碑式的大规模图像数据集。完整版包含超过1400万张已标注图像和2万多个类别。其子集(ILSVRC)包含120万张训练图像和1000个类别,它的出现极大地推动了深度学习的发展。

CO
COCO (Common Objects in Context) cocodataset.org

一个大规模、高质量的图像数据集,专为目标检测、实例分割和图像描述等复杂任务设计。它包含超过33万张图像,以其复杂的日常场景和每张图包含多个物体的特点而著称。

OP
Open Images Dataset storage.googleapis.com

由谷歌发布的一个超大规模、标注丰富的图像数据集。包含约900万张图像,带有图像级标签、物体边界框、实例分割掩码和视觉关系标注,是目前规模最大的带精细标注的图像数据集之一。

MN
MNIST yann.lecun.com

经典的手写数字识别数据集,包含6万张训练图像和1万张测试图像,是计算机视觉入门的“Hello World”。

CO
Common Crawl commoncrawl.org

PB级的公开网络爬取数据,包含海量原始网页文本,是训练大规模语言模型(LLM)最重要的语料来源之一。

WI
Wikipedia Dumps dumps.wikimedia.org

维基媒体基金会提供的维基百科全站内容的离线数据库备份。它包含数百种语言的文本语料,数据规模达到TB级别,同样是训练LLM的重要语料来源。

BO
BookCorpus yknzhu.wixsite.com

一个包含超过11,000本未出版英文书籍文本的大型数据集,常用于语言模型的预训练。

CC
CC100 (Common Crawl 100) data.statmt.org

从Common Crawl网络爬取数据中提取并清洗后形成的大规模多语言语料库。它覆盖100种语言,常用于预训练跨语言模型。

TH
THUCNews (清华) thuctc.thunlp.org

由清华大学自然语言处理实验室整理的大规模中文新闻分类数据集。包含约74万篇新闻文章,覆盖14个新闻类别,是中文长文本分类任务的常用基准。

今日
今日头条新闻标题数据集 github.com

一个大型中文短文本分类数据集,包含约38万条由今日头条App生成的新闻标题,共分为15个类别。非常适合用于训练和评估短文本分类模型。

CH
ChnSentiCorp github.com

一个常用的中文情感分析数据集,主要包含对酒店、书籍、电子产品等的评论。数据规模约1.2万条,已标注为正面或负面,是情感分类任务的入门级经典数据。