适合搜索 AI 数据集、机器学习数据集、NLP 数据集、计算机视觉数据集、语音数据集、标注数据和合成数据的用户。
AI 数据集的价值不只取决于数量,还取决于任务定义、标签质量、数据许可、更新方式和是否能与模型训练流程衔接。DataHub 将 NLP、语音、计算机视觉、标注平台、合成数据和数据增强资源放在同一专题,便于从任务类型出发做筛选。
本页适合模型训练前的资源调研,也适合产品团队判断某类 AI 应用是否已有公开数据基础。对于 Hugging Face Datasets、Papers with Code、OpenML、Roboflow、COCO、ImageNet、LibriSpeech 等资源,建议同时查看原站说明、数据许可、论文引用方式和样本偏差。
如果你的目标是做中文 AI 应用或行业模型,建议把本页与中国数据平台、研究数据仓库和 DataHub AI 行业岗位数据一起使用:前者帮助找训练和评测素材,后者帮助理解市场正在招聘哪些 AI 能力。
适合哪些场景
- 寻找 NLP、语音、视觉、标注和合成数据资源。
- 为模型训练、评测、数据增强和 benchmark 对比建立来源清单。
- 判断某个 AI 应用方向是否已有可复用公开数据。