DataHubDataNav
返回数据导航

NLP & Speech Datasets

NLP 与语音数据集导航

DataHub NLP 与语音数据集导航整理文本语料、情感分析、问答、词向量、语音识别和多语言训练数据入口,适合语言模型与语音项目调研。

适合搜索 NLP 数据集、中文语料库、文本分类数据集、问答数据集、语音识别数据集和多语言训练语料的用户。

NLP 与语音数据的主要差异来自语言覆盖、文本来源、标注任务、音频条件和许可范围。相同规模的语料,清洗质量、重复率、时间范围和领域匹配程度不同,训练效果也会明显不同。

文本分类、问答、词向量、语言模型预训练和自动语音识别需要不同的数据格式与评测方式。选择前应先确定语言、领域、任务和输出目标,再核对语料来源、转录质量、说话人分布和官方数据划分。

中文和多语言项目还应关注简繁体、方言、编码、分词方式和跨语言比例。涉及网页抓取或用户生成内容时,必须回到发布方说明确认版权、隐私和再分发条件。

适合哪些场景

  • 查找文本分类、情感分析、问答、词向量和语言模型语料。
  • 寻找语音识别、说话人和多语言音频训练数据。
  • 为中文 NLP、跨语言模型和语音产品建立数据候选清单。

如何选择

  • 先按语言、领域和任务筛选,再比较样本规模、标签体系和数据时间范围。
  • 语音数据需要检查采样率、转录准确度、说话人分布与录音环境。
  • 预训练语料需要关注重复内容、来源混合比例、清洗方法和污染风险。

使用前核验

  • 核验文本或音频的版权、隐私、再分发和商业使用条件。
  • 确认训练、验证和测试集划分,避免基准答案进入训练语料。
  • 记录数据版本、预处理步骤、语言比例和过滤规则。

代表资源入口

从 DataHub 数据导航中抽取的高相关数据平台

11
CO
Common Crawl commoncrawl.org

PB级的公开网络爬取数据,包含海量原始网页文本,是训练大规模语言模型(LLM)最重要的语料来源之一。

WI
Wikipedia Dumps dumps.wikimedia.org

维基媒体基金会提供的维基百科全站内容的离线数据库备份。它包含数百种语言的文本语料,数据规模达到TB级别,同样是训练LLM的重要语料来源。

BO
BookCorpus yknzhu.wixsite.com

一个包含超过11,000本未出版英文书籍文本的大型数据集,常用于语言模型的预训练。

CC
CC100 (Common Crawl 100) data.statmt.org

从Common Crawl网络爬取数据中提取并清洗后形成的大规模多语言语料库。它覆盖100种语言,常用于预训练跨语言模型。

TH
THUCNews (清华) thuctc.thunlp.org

由清华大学自然语言处理实验室整理的大规模中文新闻分类数据集。包含约74万篇新闻文章,覆盖14个新闻类别,是中文长文本分类任务的常用基准。

今日
今日头条新闻标题数据集 github.com

一个大型中文短文本分类数据集,包含约38万条由今日头条App生成的新闻标题,共分为15个类别。非常适合用于训练和评估短文本分类模型。

CH
ChnSentiCorp github.com

一个常用的中文情感分析数据集,主要包含对酒店、书籍、电子产品等的评论。数据规模约1.2万条,已标注为正面或负面,是情感分类任务的入门级经典数据。

IM
IMDB Reviews imdb.com

经典的情感分析文本数据集,包含从IMDB网站收集的5万条电影评论,用于二元情感分类。

LI
LibriSpeech openslr.org

基于有声读物的大规模(约1000小时)英语语音识别数据集,发音清晰,质量高。