DataHub Tools 字数统计

字数统计和字符统计工具

本地优先

本地统计词数、字符数、行数、句子数和预计阅读时间。

工具实际如何工作?

浏览器支持时,计数器使用 Intl.Segmenter 进行语言感知的单词与字素分段,单独报告 CJK 字符,并按每分钟 220 个 word-like 分段估算阅读时间;空输入显示 0 分钟。

  • 统计语言感知单词段
  • 报告 CJK 字符和字素簇
  • 估算阅读时间

如何使用?

  1. 粘贴需要检查的准确文本。
  2. 按语言和发布规则选择合适指标。
  3. 需要精确结果时,用语言感知工具复核缩写、中文、组合字符和 emoji。
  4. 把阅读时间当作粗略估算,而不是实测时长。

快速示例

示例输入

Don't stop. 你好世界 👨‍👩‍👧‍👦

预期结果

支持的浏览器会把 Don't 视为一个 word-like 分段,并把家庭 emoji 视为一个字素簇。

分段结果取决于浏览器 Intl.Segmenter 数据和语言规则,出版、合同计费和语言学口径可能不同。

适合哪些场景?

  • 估算英文风格单词连续段。
  • 单独检查 CJK 字符量。
  • 快速查看行数和阅读时间摘要。

参考标准与适用边界

Unicode UAX #29 定义文本边界,Intl.Segmenter 提供语言感知分段;两者都不能替代出版或合同规定的计数口径。

来源核验日期:2026 年 7 月 24 日。规范与平台行为可能更新,正式使用前请复核来源。

已知限制

  • 不支持 Intl.Segmenter 的浏览器会回退到简单字母数字连续段。
  • 混合语言阅读时间仍只是粗略估算。
  • 支持 Intl.Segmenter 时,Characters 按字素簇统计。

FAQ

Words 代表中文词数吗?

支持 Intl.Segmenter 时会使用语言感知的 word-like 分段,但不是专业中文分词器。

don't 怎么统计?

支持的浏览器通常会把它统计为一个 word-like 分段。

emoji 会算一个字符吗?

支持 Intl.Segmenter 时,连接后的可见 emoji 通常算一个字素簇。

阅读时间准确吗?

不准确,它只是按固定速度估算。