浏览器本地处理

文本统计

对比用户感知字符、Unicode 码点、UTF-16 代码单元、单词、行和编码字节长度。使用 Intl.Segmenter 把 Emoji 序列和组合附加符归为完整字素。

浏览器本地处理
Unicode · Intl.Segmenter · UTF-8
0 / 1,000,000
文本统计结果

工具指南

什么是文本统计?

文本统计同时给出字素簇、Unicode 码点、UTF-16 代码单元、单词、行和 UTF-8 字节数,帮助区分用户看到的字符与程序实际存储单位。Emoji、肤色修饰符和组合附加符会按完整字素处理,适合界面限制、数据库字段和编码排错。常见使用场景包括:评估输入框的可见字符与字节限制。;检查 Emoji 或组合字符为何长度不同。;统计多语言文案的单词、行数和 UTF-8 大小。页面同时列出输入边界、输出规则和限制,便于在复制结果或投入实际流程前核对格式、语义与安全注意事项。

适用场景

  • 评估输入框的可见字符与字节限制。
  • 检查 Emoji 或组合字符为何长度不同。
  • 统计多语言文案的单词、行数和 UTF-8 大小。

使用方法

  1. 粘贴或输入文本。
  2. 使用支持 Unicode 的浏览器 API 统计。
  3. 对比字素簇、码点、单词、行和字节总数。
  4. 先使用页面提供的复杂示例验证当前选项和运行方向,再替换为自己的数据。
  5. 检查输出区、状态提示和限制说明,确认结果符合预期后再复制、下载或继续处理。

可运行示例

工作区中的“示例 1”和“示例 2”按钮会载入对应内容。两个示例覆盖不同结构、方向或边界,可以直接运行并观察输出与状态提示。

示例 1

JSONLane 版本 1.5
支持中文、English、Emoji 👍🏽 和组合字符 é。
本地处理,不上传输入。

示例 2

第一段包含 3 个单词和数字 2026。
Second line has punctuation, tabs	and 🚀.
最后一行。

输入规则

  • 输入可以是任意普通文本。
  • 统计结果依赖当前浏览器的 Unicode 分段数据。
  • 超出页面字符上限的文本会被拒绝。
  • 文本输入在运行前按字符计数,当前页面上限为 1,000,000;文件类功能另按页面显示的文件上限执行。
  • 单词边界取决于浏览器内置的 Unicode 和区域数据。

输出规则

  • 字素簇接近用户感知字符数。
  • 码点、UTF-16 单元和 UTF-8 字节分别独立统计。
  • 行数识别 LF、CRLF 和 CR 分隔符。
  • 输出只反映当前输入、方向和选项;切换模式或修改输入后应重新运行,不应把旧结果当成新结果。
  • 行数识别 LF、CRLF 和 CR 分隔符。

限制与注意事项

  • 单词边界取决于浏览器内置的 Unicode 和区域数据。
  • 行数识别 LF、CRLF 和 CR 分隔符。
  • UTF-16 代码单元仅用于开发对比,不代表用户可见字符数。

数据处理说明

文本分段和字节编码在本地完成,内容不会上传或写入浏览器存储。关闭或刷新页面后,本工具不会保留本次数据。

FAQ

什么是字素簇?

它接近用户眼中的一个字符。一个字素簇可能包含多个码点,例如 Emoji 和肤色修饰符。

字节如何计算?

使用 TextEncoder 把文本编码为 UTF-8 后计数。

单词如何识别?

Intl.Segmenter 使用区域和 Unicode 规则识别 word-like 片段。

字素簇与 Unicode 码点为什么不同?

用户看到的一个字符可能由多个码点组成,例如肤色 Emoji 或字母加组合附加符。

中文会被统计为单词吗?

单词计数依赖浏览器的 Intl.Segmenter 和区域数据;它会按 Unicode 分词规则识别 word-like 片段。

UTF-8 字节数有什么用途?

它可用于估算传输、数据库字段和接口限制,但不等同于 JavaScript 字符串的 UTF-16 长度。

更新日期: 2026-08-02