什么是文本统计?
文本统计同时给出字素簇、Unicode 码点、UTF-16 代码单元、单词、行和 UTF-8 字节数,帮助区分用户看到的字符与程序实际存储单位。Emoji、肤色修饰符和组合附加符会按完整字素处理,适合界面限制、数据库字段和编码排错。常见使用场景包括:评估输入框的可见字符与字节限制。;检查 Emoji 或组合字符为何长度不同。;统计多语言文案的单词、行数和 UTF-8 大小。页面同时列出输入边界、输出规则和限制,便于在复制结果或投入实际流程前核对格式、语义与安全注意事项。
适用场景
- 评估输入框的可见字符与字节限制。
- 检查 Emoji 或组合字符为何长度不同。
- 统计多语言文案的单词、行数和 UTF-8 大小。
使用方法
- 粘贴或输入文本。
- 使用支持 Unicode 的浏览器 API 统计。
- 对比字素簇、码点、单词、行和字节总数。
- 先使用页面提供的复杂示例验证当前选项和运行方向,再替换为自己的数据。
- 检查输出区、状态提示和限制说明,确认结果符合预期后再复制、下载或继续处理。
可运行示例
工作区中的“示例 1”和“示例 2”按钮会载入对应内容。两个示例覆盖不同结构、方向或边界,可以直接运行并观察输出与状态提示。
示例 1
JSONLane 版本 1.5
支持中文、English、Emoji 👍🏽 和组合字符 é。
本地处理,不上传输入。示例 2
第一段包含 3 个单词和数字 2026。
Second line has punctuation, tabs and 🚀.
最后一行。输入规则
- 输入可以是任意普通文本。
- 统计结果依赖当前浏览器的 Unicode 分段数据。
- 超出页面字符上限的文本会被拒绝。
- 文本输入在运行前按字符计数,当前页面上限为 1,000,000;文件类功能另按页面显示的文件上限执行。
- 单词边界取决于浏览器内置的 Unicode 和区域数据。
输出规则
- 字素簇接近用户感知字符数。
- 码点、UTF-16 单元和 UTF-8 字节分别独立统计。
- 行数识别 LF、CRLF 和 CR 分隔符。
- 输出只反映当前输入、方向和选项;切换模式或修改输入后应重新运行,不应把旧结果当成新结果。
- 行数识别 LF、CRLF 和 CR 分隔符。
限制与注意事项
- 单词边界取决于浏览器内置的 Unicode 和区域数据。
- 行数识别 LF、CRLF 和 CR 分隔符。
- UTF-16 代码单元仅用于开发对比,不代表用户可见字符数。
数据处理说明
文本分段和字节编码在本地完成,内容不会上传或写入浏览器存储。关闭或刷新页面后,本工具不会保留本次数据。