文本去重

原始文本
每一行作为一个整体比较,最常用。
全部计算在浏览器本地完成,文本不会上传。 适合清理导出名单、日志、关键词表里的重复条目。
去重结果
在左侧粘贴文本,这里会显示去重后的结果
在线文本去重工具,支持按行、按分隔符、按字符三种单位去重,可忽略大小写与首尾空白,并能单独查看重复项或唯一项,全部在浏览器本地完成。

工具简介

在线文本去重工具,可以按行*、**分隔符**或*字符三种单位去重,支持忽略大小写、忽略首尾空白、丢弃空行,并可按原序、升序或出现次数排序。全部计算在浏览器本地完成,文本不会上传。

使用步骤

  1. 在左侧粘贴文本,右侧会自动去重。
  2. 选择「去重单位」:按行最常用;处理一行内的逗号列表选「按分隔符」;去除重复字符选「按字符」。
  3. 按需设置比较规则(忽略大小写 / 忽略首尾空白 / 丢弃空行)。
  4. 切换「输出内容」可以只看重复项或只看唯一项,用来做数据体检。
  5. 点「复制」或「导出 txt」取走结果。

三种去重单位的区别

假设输入是 苹果,香蕉,苹果,樱桃:

单位比较对象结果
按行整行只保留 1 行(整行原样)
按分隔符拆出的每一项苹果、香蕉、樱桃(每行一条)
按字符单个字符苹果香蕉樱桃(重复字符只留一个)

按字符去重会丢弃空白字符,适合清理杂乱的关键词串。

「保留首次出现」还是「保留最后一次」

本工具保留第一次出现的那一份,包括它原来的大小写与前后空白。

例如输入 Apple 和 apple,勾选「忽略大小写」后视为同一条,输出里保留先出现的 Apple。这比保留最后一次更符合「以第一次录入为准」的习惯。

输出内容三档

选项含义用途
去重结果每种只保留一条正常去重
只看重复项出现 2 次以上的项找出重复数据
只看唯一项只出现 1 次的项找出「孤儿」数据

右侧的「重复项明细」会按出现次数降序列出每种重复项及其次数,最多显示 200 种。

排序方式

  • 保持原序:按首次出现的顺序输出,适合保持名单原有逻辑。
  • 升序:按中文拼音 / 字母顺序排序,方便肉眼核对。
  • 按次数:出现次数多的排前面,适合分析高频项。

适用场景

  • 清理从 Excel、数据库导出的名单,去掉重复行
  • 整理关键词表、标签表、域名表
  • 合并多份清单后的去重
  • 检查日志里的重复条目
  • 去除字符串里的重复字符

注意事项

  • 去重是精确匹配(可配合忽略大小写与首尾空白),不做模糊匹配。
  • 全角空格与半角空格是不同的字符,如需统一请先用查找替换处理。
  • 文本只在本地处理,刷新页面后内容会丢失,重要结果请先导出。

常见问题 FAQ

文本会上传吗?

不会。全部计算在浏览器本地完成,关闭页面后内容即消失,重要结果请先导出。

导出的文件是什么格式?

导出为 UTF-8 编码的 .txt 文件,每行一条,可以直接被 Excel 或其它工具读取。

去重是模糊匹配吗?

不是。只有完全相同的字符串才会被判定为重复(可配合忽略大小写与忽略首尾空白),不做相似度匹配。

能处理多长的文本?

纯文本几万行没有压力。超过十万行时浏览器可能出现卡顿,建议分批处理。

全角和半角空格算一样吗?

不算。它们是完全不同的字符,不会被当作相同内容。如果需要统一,请先用查找替换处理。

为什么我的结果和预期不一样?

先检查去重单位是否选对。例如想按行去重却选了按字符,结果就会变成一堆单个字符。另外确认「丢弃空行」是否开着。

排序方式怎么选?

保持原序适合保持名单原有逻辑;升序按拼音/字母排序,方便肉眼核对;按次数把高频项排前面,适合分析。

「只看唯一项」有什么用?

找出只出现过一次的条目,适合检查合并多份名单后哪些是「孤儿」数据。

「只看重复项」有什么用?

可以快速找出名单里哪些条目重复了,配合右侧的重复项明细(含出现次数)做数据体检。

「忽略大小写」是怎么比较的?

比较时把内容统一转成小写再判断,但输出的是原文。所以 Apple 和 APPLE 会被视为同一条。

重复项保留哪一个?

保留第一次出现的那一份,包括它原来的大小写与前后空白。例如输入 Apple 和 apple,勾选忽略大小写后会保留先出现的 Apple。

按行、按分隔符、按字符有什么区别?

按行是整行比较,最常用;按分隔符会先把每行按指定符号拆开,再对拆出来的每一项去重,适合处理一行里的逗号列表;按字符是把文本拆成单个字符去重,会忽略空白。