混合字符残留检测器
商品详情里的某些字符,长得跟它实际的代码完全不是一回事。全角逗号 , 和普通逗号 , 渲染出来几乎没有分别;混在英文里的西里尔字母 а 更是肉眼绝对无法分辨。拼写检查不会报错,但消费者的搜索永远匹配不到你。
🔒 你的数据不会离开浏览器。
两种看起来差不多、本质完全不同的问题
全角标点是东亚输入法默认打出的字符。在中文排版中完全正确,但在面向海外买家的英文 Listing 里则是致命伤:买家在搜索框输入半角普通逗号,永远搜不出包含全角标点的你。这属于纯粹的机械等价替换,因此工具会直接为你完成:
, → , · 、 → , · 。 → . · ; → ; · : → : · ? → ? · ! → ! · ( → ( · ) → ) · [ → [
同形异码字母则是另一回事。西里尔字母 а е о р с 和希腊字母 ο 在几乎所有字体下都与拉丁字母完全一样。一旦单词里混入一个,它在底层就彻底变成了另一个字符串:搜索无法命中、去重无法合并、拼写检查完全沉默。肉眼根本看不出端倪,这正是需要专门工具进行排查的原因。
为什么外语残留不会被自动「修复」
当文本中出现整段其他语种的文字时 —— 一个产品名、一个单位、半句提示语 —— 本工具只做标出而不擅自替你修改。决定是该翻译、音译还是直接删除,必须基于对上下文意义与目标市场的理解。随意替换只是瞎猜,而在商品标题里猜错比发出警告更危险。
本工具执行的全部检查(共 5 条规则)
SCR-P01 存在全角标点符号
诸如 ,。、;:?!()【】 等字符看似普通标点,但在底层是完全不同的 Unicode 码点。带有这些符号的英文 listing 无法匹配消费者的正常搜索,部分平台的数据校验更会直接拒收该行。
修复: 替换为对应的半角 ASCII 标点;工具已在下方给出转换后的文本。
来源: 依据的是 Unicode 的文字(Script)属性与 CJK 兼容标点区块。全角标点到对应 ASCII 字符的映射是标准的兼容分解,我们的测试逐字符检查它能往返还原。
SCR-S01 混入了其他书写系统的字符
文本中混杂了不同的书写系统。在面向特定市场的 listing 中,这几乎总是源语言未清理干净的残留词句 —— 例如未翻译的产品名、中文单位或零碎短句。
修复: 将残留外文翻译为目标语言或直接删除;工具不会擅自猜测。
来源: 依据的是 Unicode 的文字(Script)属性与 CJK 兼容标点区块。全角标点到对应 ASCII 字符的映射是标准的兼容分解,我们的测试逐字符检查它能往返还原。
SCR-H01 单个单词内部混杂了不同书写系统
同一个单词里同时包含来自两个书写系统的字符。西里尔字母 а、е、о、р、с 和希腊字母 ο 在几乎所有字体下都与拉丁字母肉眼无异,常规校对无法察觉 —— 但在计算机看来它不再是原本的单词。搜索无法匹配、去重无法识别、拼写检查也会保持沉默。
修复: 请重新完整手动输入受影响的单词,而非在原词上修改;同形字符肉眼不可见。
来源: 依据的是 Unicode 的文字(Script)属性与 CJK 兼容标点区块。全角标点到对应 ASCII 字符的映射是标准的兼容分解,我们的测试逐字符检查它能往返还原。
SCR-W01 存在全角拉丁字母或全角数字
A、B、1、2 是全角字符。对人类而言它们是字母和数字,但对解析程序而言完全不同 —— 全角数字将无法被解析为有效数值。
修复: 转换为常规的半角字母或数字。
来源: 依据的是 Unicode 的文字(Script)属性与 CJK 兼容标点区块。全角标点到对应 ASCII 字符的映射是标准的兼容分解,我们的测试逐字符检查它能往返还原。
SCR-N01 单一书写系统
文本仅使用了预期的书写系统以及常规的通用标点。
来源: 依据的是 Unicode 的文字(Script)属性与 CJK 兼容标点区块。全角标点到对应 ASCII 字符的映射是标准的兼容分解,我们的测试逐字符检查它能往返还原。
没有忠实 ASCII 对应物的字符会被作为异种字符报告而非强行替换。最典型的例子是片假名中点「・」:将其替换为 U+00B7 只是用一个非 ASCII 字符换掉另一个,毫无实际帮助。
关于这些规则。 每一条都有编号、严重级别和通俗解释。每个来源链接都已登记在案,并对线上页面实际复验过,而不是凭印象写上去的. 规则如何编写、测试与保持更新 →