先给结论:多数情况下不是软件漏抓,而是你的“实际对象数量”和软件的“报告页数”本来就用了两套计数单位。真正需要做的不是继续清洗报告,而是先找出那个被遗漏的条件——通常藏在URL参数、分页结构和对象合并规则里。只有把计数单位对齐,去重才有意义。
假设你有一个内容站,后台明确列出1200篇文章,但排名优化软件导出的报告显示1480行。你按标题去重,剩1300行;按URL去重,还剩1260行;再按正文首段去重,仍有1230行。常规做法都试过了,差距还在。
这时容易得出两个错误结论:一是软件抓取不干净,二是自己的站点存在大量重复内容。两者都可能,但都不足以解释“反复去重仍有稳定余量”这个特征。稳定余量说明差异来自结构,而不是随机噪声。
解释一:软件把同一对象的不同分页或不同参数版本各算一页。比如一篇文章带?page=2、?from=list、?utm_source=这类参数,或者评论分页、打印版、AMP版各自成行。软件按“可访问URL”计数,你按“内容对象”计数,两边都没错。
解释二:软件把本该合并的多个对象拆开了,或者反过来,你手动合并时把不同对象当成同一个。常见于产品变体、多语言版本、同一系列的多篇内容被标题模板归一化。此时报告行数偏大,是因为你的去重键太宽。
两种解释的后果完全不同:前者要收敛参数和分页,后者要收紧去重键。搞反了,越处理越乱。
不要抽样看几行就下判断,要看差异行的分布。把报告按URL路径分组,统计每个路径下有多少行,再和你的对象清单对照。
另一个可区分证据是时间:分页和参数版本通常随抓取深度增加而增加,重抓一次差异行会变;对象合并问题重抓后差异行基本不变。这个稳定性本身就是线索。
假设某站有800个内容对象,报告显示1010行。按路径分组后发现,多出的210行集中在60个路径下,每个路径多出3到4行,URL分别带?page=、?reply=和?output=print。这指向解释一。
此时的动作是:在导出前先按“规范化URL”折叠,即去掉查询参数中不影响内容的键,只保留路径和必要的主键。做完这一步,报告降到820行。剩下的20行差异再去查,发现是两篇被标题模板归一化的不同文章,属于解释二。
这个顺序很关键:先处理结构性重复,再处理语义性重复。反过来做,你会把分页当成重复内容删掉,损失真实对象。
去重键不是越严越好。文章、产品、分类页、标签页的对象定义不同,混用一套键必然出错。可行的做法是分层:
每层去重后,把结果合并,再和后台对象清单对一次。如果仍有差距,记录差距行的URL特征,而不是继续迭代去重规则。记录本身就是下一步的证据。
如果按上述分层处理两轮后,差距仍稳定在某个比例,且差异行没有明显URL规律,那么问题可能出在工具对“页”的定义上。不同排名优化软件对分页、参数、重定向和规范标签的处理方式不同,具体规则需要查该工具的当前文档或导出说明,不能凭经验假设。
此时不要继续在Excel里硬洗数据。先确认工具把什么算作一行,再决定是否调整导出配置。这一步的产出不是更干净的报告,而是一句能写下来的定义:本工具的一行等于什么。定义清楚后,去重才有可复现的标准,后续的执行优先级也才有依据。