结论是:当页面数量、模板类型或改动频率超过一个人能持续核对的范围时,逐页手工处理内链、重复标题、参数化网址和结构化数据,就会从“精细”变成“不可验证”。但这不是一刀切——如果页面总量仍小、模板统一且每次改动都能被完整复查,手工反而更可控。判断分界线不是网站“看起来大”,而是同一类页面是否已经多到无法逐条确认。
小站阶段,手工改标题、调内链、补描述,每一步都能看到结果,直觉上“人比工具可靠”。规模扩大后会出现相反现象:你仍然认真处理了首页和几个重点栏目,但大量列表页、筛选页、分页和标签页从未进入检查范围。此时手工并没有失效,而是覆盖面失效。你看到的是一批被精心处理过的页面,看不到的是成倍增长、从未被纳入清单的页面。用“我检查过的页面都正常”来推断全站正常,是规模扩大后最常见的错误证据。
要区分两种解释:一种是内容质量确实下降,另一种是大量页面根本没被纳入处理。前者需要改内容策略,后者需要改工作方式。可核对的证据包括:同一模板产出的页面是否存在相同的标题结构、分页与筛选参数是否被大量生成、站点地图中的网址数量与你能逐条说清的页面数量是否已经严重不匹配。如果最后一组差距很大,问题更可能出在覆盖面,而不是单页质量。
下面几类工作的共同点是:规则明确、重复度高、单页判断价值低,而遗漏的代价会随页数放大。
反过来,以下工作仍值得手工做:首页与核心栏目的定位、少数高价值页面的内容结构、以及需要对业务语境做判断的取舍。这些工作的共同点是数量少、影响大、规则难以写清。
假设一个站点有约两千个页面,其中商品页占大多数。若直接用规则把所有含参数的网址都设为不可抓取,短期内可能减少重复,但也可能把用户真正需要的筛选结果一并挡掉。这个假设说明:自动化解决的是覆盖面和一致性,不替代对具体页面价值的判断。正确顺序是先统计参数类型与访问情况,再决定哪些参数保留、哪些合并、哪些限制。动作的结果会直接改变下一步——如果统计显示某类参数几乎没有独立访问,就优先合并;如果某类参数有稳定访问,就应保留并单独优化,而不是统一处理。
不要先买工具或先外包,而是先做一次范围盘点:按模板和栏目列出页面类型,标注每类的数量、更新频率和当前处理方式。然后只挑一类重复度最高的页面,用规则跑一遍,与手工抽查结果对比。如果规则能覆盖大部分情况且差异可解释,就说明这类工作适合转为规则处理;如果差异集中在少数高价值页面,就保留手工。这个动作的结果决定后续投入方向:是补规则、补人力,还是先修正模板本身。
需要提醒的是,抓取量、索引量或某项统计归零,并不能单独证明处理正确。它也可能来自屏蔽规则、服务器响应、抓取预算变化或统计口径调整。把现象与原因分开核对,才不会在规模扩大后用错误结论指导下一步。