结论先给:当页面数量、模板类型和变更频率同时上升后,仍然值得手工做的,通常是判断类工作,比如内容取舍、栏目优先级、异常原因分析;不适合继续手工做的,是那些重复、可枚举、结果需要被逐条核对的工作,比如批量检查标题重复、批量核对内链指向、批量确认页面是否被索引。前提是你能拿到一份可导出的页面清单和至少一种可验证的抓取或日志来源;如果连完整URL列表、模板归属和访问权限都拿不到,那么手工与自动化都做不完整,此时只能先做抽样核查,不能据此推断全站状态。
很多人把规模扩大后的手工工作问题理解成“页面多了忙不过来”,但真正决定是否该停手的,是这项工作重复执行时是否还需要人做新判断。可以用三个条件区分:
一个实际动作是:先导出最近一次全量URL清单,按模板类型分组,再对每组随机抽10到20条做人工核查。如果同一类问题在抽样中反复出现,并且修复方式一致,就应转为批量处理;如果抽样中每条都需要不同处理,就保留手工。这个动作的结果会直接影响下一步:批量处理适合先修模板或数据源,手工处理适合先排优先级。
假设某网站只有几百个页面,但页面由多个历史编辑器生成,字段结构不统一,连标题和正文的存放位置都不一致。这种情况下,即使页面数量已经超过“手工看着累”的阈值,也不适合立刻上批量脚本,因为脚本需要稳定的输入结构。此时更合理的动作是先把页面按来源系统分组,只对结构一致的那一组做批量检查,其余继续手工或先做数据清洗。也就是说,“规模扩大后不该手工做”成立的条件是重复对象具有稳定结构;结构不稳定时,批量处理会把错误放大,而不是节省时间。
第一类是重复属性核查,例如页面标题是否为空、是否与其他页面完全重复、描述标签是否被模板统一覆盖。第二类是链接关系核查,例如站内链接是否指向已删除页面、分页链接是否形成闭环、重要栏目是否从首页可达。第三类是索引状态核查,例如哪些URL被robots规则挡住、哪些返回非200状态、哪些被规范标签指向别处。三类工作的共同点是:结果可以落成清单,修复动作可以按规则批量执行,执行后还能用同一份清单复查。
这里要区分抓取、索引和排名:批量检查能帮你发现抓取和索引层面的异常,但不能直接推出排名变化的原因。抓取量下降、索引量归零这类现象,也可能来自统计口径变化、权限变更、规则误伤或数据延迟,不能单独证明某次处理正确或错误。
如果你只有部分页面列表,没有日志和后台权限,仍然可以做一件最小的事:选一个模板类型,手工列出该模板下所有可访问URL,逐条记录标题、状态码和主要内链入口,形成一份小清单。然后只针对这份清单做两件事:找出完全重复的标题,找出指向404的链接。做完后,你能得到的结论仅限于这个模板和这批URL,不能推断全站。下一步动作是拿这份清单去申请对应权限或导出完整数据;如果申请不到,就把抽样范围固定下来,定期复查同一批URL,而不是不断扩大手工范围。
当一项工作每次执行都需要重新判断内容价值、业务优先级或异常原因时,继续手工是合理的。当一项工作已经能写成“如果A则改B”的规则,并且同样的规则会应用到几十条以上URL时,就应该停止逐条手工处理,转为批量执行加抽样复核。停止手工不等于放弃检查,而是把人的注意力从重复核对移到规则设计和异常解释上,这才是规模扩大后更值得投入的部分。