结论先给:只有当重复说明在不同页面里含义完全一致、且不依赖所在页面的具体条件时,才适合提取到公共页面;否则应保留原位,或提取后补一段只属于该页的上下文。判断标准不是重复次数,而是这段话被移走后,读者还能不能回答“它为什么出现在这里”。
把几段文字放进同一张对照表,逐句看三件事:主语是否相同、适用条件是否相同、结论是否相同。假设三个页面都出现“资料提交后需要等待审核”这一句,其中两个页面的审核由系统自动完成,另一个页面由人工处理,那么这句话表面重复,实际含义并不同,直接提取会丢掉差异。
可以按下面的顺序处理:
这样做的结果是:公共页面承担稳定信息,原页面承担变化信息,后续修改时不会因为改一处而误伤另一处。
很多提取失败,不是公共页面写错了,而是原页面只剩一个链接,读者失去了理解起点。最小上下文通常包含三层:这段说明解决什么问题、在当前页面适用于哪个对象、点击后能获得什么补充。
例如原页面写“常见问题见公共说明”,读者无法判断是否与自己有关。改成“本页涉及的是首次提交场景,通用审核规则和例外情况集中在公共说明中”,读者就知道自己该不该继续看。这里不需要复述公共页面的全部内容,只需要交代当前页面的位置。
一个实际动作是:提取完成后,逐页检查原位置是否还能独立回答“这段内容和我当前看的页面是什么关系”。如果答案是否定的,就补一句限定语,而不是把整段搬回来。
反例出现在说明本身承担页面主结论的时候。假设某个页面主要回答“某类申请多久能完成”,重复说明正是该页的核心答案,把它移到公共页面后,本页只剩流程介绍,读者需要多点一次才能得到结论。这种情况下,提取会削弱页面自身的完整性。
另一类失效条件是页面之间存在明显的用户意图差异。面向新用户和面向老用户的页面,即使文字相同,解释深度和前置假设也可能不同。此时更稳妥的做法是保留各自版本,只在公共页面维护一份更完整的说明,供两边按需引用。
因此,提取的边界可以概括为:公共页面负责稳定的通用规则,原页面负责本页结论和适用条件。两者职责混在一起时,不要强行合并。
不要只看公共页面是否被访问,也不要只看原页面字数是否减少。更可靠的做法是比较改动前后的行为变化,同时考虑季节和搜索需求本身的波动。假设改动前后各取一段相近长度的时间,观察原页面的停留、跳转和后续点击是否出现同向变化;如果只有公共页面访问上升,而原页面读者更快离开,说明上下文衔接可能不足。
这里要区分两种解释:一是公共页面确实提供了补充信息,二是原页面本身的问题被改动放大。抓取量或访问量归零不能单独证明提取正确,它也可能来自需求下降、入口调整或采集差异。把多个信号放在一起看,才能决定下一步是继续精简,还是补回局部说明。
选一个重复说明最集中、页面意图最接近的小范围页面组,先完成提取和上下文补写,保留其余页面不动。观察一段时间后,再判断公共页面的说明是否需要按场景拆分。如果试点中原页面读者仍能顺畅理解,就把同一方法用于条件一致的页面组;如果出现理解断点,就回到“公共部分加专属部分”的拆分方式,而不是整体回滚。
这样推进的好处是,每一步都有可比较的依据,改动范围也可控,不会因为一次大规模提取而同时失去多个页面的上下文。