最需要警惕的不是“手工做不完”,而是手工流程在样本少时看起来更准,规模一上来却开始制造错误。判断标准可以落到一条:这项工作是否需要把同一规则重复应用到几十、几百个页面,并且每次都要读取上一批结果再决定下一步。若答案是肯定的,它通常就不该继续靠人工逐条处理。
小规模阶段,人工逐页检查标题、内链、栏目归属,往往比批量规则更细腻。但页面数量增长后,会出现几种例外:同一模板下部分页面内容高度相似,人工调整时容易漏掉;旧页面改版后,人工维护的跳转或内链没有同步;分页、筛选、参数页数量增加,人工清单很快失真。
这不一定说明手工方式本身错了,更常见的是两种解释。第一种解释是样本阶段页面少,人工能记住上下文,规则没有真正被写下来。第二种解释是规模扩大后,页面之间的依赖关系变多,单页判断无法覆盖跨栏目、跨模板的影响。区分这两种解释,可以看同一类问题是否在换一个人、换一个时间后仍能稳定复现;如果能复现,说明缺的是可执行规则,而不是某个人不够细心。
当栏目页、地区页、产品页共用模板时,人工逐页改标题很容易只改表面词,留下大量同构页面。更稳妥的动作是把页面按模板、栏目、业务线分组,先抽查每组里有多少页面出现相同或近似标题,再决定哪些组需要规则化处理。这个动作的结果会直接影响下一步:如果某组重复比例高,优先改模板和内容生成逻辑;如果只是个别页面重复,再回到人工处理更划算。
这里要区分抓取、索引和排名。标题重复可能影响搜索引擎理解页面主题,也可能只是展示层面的问题,不能因为一次抽查就断定排名会立刻变化。假设某栏目有 200 个页面,人工抽查 20 个发现 6 个标题高度相似,这只能说明该模板存在风险,不能证明全站 200 个都同样严重;下一步应扩大抽样或按模板统计,而不是直接批量替换。
人工加内链在早期有效,因为编辑知道哪些页面值得推荐。但规模扩大后,内链会变成一张不断变化的网:栏目调整、页面合并、旧链接失效,都会让手工维护的清单迅速过期。此时更适合把内链拆成两类:一类是编辑判断型的推荐链接,仍可人工处理;另一类是规则型的导航、面包屑、相关推荐和旧链接跳转,应尽量由模板或规则生成。
判断是否该交给规则,可以做一个短测试:随机抽取 30 个已调整页面,检查其中有多少个仍能通过模板自动获得正确入口。如果大部分页面依赖人工补链,说明内链维护已经不适合继续手工做;如果只有少数重点页面需要人工推荐,手工反而更合适。这个测试的结果决定下一步是优先修模板,还是继续维护重点页面清单。
网站规模扩大后,页面状态会分化:有的被正常抓取,有的被抓取但未索引,有的因参数、重复内容或入口过深而长期不被发现。人工逐条查 URL 在几十个页面时可行,到几百个页面时就会变成低效重复。更合理的动作是先按页面类型分组,再观察每组在抓取和索引上的差异,而不是把某个页面的表现直接推广到全站。
需要说明的是,抓取量、索引量或某个统计归零,不能单独证明处理正确。它还可能来自统计口径变化、页面改版、入口调整或抓取预算重新分配。能区分原因的证据是:同一批页面在调整前后是否保持相同类型、相同入口和相同统计范围。如果范围变了,就不能把变化直接归因于某次优化动作。
不是所有工作都该自动化。以下情况仍适合人工处理:
边界在于:一旦同一判断需要重复应用到大量页面,并且每次都要依赖上一批结果,就应该把规则写下来,交给模板、脚本或内容管理系统执行。手工保留在判断和抽查环节,而不是承担全量重复劳动。这样做的结果是,下一步可以先用小样本验证规则,再决定是否扩大处理范围,而不是一次性替换全站。
这套顺序的核心不是追求全自动,而是把人工从重复劳动中移出来,用在需要判断的地方。网站规模扩大后,真正不适合继续手工做的,是那些需要重复执行、依赖上下文同步、且错误会随页面数量放大的工作;而需要业务判断和个案诊断的部分,仍应保留人工。下一步可以从一个模板组开始,先验证规则是否稳定,再决定是否推广到其他组。