当页面从几十个涨到几百上千个,手工做百度搜索词挖掘最先崩掉的不是“想词”的能力,而是词与页面之间的对应关系。保留、改写还是退出,判断依据只有一个:这个动作是否还能稳定地产出可核对的词页映射。一旦某环节的产出开始依赖个人记忆或临时表格,它就适合改为半自动或规则驱动。
小站阶段,手工挖词之所以有效,是因为你能同时记住三件事:这个词来自哪个页面、它当前有没有被覆盖、下一轮该补什么内容。规模扩大后,这三件事会分离。典型信号是:同一批词在不同人的表格里重复出现,或者某个栏目已经上线几十个页面,但没人能说清哪些词已经被这些页面承接。
这里要区分两种“手工”。一种是人工判断词的价值和意图,这部分短期不该退出,因为机器很难替代对业务语境的理解。另一种是人工搬运、去重、匹配 URL、记录状态,这部分在页面数量超过你一次能完整复核的范围后,就会持续产生错漏。判断阈值不是某个固定数字,而是:你还能不能在不翻旧记录的情况下,说清任意一个重点词由哪个页面负责。
最该从手工转为规则处理的是词表在不同表格之间的搬运,以及状态字段的同步。假设一个站点有 800 个已发布页面,每轮挖掘新增 200 个候选词,如果全靠人工把候选词分配到页面并更新“已覆盖/待覆盖”状态,那么每轮都会有一部分词因为漏更新而被重复处理。
实际动作可以这样设计:先固定一份页面清单,字段至少包含 URL、主题、已承接的核心词;再让候选词必须落到某个 URL 或明确标记为“无对应页面”。这个动作的结果会直接决定下一步——如果大量候选词找不到对应页面,说明问题不在挖掘,而在内容结构缺位;如果能落位但状态混乱,说明该把状态同步交给脚本或表格公式,而不是继续加人手。
去重和意图归类不适合直接退出,但需要改变做法。完全靠人工逐条比对,在词量上千后既慢又不可靠;完全交给自动聚类,又会把“价格查询”和“购买渠道”这类意图不同但字面相近的词混在一起。
可行的前提是:先人工定义少量稳定的意图类别,比如信息了解、方案对比、交易准备,再让规则按词形和共现词做初分,人工只复核边界样本。这样做的结果是,复核量从“全部词”降到“分类不确定的词”,后续内容规划才有稳定的输入。如果站点业务线单一、词义差异小,这一步甚至可以只保留抽检。
有一个环节不建议退出:决定某个词由哪个页面承接、是否需要新建页面。这个决策涉及内容优先级和站内结构,错配的代价远高于搬运成本。假设同一组词既可能归入栏目页,也可能归入详情页,自动规则往往只能按字面相似度选一个,而实际选择取决于该词背后的用户是否已经到了比较阶段。
保留这个环节的前提是,前面的词表已经清洗、去重、归类完成。否则人工会把大量时间花在核对重复项上,而不是做真正的映射判断。换句话说,退出搬运是为了把人力腾给映射决策,而不是取消决策。
如果站点页面数量有限、更新频率低,或者挖掘目标只是验证一个方向而不是长期运营,那么继续手工处理词表是合理的,因为搭建规则的成本高于收益。另一个边界是:当候选词高度集中在一两个主题,且你每轮都能完整复核时,手工反而更灵活。
需要避免的是把“暂时还能手工”当成长期方案。一旦出现同一词被两个页面同时承接、或者某栏目页面数量增长到无法逐页核对,就说明该环节已经越过了手工可控的边界。这时先处理状态同步和去重,再谈扩展词量,顺序反了只会放大混乱。