核心判断标准只有一条:优先选择“结果可能改变下一步动作”的对象。额度充足时你可以铺开覆盖面,额度紧张时应当把样本当作决策探针,而不是缩小版的完整报表。先明确你当前最想排除哪一种可能,再决定样本类型;如果连要排除什么都不清楚,任何抽样都只是消耗额度。
这两种局面下的抽样逻辑几乎相反,选错方向会让有限的额度白花。
当你已经怀疑某个条件在起作用,例如某类页面模板、某个目录层级或某种内容结构,样本要选“该条件成立”和“该条件不成立”两端各少量对象。这样做的价值在于:结果无论偏向哪边都能推进判断。假设你怀疑某个页面模板导致抓取异常,那就各取几个使用该模板和未使用该模板的页面,而不是随机抽一批页面看平均值。
此时不要平均撒网,而要把额度集中到差异最大的对象上:新旧内容、深浅层级、有无内链、不同发布方式。差异越大,越容易暴露真正起作用的变量。如果样本之间几乎没有区别,结果再整齐也提供不了信息。
额度有限时,代表性是次要的,信息增益才是首要的。可以用三个问题快速筛选:
按这个顺序筛完,通常剩下的样本数量远少于直觉。少而分化的样本,比多而雷同的样本更能支撑下一步决策。
具体动作可以这样安排:第一轮只查两组极端对象,每组两到三个,观察结果是否出现方向性差异。假设第一轮显示两组结果几乎一致,说明你怀疑的变量可能不是主因,下一步应转向其他变量,而不是在这条线上追加样本;如果两组出现明显分化,说明方向值得继续,此时再把剩余额度投向中间地带,确认分化的边界在哪里。这个“先极端、后中间”的顺序,能让每一轮结果直接决定下一轮怎么花额度。
需要提醒的是,结果分化不等于因果关系。样本量小的时候,分化也可能来自抓取时机、页面体量或偶然波动。把分化当作“值得继续查”的信号,而不是“已经找到原因”的结论。
有两种情况应当放弃抽样、直接扩大范围。一是对象之间差异极小且你无法事先判断哪端更关键,此时极端对照也选不出来,硬抽反而误导;二是决策代价很高,例如即将大规模改版或迁移,错误判断的损失远超额度成本。这两种情况下,省额度省下的是小钱,赔上的是方向。
至于具体工具当前的额度规则、可查字段和调用方式,属于会变动的信息,使用前应以你实际看到的界面和说明为准,不要依赖记忆或他人转述。
每轮查询结束后,用一句话记录“这次结果让我排除了什么、下一步查什么”。如果一句话写不出来,说明这轮样本没有产生信息,下一轮就该换筛选标准。额度有限时,真正稀缺的不是查询次数,而是每次查询之后判断的清晰度。