先给结论:升级后评分变化,多数不是“数据被修正”,而是评分口径换了。要解释差异,先确认两版是否使用同一套规则版本与同一份输入;如果拿不到完整数据或权限,最小可执行动作是固定一份样本、分别用新旧口径复算并记录差异来源,而不是直接宣布旧分错误或新分更准。
评分变化只有两类来源:输入变了,或规则变了。区分方法很直接——把同一批对象、同一时间范围的原始数据,分别按新旧两版规则各算一次。如果输入相同而分数不同,差异就归因于规则;如果输入本身已经不同,规则是否变化都无法单独解释。
缺少完整数据或权限时,仍可做一件事:选取少量可完整获取的对象,记录它们在两版中的分数、扣分项名称和扣分顺序。这个动作的结果决定下一步——若扣分项名称整体替换,说明是维度重构;若名称不变而阈值移动,说明是权重或分档调整。两种情况的沟通话术和补救优先级完全不同。
条件一:能拿到两版规则说明或变更记录。此时优先做规则对照,把新增、删除、改阈值的条目列出来,再回到样本上验证每一条是否真的产生了分数差。选择这条路径的依据是:规则文本可核对,结论可复现,适合对外解释。
条件二:拿不到规则说明,只有前后两次评分结果。此时不要猜算法,改为做“差异聚类”:把分数上升、下降、不变的对象分组,看每组是否有共同特征,例如页面类型、内容长度区间或链接结构。若某组普遍下降而其他组不变,合理推断是规则对该特征更敏感;但这只是推断,不能当作已确认的规则变更。
例外情况要单独说明:如果升级同时伴随数据重新采集,那么分数差可能全部来自输入变化,规则对照就失去意义。此时应先确认采集口径是否一致,再谈评分解释。
假设某站点有 20 个页面,升级前平均分 72,升级后平均分 65。假设原始数据未变,且能拿到两版规则文本。复算后发现:旧版对“标题长度”只做提示不扣分,新版将其纳入扣分项。20 个页面中有 9 个标题超长,这 9 个页面平均下降 8 分,其余 11 个基本不变。这个对照说明差异集中在标题维度,下一步应优先处理这 9 个页面,而不是全站重写。
如果拿不到规则文本,只能看到这 9 个页面下降,就不能断定是标题原因——也可能是采集时间不同、页面本身被改动,或评分对多个维度同时调整。此时可执行的最小动作是:对这 9 个页面做一次人工检查,记录标题、描述、正文长度等可观察项,再与未下降页面比较。比较结果只能作为线索,不能作为规则已变更的证据。
把这些边界写进解释文档,比给出一个确定结论更有用。读者需要知道哪些是已核实、哪些是推断、哪些需要更多数据才能判断。
解释差异的终点不是写一份说明,而是决定先改什么。可按以下顺序推进:先固定样本与口径,再标注差异类型,然后按影响面排序——影响对象多且扣分明确的维度优先处理,影响面小或原因不明的维度先记录待查。
每完成一项修改后,用同一份样本复算一次,观察分数是否按预期方向移动。如果移动方向与预期不符,说明此前对规则的理解有误,应回到差异聚类步骤重新判断,而不是继续批量修改。这个回环动作能避免在错误归因上投入更多工作量。