在共享服务器网站上,筛选、排序、分页、追踪参数可以互相组合,理论上地址数量没有上限。有效地址集合不能靠枚举定义,而要按“内容是否随参数变化”和“该变化是否值得被抓取”两条线划出边界。可执行的做法是:先给每个参数定角色,再用规则描述哪些组合属于同一内容、哪些组合直接排除,最后把规则落到服务器返回、页面标签和抓取入口三个位置。下面的推演以你手上的一份参数清单和一个真实页面为对象。
把清单里的参数逐个标成三类。内容参数会改变页面主体,例如商品分类、地区、页码;展示参数只改变排序、每页条数、视图模式;追踪参数只用于来源标识,例如广告来源、会话标记。分类依据不是参数名,而是同一参数取两个值后,主体内容是否出现实质差异。
一个可操作的验证动作:取目标页面,分别构造只改一个参数的地址,抓取后对比正文标题、主体文本和结构化数据。若三者一致,该参数视为展示或追踪参数;若正文出现新的实体或新的列表,才归入内容参数。这个动作的结果直接决定下一步:内容参数进入有效集合的维度,其余参数不参与维度组合。
分类完成后,组合空间仍然很大。此时不要枚举地址,而是写规则。规则要能回答两个问题:哪些地址指向同一份内容,哪些地址应当被排除。
这里有一个容易踩的边界:规范化规则只对“确实等价”的地址成立。如果某个展示参数在个别样本上碰巧不改变内容,不能据此把整个参数归为展示类;规模化后,不同分类、不同数据量下的表现可能相反。规则必须能在抽样之外成立,否则应退回逐参数验证。
规则写完只存在于文档里,搜索引擎无法据此判断。需要落到三个位置。
需要说明的是,robots.txt 的抓取限制不等于可靠的索引移除,被限制抓取的地址仍可能以其他方式出现在结果中;站点地图也不保证收录。因此这些位置是协同关系,不是替代关系。不同搜索引擎对参数处理和规范信号的支持情况须分别核查,不能按一套假设统一推断。
假设某共享服务器网站有分类、页码、排序、每页条数、来源标记五个参数,取值分别为 20、10、3、3、5。若全部组合都算有效地址,数量会迅速膨胀到无法管理。按上面的规则:分类和页码是内容参数,排序和每页条数取默认值后规范化,来源标记剥离。有效集合就收敛为分类与页码的组合。
检验方法不是看总量下降,而是看抽样页面在新规则下是否仍能被正常访问、内容是否完整、规范地址是否唯一。若某个分类在非默认排序下出现独有内容,说明该排序在该维度上具有内容属性,需要单独处理,而不是强行并入默认值。这个结果会反过来修改规则,而不是修改抽样。
规模化后出现例外是常态。处理原则是:例外必须能对应到具体参数和具体维度,并留下可复查的判断依据。记录内容包括参数名、取值、抓取时间、主体内容是否变化、最终归类。这样当规则需要调整时,可以定位到是哪一类组合触发了变化,而不是重新全量验证。
最后要明确适用条件:上述方法适用于参数由站点自身生成、且内容差异可被稳定观测的共享服务器网站。若参数由外部渠道动态注入且无法在服务端识别,规范化规则的可执行性会下降,此时应优先控制抓取入口,而不是继续扩展有效集合的定义。定义有效地址集合的目标不是穷尽所有地址,而是让每一个被允许抓取的地址都有明确的内容理由。