先给结论:有效地址集合不是“所有参数组合”,而是“能被独立检索、且内容确实不同”的最小地址集。其余组合要么规范到主地址,要么用抓取限制挡住,但抓取限制不等于移除索引。下面用一个假设情境把决策过程走完。
假设一个商品站,早期只有品牌、价格区间两个筛选参数,地址形如 /list?brand=a&price=1,数量有限,收录也正常。后来加入尺寸、颜色、材质、库存地、排序方式,参数可自由组合,理论地址数迅速膨胀到远超商品总数。
此时站长常见的第一反应是“全部放开让百度自己选”。这个做法在样本阶段可能成立:少量组合确实带来了额外入口流量。但规模化后会出现例外——同一批商品被几十个地址重复呈现,抓取预算被大量近似页面消耗,真正需要更新的商品页反而变慢。样本成立不等于整体成立,边界就在这里。
对每个候选地址,用三个可验证的问题过滤:
三项都通过,才进入有效集合;只通过一项,通常归入“可抓取但不索引”的类别。这个分类动作会直接决定下一步:进入有效集合的地址需要可被发现、可被更新;其余地址则要处理重复信号,而不是继续放大数量。
参数增长失控的根源,往往是单值参数和组合参数混在一起。单值参数(如排序、每页条数)结果集稳定、可枚举,适合保留少数几个;组合参数(多条件交叉)数量随维度乘积增长,几乎不可能全部有效。
一个可执行的划分方法是:
做完这一步,再去观察抓取日志。如果某些组合仍被频繁抓取,说明站内或外链仍在暴露它们,需要回到链接层处理,而不是只改地址规则。
很多团队会用 robots.txt 屏蔽全部参数地址,认为问题解决了。这里必须说清:抓取限制不等于可靠的索引移除。被屏蔽的地址如果已从别处获得链接,仍可能以无摘要形式出现在结果里,而且你失去了用页面内容纠正它的机会。
站点地图也不是收录保证。它适合用来提交你确认属于有效集合的地址,帮助发现和更新,但不能靠堆入海量参数组合来“催收录”。把无限组合塞进站点地图,通常只会稀释其中真正重要地址的信号。
因此两种手段的定位是:robots.txt 用于挡住确定无价值、且不会被误当内容的路径;站点地图用于声明有效集合。两者都不能替代对地址集合本身的定义。
把上面的取舍收成一条流程,便于在参数继续增加时重复使用:
注意复核时的归因:某个参数地址抓取量下降,可能来自链接调整、站点地图变化或抓取节奏波动,不能只凭一个现象就断定处理正确。必要时对照调整前后的日志与入口变化,再决定是否扩大或收紧白名单。
回到最初的问题:有效地址集合应当由“内容是否独立、需求是否真实、结果是否可枚举”共同定义,而不是由参数能拼出多少种组合决定。先划出这条边界,再谈抓取与提交手段,参数继续增长时才不会反复推翻前面的决定。