把“怎么选”“多少钱”“哪个好”“能退吗”这类近似问句全部塞进同一张关键词表,样本少时看起来整齐,规模一大就会出现矛盾:有些问句明明只差一个词,却对应完全不同的页面和下一步动作。更实用的做法不是继续按字面聚类,而是先判断提问者处在哪个决策阶段,再决定这些问句该合并、拆开还是暂时搁置。
假设你收集到三组问句:“A方案怎么选”“A方案选哪个好”“A方案选错了怎么办”。从字面看,它们共享同一个核心词,自动聚类工具很可能把它们放进同一组。但把它们放进同一篇文章,读者会感到跳跃:第一句的人还在比较条件,第二句的人在找结论,第三句的人已经遇到问题。规模化后,这种跳跃会反复出现,因为近似问句的数量增长快于意图差异的显现速度。
个别样本成立不代表可以照搬。你手动看十条问句时,能凭语感判断它们像不像一类;当问句变成几百条,语感失效,聚类结果开始把不同阶段混在一起。这时继续按字面相似度合并,只会得到一个看似完整、实际无法落笔的清单。
面对上述矛盾,通常有两种解释。
解释一:它们只是同一意图的不同说法。持这种解释时,你会认为“怎么选”和“选哪个好”在问同一件事,只是措辞不同,可以合并成一个选题,用一段话同时回应。
解释二:它们指向不同的决策阶段。持这种解释时,你会认为“怎么选”是在建立判断标准,“选哪个好”是在收敛到具体选项,“选错了怎么办”是在处理已发生的后果。三者需要的证据、结构和下一步动作都不同,不能共用同一篇内容。
两种解释都成立,但成立条件不同。当问句只涉及单一维度、选项极少、后果可逆时,解释一更可能成立,合并不会损失信息。当问句涉及多个比较维度、选项多、决策成本高或后果难逆时,解释二更可能成立,强行合并会让每个阶段的人都得不到完整回答。
要判断一批近似问句到底属于哪种情况,可以找几类可观察的证据,而不是只凭字数或词形相似度。
把这些证据标在关键词表里,你会得到一张按阶段分层的清单,而不是一张按字面聚类的清单。分层之后,再决定哪些层可以合并成一篇,哪些层必须独立成页。
假设你整理的是“远程协作工具”相关问句,收集到约两百条近似表达。按字面聚类,可能得到“选择类”“价格类”“使用类”三堆。但按决策阶段重新标注后,会变成:
这个例子是假设的,数字只用于说明比较方法,不代表任何真实统计。它的作用是展示:同一批近似问句,按字面看是一类,按阶段看是三类。分类动作本身会改变下一步——如果你把它们分成三个阶段,接下来就会为每个阶段单独设计页面结构和证据;如果继续混在一起,接下来只能写出一篇每段都浅尝辄止的内容。
阶段分层不是万能规则。当你的站点规模很小、问句总量有限、每个阶段都凑不出一篇有足够证据的内容时,强行拆成三页会产生大量薄页面,反而不如合并成一篇、用清晰的小标题区分阶段。反过来,当某个阶段的问句持续增加、且答案形态明显不同,继续合并就会让页面失去焦点。
判断边界时,可以问自己:这个阶段是否有独立的证据、独立的后续动作、独立的失败情形。三者至少满足两项,独立成页才更可能成立;只满足一项,优先考虑合并。这个判断不依赖关键词密度、字数阈值或标题字符数,那些数值没有适用于所有网站的通用标准,机械换写同义词也不会带来新的决策价值。
整理近似问句的关键动作,是先标注决策阶段,再看阶段之间的证据和后续动作是否可分。标注结果直接决定你下一步是合并、拆分还是搁置,而不是继续在字面相似度上反复调整聚类参数。