当站点从几十个页面扩到几千个页面时,最先失效的不是某条规则,而是“逐页判断”这种工作方式。石榴算法针对的是内容质量与采集、拼凑类问题,它的处理对象是成批页面,因此规模扩大后,逐条人工检查低质内容、逐页改写旧文、逐个保留或删除旧链接,都会成为拖慢决策的瓶颈。更实际的做法是:把工作拆成“保留、改写、退出”三类批量规则,人工只处理规则边界上的少数页面。
手工做内容治理并非一律不可取,关键看它是否产生可复用的判断标准。以下动作在规模扩大后仍然值得人工投入:
不适合继续手工做的,是那些每次都要重新判断、判断结果又无法沉淀成规则的动作,例如逐页读完全文再决定是否保留、逐条修改旧文标题、逐个检查旧合作关系留下的外链页面。这些动作在页面量上升后,成本会线性增长,而判断质量反而下降。
把旧内容分成三类,先看前提是否成立,再决定动作。
适用前提是页面能独立回答一个具体问题,且信息没有明显过时。保留不等于原样不动,可以只做必要的维护,例如更新失效的引用、补充新的适用条件。保留池的规模应当可控,如果一类页面几乎全部进入保留池,说明筛选标准过宽,需要重新定义什么算“仍有价值”。
适用前提是页面主题仍有人需要,但内容存在明显缺陷:结构混乱、信息陈旧、或多个页面重复讲同一件事。改写的重点不是换同义词,而是合并重复页面、补上缺失的判断依据。规模扩大后,改写应按主题簇批量进行,而不是按页面顺序逐篇处理。若改写后页面之间仍然高度相似,说明合并策略没有落实,下一步应优先合并而不是继续改写。
适用前提是页面既没有独立信息,也无法通过改写获得独立价值,例如纯采集拼凑、只为覆盖词而生成、或对应旧合作关系已经结束且无后续维护的内容。退出的方式包括删除、设置跳转或保留但不再投入维护,具体选哪种取决于该页面是否还有外部引用、是否仍是用户可能到达的入口。退出动作一旦执行,应记录被退出页面的类型,用于校验规则是否过宽。
假设某站有 2000 个旧页面,其中约 600 个是早年围绕相近主题生成的短内容。人工逐页判断需要较长时间,且不同人给出的结论可能不一致。可以先用规则筛出“正文少于某个长度、没有独立数据、标题与站内其他页面高度重合”的页面,把它们放入待退出池;再从中抽样人工复核,确认规则是否误伤。若抽样中发现相当比例的页面其实有独立信息,说明规则过严,应先调整规则再批量执行,而不是直接删除。这个例子的数字只用于说明比较方法,不代表任何实际站点的比例。
批量处理低质内容后,抓取量或索引量出现变化是常见现象,但它不能单独证明处理正确。索引量下降可能来自退出动作,也可能来自抓取预算重新分配、站点其他改动或正常波动。判断处理是否合理,应结合:
如果退出后没有页面承接原有需求,用户可能转向站外,这时应考虑把部分页面改为改写而非直接退出。反过来,如果保留池中大量页面长期没有维护价值,说明筛选标准需要收紧。每一步动作的结果都应反馈到规则本身,而不是只反馈到单个页面。
规模扩大后,人工的角色应从“处理页面”转为“维护规则和复核样本”。具体动作包括:定义保留、改写、退出的判断条件;按主题簇批量执行;抽样复核;根据复核结果调整条件。这样做的结果是,后续新增旧内容可以直接套用已有规则,只有边界情况才需要人工介入。若某类页面反复出现在边界情况中,说明规则缺少一个明确条件,应补充条件而不是继续逐页处理。石榴算法所针对的内容质量问题,在规模站点上往往表现为成批的相似页面,因此规则化处理比逐页优化更接近问题本身。最终要保留的,是那些能独立回答问题的页面;要退出的,是既无独立信息又无维护价值的页面;介于两者之间的,才进入改写流程。