结论有前提:当页面数量、改版频率或历史遗留内容超过一个人能稳定核对的范围时,逐条手工改标题、手工补内链、手工判断旧内容去留,会从“精细”变成“不可控”。此时应把可规则化的工作交给脚本或系统,把判断类工作保留给人。反例是:站点只有几十个页面、每次改动都能当天复核,手工反而更快,过早自动化只会增加维护成本。
不是页面一多就必须停手,而是出现下面几种情况时,手工的边际收益明显下降:
这些信号的共同点是:工作本身有明确规则,但执行量超过了人工可验证的范围。此时继续手工,风险不是慢,而是漏改和误判被掩盖。
可以把工作分成“可判定”和“需判断”两类。可判定的部分适合用脚本或系统批量处理:
假设一个站点有约两千篇旧文章,其中一部分来自已停止合作的栏目。可以先按“超过两年未更新且无任何内链指向”筛出候选清单,人工只复核这份清单,而不是逐篇翻完两千篇。这个动作的结果是:复核量从两千降到几百,下一步的退出或保留决策才有可执行性。
规模扩大不等于所有事都能脚本化。以下工作即使量大,也应由人保留最终决定:
换句话说,自动化适合处理“已经想清楚”的部分,不适合替人“想清楚”。把判断也一起交出去,问题只会从执行层转移到更难发现的决策层。
如果站点已经出现手工失效的信号,可以按这个顺序推进:先用小样本验证一条规则,确认误伤范围;再把规则应用到全量并导出结果;然后只对结果中“不确定”的部分人工复核;最后根据复核结论决定是否扩大规则范围。每一步的结果都会影响下一步:样本误伤高,就先改规则;全量结果里不确定项过多,就说明筛选条件还不够细,应先补条件而不是硬做决定。
需要说明的是,抓取量或索引量下降本身不能单独证明某个处理动作正确,它也可能来自改版、服务器波动或外部环境变化。判断动作是否有效,要结合改动前后的对照和具体页面样本,而不是只看一个总数。
先列出当前仍在手工重复的三项工作,逐项标注“规则是否明确”。规则明确且量大的,写一条最小规则并在小样本上跑一遍;规则不明确的,先补判断依据,不要急着自动化。这样做的结果是:你能清楚区分哪些工作该退出人工流程,哪些判断仍需保留,规模扩大后才不会在漏改和误判之间反复消耗。