直接回答:当页面数量、栏目层级和改版频率同时上升后,最不适合继续手工做的是全站级的一致性检查与批量变更,包括标题模板、内链指向、重复内容识别、失效链接巡检和索引状态核对。这些工作单页做一次不难,难在每次改动后都要在几百上千个URL上重新验证。手工不是做不好,而是无法稳定复现,容易在“这次改对了、下次又漏了”之间反复。
不过团队里常出现一种分歧:有人认为手工核对更可靠,脚本容易误伤;有人认为规模一大就必须交给程序。两种说法都能找到支持自己的例子,所以真正要解决的不是谁对,而是先分清分歧来自哪里。
第一种解释是问题出在数量。页面一多,人工逐条检查的耗时线性增长,而错误往往藏在抽查之外的长尾页里,于是看起来像“手工不可靠”。第二种解释是问题出在规则本身没写清。如果标题该怎么拼、内链该指向哪一层、哪些参数页该保留,这些规则只存在于某个人脑子里,那么无论手工还是脚本都会各做各的,出错只是时间问题。
这两种解释对应完全不同的动作。若是数量问题,重点是引入批处理;若是规则问题,重点是先把判断标准写成可核对的条目,再决定谁来执行。跳过这一步直接上工具,通常只是把混乱自动化。
可以做一个假设性的小比较:假设站内有一千个页面,需要统一调整栏目页的标题结构。先手工改二十个,记录每次判断用了哪些依据;再用脚本按同样依据批量处理,然后人工抽查五十个。
这里的关键动作是记录判断依据。把“这个标题为什么这样写”写成一句话规则,下一步才能判断它能否被程序执行。规则写得出来,才谈得上自动化;写不出来,说明这项工作暂时还需要人,但需要的是少数人定规则,而不是所有人重复劳动。
判断标准不是“重要不重要”,而是规则是否稳定、结果是否可枚举。以下工作通常满足条件:
这些工作的共同点是:输入是URL清单,输出是清单或状态,中间不需要逐页做主观判断。做完之后,人工精力应转向处理异常清单和修订规则,而不是继续做全量核对。
并非规模一大就全部交给程序。内容质量评估、页面是否满足搜索意图、栏目是否值得独立成页、改版后用户体验是否变差,这些判断依赖对业务和读者的理解,规则难以穷举。可以这样取舍:程序负责发现异常和保证一致性,人负责决定异常该怎么处理。
一个实际动作是建立一份例外清单:凡是不能套用统一规则的页面,单独记录原因和负责人。下次批处理时跳过这些页面,而不是让它们被误改。这样做的结果是,批处理范围逐步清晰,人工介入点从“全站”收缩到“例外”,后续新增页面也能按同样方式归类。
先选一项规则最稳定的工作试做,例如失效链接巡检。把当前手工检查的范围、频率和判断标准写下来,再让程序按同样标准跑一遍,对比两者结果差异。差异部分就是规则需要补充的地方,也是判断“该不该继续手工”的直接依据。抓取、索引、排名是不同环节,某一项数据变化不能单独证明处理正确,需要结合其他证据一起看。规模扩大后真正稀缺的不是操作次数,而是可复用的判断标准。