规模扩大后,最先该停止手工做的是那些“每次都要重新判断、且判断标准已经稳定”的工作,典型是旧内容的批量淘汰与保留、旧系统页面的去留、旧合作关系的续约筛选。手工做单页决策在几十页时没问题,到几千页时,真正拖慢你的不是操作速度,而是每次判断的不一致——同一类页面,这周留、下周删,最后没人说得清规则是什么。下面以你手里的一份旧内容清单为对象,走一遍从手工判断到可执行方案的过程。
把当前手工做的事列出来,按两个维度分类:判断是否已经稳定、单次判断是否需要看页面本身。
判断标准:如果同一类页面你连续三次给出相同结论,第四次开始就不该再手工逐页决定。这不是效率问题,是一致性问题——手工决策越多,规则越模糊,后面接手的人越难复现你的判断。
假设你手里有一份 2000 行的旧内容清单,字段包括 URL、标题、发布时间、最近一次修改时间、站内入链数、近 90 天访问量。手工逐行看,两周也看不完,而且看到第 500 行时标准已经变了。可行的做法是分三层处理。
先只按客观字段分流,不评价内容好坏。例如:
这一步的产出不是删除名单,而是把 2000 行压缩成几百行候选。动作的结果直接影响下一步:候选越少,人工复审才可能真正逐页看完。
对候选页逐页看,但要求每次判断都写一句理由,例如“内容已被新页面覆盖,可合并”“仍有独立信息,保留但更新”。写理由这个动作本身就是在积累规则——复审到几十页后,你会发现理由高度重复,重复的那几条就是下一轮可以自动化的规则。
当某条理由重复出现足够多次,就把它从人工判断升级为规则。例如“内容已被新页面覆盖”可以对应一个检查:新旧页面主题是否重合、新页面是否已有入链。这一步不要求复杂系统,一份带条件的清单加一段简单脚本就能跑。关键是规则要能被别人读懂,而不是只存在你脑子里。
旧系统的处理逻辑和旧内容类似,但多一层约束:页面还在被访问,就不能只按“旧”来判。手工判断容易走两个极端——要么因为怕出错全部保留,要么因为想清理全部下线。可执行的做法是先确认该页面是否仍有独立访问入口和站内入链,再决定是保留、重定向还是下线。这里要区分抓取、索引和排名是不同环节:页面被下线,不等于它承载的入口价值自动转移到新页面,重定向的目标页需要能承接原来的主题。
旧合作关系同理。续约筛选如果每次都靠人回忆上次合作效果,标准会随记忆波动。把“上次合作产出的内容是否仍被站内引用”“是否仍带来可识别的访问”这类可查证的字段固定下来,续约判断就从印象变成核对。这一步的动作结果是:不续约的决定有依据,而不是凭感觉。
不是所有事都适合转规则。以下三类建议保留人工:
如果你现在只有一份清单和有限时间,按这个顺序做:先给清单补齐客观字段,再按第一层规则分流,然后只复审候选并写理由,最后把重复理由升级成规则。每完成一层,下一层的工作量都会下降。反过来,如果跳过第一层直接逐页看,你会在看到几百行后失去标准,最后既没删干净,也没留下可复用的规则。规模扩大后真正该停止手工做的,就是那些你已经能写出稳定判断标准、却还在逐条重复判断的工作。