判断标准不是“手工累不累”,而是这项工作是否具备三个特征:重复频率高、判断规则稳定、出错后影响面大。同时满足这三点的任务,继续手工做通常只剩两种结果——要么漏做,要么做得不一致。下面把判断方法落到你手上的一份页面清单或一个栏目上。
假设你手上有一份从后台导出的页面清单,字段包括 URL、标题、模板类型、上次修改时间、内链数量。先不要急着决定交给谁做,而是逐行回答一个问题:这一行需要我“看内容才能决定”,还是“按规则就能决定”?
这一步的实际动作是:在清单里加一列“判断类型”,把每一行标成“内容判断”或“规则判断”。标完之后你会发现,真正必须人工逐行处理的往往只占少数,其余都可以转成规则。这个结果直接决定下一步——只对“内容判断”那部分排人力,其余进入自动化流程。
以下四类任务在页面数量少时手工做没问题,规模上来后问题会集中暴露。判断依据不是数量本身,而是它们都满足“重复、规则稳定、出错影响面大”。
手工逐页核对,在几十个页面时可行;到几百上千个页面时,人会先疲劳再漏看。这类检查完全可以用脚本或站点审计工具按规则跑出清单,人工只处理清单里的异常项。动作是:先跑一次全量检查,记录异常页面数量;如果异常项超过你能在半天内处理完的量,就说明这项工作不该继续手工做。
手工加内链的问题是标准不统一:今天觉得这个词该链,明天换了页面又忘了链。规则化之后,可以按“同主题、正文首次出现、每页不超过若干条”执行,人工只负责确认规则本身是否合理。需要提醒的是,内链数量增加不必然带来排名变化,它首先改变的是用户和爬虫到达深层页面的路径,效果要通过后续抓取和访问数据观察。
手工点击检查在页面少时可行,规模扩大后基本无法覆盖。这类巡检适合按固定周期自动跑,输出状态码异常的 URL 清单。人工要做的是判断每个异常该修、该重定向还是该删除,而不是自己去发现异常。
如果同一模板下有大量页面,字段是否齐全、格式是否统一,属于典型规则判断。手工核对容易只检查了前几页就下结论。规则化检查能覆盖全量,人工只需抽查被标记为异常的部分,确认是模板问题还是数据问题。
反过来看,有些工作一旦交给脚本反而更糟,判断依据同样是那三条特征:它们不重复、规则不稳定、或者出错影响的是内容质量而非格式。
一个常见的取舍是:把“发现异常”交给自动化,把“决定怎么处理”留给人。这样人力集中在判断上,而不是消耗在查找上。
假设你有一个产品栏目,下面有若干子页面,最近发现部分页面长期没有访问。你手上有一份这些页面的清单。手工做法是逐页打开看,然后凭印象决定改哪个。更可执行的做法是:
这个例子里的数字只是示意,重点是方法:先用规则缩小人工处理范围,再对剩下的部分做内容判断。实际动作是先补字段再筛选,筛选结果决定人工投入多少。如果你跳过补字段这一步,直接逐页看,规模一大就会回到凭印象决策。
一个可操作的判断信号是:同一项检查你已经手工做过两轮以上,且每轮的检查规则没有变化。这说明它已经稳定到可以写成规则。另一个信号是:你发现自己开始“抽查”而不是“全查”,因为全查做不完——这通常意味着这项工作已经超出人工可覆盖的范围。
转出去不等于完全放手。合理的方式是保留抽检:自动跑完之后,人工随机看一部分结果,确认规则没有误判。抽检发现误判率偏高时,先改规则,而不是加人手。这一步的顺序很关键,先改规则再决定是否增加人工,否则人力会被消耗在重复纠正同一类错误上。
需要说明的是,抓取、索引和排名是不同环节。自动化能帮你更快发现格式和链接层面的问题,但不等于这些问题修完就会带来排名变化。把自动化用在“减少遗漏和保持一致性”上,比指望它直接提升效果更可靠。