先给有条件的结论:如果免费版只缺字段展示、但原始数据仍能在页面源码、日志或搜狗站长平台的其他位置取到,优先用外部可复核的来源补证;如果免费版连原始数据都不提供,只剩一个结论性提示,那就不要用截图和转述硬凑证据,而应改为记录“无法核对”的范围,并把判断依据降级为待验证假设。两种做法都成立,分界线是:你补的字段能否被第三方独立复现。
免费版给出一个结论,比如“标题存在风险”或“页面未收录”,但缺少具体字段、时间戳或原始值,这时先分清两种缺失。
判断方法很简单:先看免费版是否提供导出、复制原文、查看源码或查看请求记录。如果这些入口存在,缺的通常只是展示层。如果这些入口全部不存在,且页面没有任何可展开的原始值,就按数据层缺失处理。注意,入口是否存在需要以你当前实际看到的界面为准,工具的功能和额度会变化,不能凭旧印象推断。
假设你面对一个页面,免费版提示“标题过长”,但不给出字符数、计算口径和检测时间。你有两个看似合理的做法。
适用条件是字段本身可以从公开信息重新计算,比如标题字符数、页面状态码、canonical 指向、robots 指令。做法是直接取页面源码,用统一的计算口径重新得出数值,并把源码片段、计算规则、取得时间一起记录。
代价是你要自己承担口径不一致的风险。工具可能按字节算,你按字符算;工具可能算上空格,你没算。结果对不上时,不能直接说工具错了,只能标记为“口径待确认”。
适用条件是字段与抓取、收录、展现相关,且站长平台里能看到对应状态。做法是把工具结论与平台里同一页面、同一时间段的记录并列,观察是否一致。
代价是两边的时间窗口和统计口径往往不同。工具说“有问题”,平台说“已抓取”,这不一定矛盾,可能只是检测时点和抓取时点不同。此时应记录两个时间点,而不是直接下结论。
两条路线的选择标准可以压成一句话:能独立复现的字段走路线一,与抓取和展现绑定的字段走路线二,两者都做不到的字段直接标记为不可核对。
假设你选了路线一,从页面源码里数出标题有 32 个字符,而免费版提示“过长”。你据此认为工具误报,并把这条写进报告。这个结论可能失效,因为工具检测的未必是当前线上版本。
常见解释至少有三种:工具检测的是缓存版本或上一次抓取版本;工具统计的是包含 HTML 实体后的长度;工具的口径包含标题前后的空白或分隔符。这三种情况下,你的 32 与工具的“过长”可以同时为真。因此,只要工具没有给出检测时间和计算口径,单次数值不一致就不能证明任何一方错误。正确做法是把差异本身作为证据记录下来,注明“口径未知,需下一次检测对比”。
无论走哪条路线,记录格式应保证另一个人能按同样步骤得到同样结果。建议每条记录包含四项:字段名、取值来源、取得时间、复现步骤。
一个假设例子:某页面免费版提示标题异常,你从源码取到标题文本,按上述规则数出 28 个字符,同时记录站长平台显示该页面最近一次抓取成功。此时你的下一步不是修改标题,而是等下一次工具检测,看提示是否仍在。如果提示消失,说明此前差异可能来自缓存版本;如果提示仍在,再考虑口径差异或真实问题。这个动作的结果直接决定你是继续核对口径,还是进入修改流程。
完成一轮记录后,按以下顺序推进:先对比两次检测之间字段值是否变化;若未变化而提示变化,优先怀疑检测时点或缓存;若字段值确实超出你设定的规则,再进入修改,并在修改后保留修改前后的源码片段。
需要停止补证的条件也要提前写明:当同一字段连续两次检测都无法从任何独立来源取得,且工具不提供口径说明时,应停止为该字段寻找证据,改为在报告中标注“该结论不可核对”,并把资源转向可核对的字段。继续用截图、口头转述或推测填充,只会让后续判断建立在无法复查的基础上。