确认动态页面在搜狗中可见内容,核心是让“抓取到的HTML”和“用户看到的正文”一致。做法是:用搜狗搜索资源平台的抓取诊断或URL检查功能,查看抓取返回的原始HTML;如果正文不在其中,说明内容靠JavaScript在浏览器端渲染,搜狗抓取时可能看不到。此时应把关键正文改为服务端渲染或预渲染后输出,再重新提交验证。
多人协作时最容易返工的地方,是不同角色对“可见”的理解不同:
动态页面常见的情况是第一种成立、第二种不成立。所以验收不能只看“页面能打开”,必须以抓取返回的HTML为准。
执行步骤可以固定成一套,方便交接:
检查项要写进交付清单:正文是否在HTML中、标题与描述是否随内容变化、分页或筛选参数是否产生重复页面。判断结果只有三种——抓取可见、抓取不可见、部分可见,后两种都要回到渲染方式上处理。
如果确认正文只靠客户端脚本生成,可选方案按成本从低到高排列:
适用条件是:正文是页面主要价值,且必须被检索。如果内容本身只对登录用户开放,或只是交互控件,不构成收录所需的正文,就不必强行渲染。改完后要重新走一遍抓取核对,确认源码里出现正文再提交。
几个容易被误当成“已解决”的点:
robots.txt 里放开抓取,只代表允许抓取,不代表内容会被索引,也不等于能移除已收录页面。这些都要在验收单上单独列出,避免把“已提交”写成“已收录”。
把结果倒推成可检查的条目:开发交付可抓取的HTML,SEO交付抓取截图或HTML片段,内容方确认正文与线上一致。验收时以抓取返回的HTML为准,而不是以浏览器截图为准。任一条不满足就退回,不进入下一环节。
下一步:挑一个当前流量最高或最重要的动态页面,按上面的抓取核对流程跑一遍,把返回HTML中是否包含正文记下来,再决定是否需要改渲染方式。