本课定位
用可重复的技术审计确认页面能被正常访问、解析和理解,覆盖语义 HTML、抓取控制、结构化数据、性能、可访问性、URL 与内链。
学习目标
- 区分可抓取、可索引、可解析和可引用四个概念。
- 对单页完成一份有证据、有严重级别的技术审计。
- 识别 robots、JavaScript 渲染和 Schema 建议中的时效风险。
文章大纲
1. 审计边界与样本
- 选择模板、设备、地区、登录状态和目标爬虫。
- 单次工具结果不能代表全部平台行为。
2. 访问与抓取
- 状态码、robots.txt、meta robots、认证、重定向、canonical、站点地图。
- 逐一核对不同服务的官方 user-agent 与控制说明。
3. 解析与语义
- 服务端可见正文、标题层级、导航、链接、表格、图片替代文本。
- 检查 JavaScript 失败时是否仍保留核心答案。
4. 结构化数据与实体一致性
- 仅标记页面真实可见内容,验证类型、字段和版本。
- Schema 是语义辅助,不是展示或引用保证。
5. 性能与可访问性
- 用实测与实验室数据分别记录核心体验;避免写死永久阈值。
- 键盘、焦点、对比度与移动端阅读同时检查。
案例设计
审计一页依赖前端渲染、标题错序、FAQ 标记与可见内容不一致的产品页,按阻断/高/中/低给出修复顺序。
动手练习
选择官网一个代表页面,保存请求、HTML、结构化数据验证、性能和键盘检查证据。
提交物
一份单页技术审计表,至少列出 10 个检查项、证据、严重级别、负责人和复测日期。
验收标准
- 每个结论都附 URL、截图/输出或响应证据。
- 抓取控制按具体爬虫核对,不使用笼统“允许 AI”。
- 修复项区分阻断性问题与优化建议。
发布前核验清单
- [ ] robots、爬虫 user-agent、Schema 和性能规范均查阅最新官方资料。
- [ ] 未承诺通过清单即可收录、展示或引用。
- [ ] 测试未绕过认证、付费墙或站点访问控制。
- [ ] 修复后在目标模板、桌面与移动端完成复测。
来源与边界
检查维度源于白皮书 5.2;所有技术细节必须以发布时的 Web 标准和平台官方文档为准。