适用场景

技术 SEO 的价值是「让搜索引擎能顺利读懂并收录」。顺序很重要:先保证能抓、能索引,再谈内容与权重。很多站点内容不错却没流量,问题就出在抓取和索引环节。

配置步骤(结构化数据与站点地图)

# 1) 校验结构化数据(用 Search Console 或在线校验工具)
#    常见类型:Organization / WebSite / NewsArticle / FAQPage / BreadcrumbList

# 2) 站点地图健康检查
curl -sS https://example.com/sitemap.xml -o /tmp/sitemap.xml
xmllint --noout /tmp/sitemap.xml && echo 'XML OK'
grep -c '<loc>' /tmp/sitemap.xml
# 抽查前 20 条是否都返回 200
grep -o '<loc>[^<]*' /tmp/sitemap.xml | sed 's/<loc>//' | head -20 | while read -r u; do
  code=$(curl -sS -o /dev/null -w '%{http_code}' "$u")
  [ "$code" = '200' ] || echo "BAD $code $u"
done

# 3) robots.txt 与 sitemap 关系
curl -sS https://example.com/robots.txt | grep -i sitemap

关键参数与建议

  • 抓取基础:robots.txt 放行、sitemap 提交、页面无强制登录
  • 索引基础:每页唯一 title/description、canonical 正确、无重复内容
  • 结构化数据:Organization / WebSite / NewsArticle / FAQPage / BreadcrumbList 按页面类型使用
  • 内链:主导航 + 面包屑 + 相关文章,避免孤岛页面
  • 内容架构:栏目层级不超过 3 层,URL 语义清晰且稳定
  • 移动与速度:移动端可读、首屏加载达标(详见站点性能优化)
  • 监测:搜索资源平台看抓取、索引、覆盖报告,按月处理异常
  • 避免作弊:不做隐藏文字、关键词堆砌、批量垃圾外链

容易踩的坑

  • sitemap 里塞了成千上万条 404 或重定向地址
  • 结构化数据字段造假(评分、作者),被判为作弊
  • 同一页面既输出 NewsArticle 又输出 FAQPage 且内容不符
  • robots.txt 禁止了整个目录,sitemap 又提交该目录
  • sitemap 从未更新,新文章根本不进去
  • canonical 指向错误页面,权重分散

验证与巡检

curl -sS https://example.com/sitemap.xml | grep -c '<loc>'
curl -sS -o /dev/null -w 'sitemap http=%{http_code}\n' https://example.com/sitemap.xml
curl -sS -o /dev/null -w 'robots http=%{http_code}\n' https://example.com/robots.txt

# 抽查 20 条 sitemap 链接,全部 200
  • 巡检:sitemap 可访问且链接全部 200、结构化数据校验通过、robots 与 sitemap 无冲突

小结

技术 SEO 验收:新文章发布后 24 小时内被 sitemap 收录并进入抓取队列,页面结构化数据校验通过,无重复 title 与 canonical 冲突。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。