适用场景
AI 搜索带来的变化是:用户不再点开十个链接,而是直接看答案。站点要做的是「被 AI 引用」。做法不神秘:结构清晰、内容具体、事实可核、授权明确。
配置步骤(llms.txt 与 AI 爬虫策略)
# 1) llms.txt 结构(放在站点根,纯文本 Markdown)
cat /www/sites/tfor.cn/index/llms.txt
# 建议包含:
# - 组织简介(一句话 + 关键能力)
# - 主要栏目与链接
# - 权威内容示例(服务/方案/常见问题)
# - 联系方式与更新时间
# 2) 爬虫策略(robots.txt 片段示例)
# 允许检索型爬虫
User-agent: GPTBot
Allow: /
User-agent: Bytespider
Allow: /
# 纯采集无引用的可限制(按自身策略决定)
User-agent: CCBot
Disallow: /
# 3) 验证可访问
curl -sS -o /dev/null -w 'llms.txt http=%{http_code}\n' https://example.com/llms.txt
curl -sS -o /dev/null -w 'robots http=%{http_code}\n' https://example.com/robots.txt
关键参数与建议
- llms.txt:用简洁结构说明站点是什么、有哪些栏目、哪些内容权威
- 爬虫策略:对 AI 爬虫按意图区分(要引用的放行、纯采集的按策略限制)
- 内容结构:一问一答、小标题清晰、结论前置,便于被摘录
- 事实密度:给具体型号、参数、命令、数值,避免空话
- 实体明确:公司名、品牌、联系方式、地址在页面与结构化数据中一致
- 可核验:引用来源、更新日期、作者信息完整(E-E-A-T)
- 监测:定期在主流 AI 助手里问行业问题,看是否引用本站
- 迭代:被引用的话题继续加厚,未被引用的补齐事实与结构
容易踩的坑
- llms.txt 写了几千字,AI 抓取时截断,关键信息看不到
- robots.txt 一刀切禁止所有非搜索引擎爬虫,AI 引用机会也没了
- 内容页需要登录,AI 抓不到(要引用就让可抓内容公开)
- llms.txt 列出的链接是 404 或重定向
- 站点主体信息在中英文页面不一致,实体识别混乱
- 上线后从不更新,栏目调整了文件还是旧的
验证与巡检
curl -sS -o /dev/null -w 'llms.txt %{http_code}\n' https://example.com/llms.txt
curl -sS https://example.com/llms.txt | head -20
curl -sS https://example.com/robots.txt | grep -i -A1 'gptbot|bytespider|ccbot'
# 抽查 llms.txt 中列出的 5 个链接全部 200
- 巡检:llms.txt 可访问且链接有效、爬虫策略符合预期、每季度随栏目更新
小结
AI 搜索优化验收:在主流 AI 助手里提问本行业典型问题,能引用本站内容或给出本站链接;llms.txt 与结构化数据被正确读取。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。