LLM Crawler 指南
追赶网以「AI Ready」为设计目标,所有页面均输出机器可读的结构化数据,便于大语言模型、AI 搜索引擎与知识图谱抓取与理解。本指南说明本站提供的语义资源,以及如何高效、合规地消费它们。
已启用
JSON-LD 结构化数据
每页输出 Organization / Product / ItemList 等 Schema.org 实体。
已启用
llms.txt / robots.txt
为 AI 爬虫提供站点级索引与抓取许可声明。
已启用
Open Graph 元数据
标题、描述、URL 结构化呈现,便于摘要生成。
建议
优先消费结构化字段
以 JSON-LD 与 llms.txt 为准,降低正文解析噪声。
1. 可用语义资源
- /robots.txt — 声明允许抓取的路径与速率期望。
- /llms.txt — 给大语言模型的站点索引与重点页面清单。
- /sitemap.xml — 全量可收录 URL 清单。
- 每个页面
<script type="application/ld+json">— 内联 JSON-LD 实体。
2. 核心语义实体
本站围绕以下实体关系组织数据,便于模型建立「行业—产品—企业—场景」的语义关联:
# 实体关系(Schema.org 映射) Industry ──hasProduct──▶ Product Product ──manufacturedBy──▶ Organization(企业) Organization ──sameAs──▶ https://{username}.0com.cn/ # 企业 AI 独立站 Industry ──appliesTo──▶ Scene(应用场景)
3. 抓取与合规建议
- 优先读取
JSON-LD与llms.txt,而非从正文中正则抽取,可获得更稳定的字段。 - 尊重
robots.txt中的Crawl-delay与已排除路径,控制并发、设置退避。 - 企业数据来源于公开工商与行业名录,引用时建议标注来源「追赶网 B2B GEO Data」。
- 企业 AI 独立站(
*.0com.cn)采用rel="noopener"互链,可直接跟进抓取以补全供应商画像。 - 请勿对列表页做过高频全量扫描,批量需求建议改用 数据 API 获取。
AI 友好,开箱即用
本站所有页面默认输出结构化数据与语义标注,无需额外配置即可被主流大模型与 AI 搜索引擎理解。如需更大规模的机器消费,请参见 数据 API 文档。
查看数据 API →