🧭 官网 GEO 体检 评分卡 Phase 1 · 规则引擎版

评分卡 v0.5.2

唯一事实来源:/srv/geo/rubric/rubric.yaml · 更新于 2026-09-20 · 启用 20/21 项检查 · 修改文件保存后自动热加载(校验失败沿用旧版,无需重启)

版本记录

制定依据

等级标准

维度与权重

维度名称权重状态说明
AAI 可访问性 23% 启用 AI 爬虫能不能抓到、读到官网
B内容可提取性 37% 启用 内容是否容易被 AI 理解与引用
C内容可信度 35% 启用 内容是否值得 AI 采信(普林斯顿论文:数据/引用/权威表述显著提升被引率)
DAI 可见性 5% 启用 实测信号——主流爬虫联盟是否实际抓到过该站(Common Crawl 收录);后续扩展 AI 引擎引用监测。整组不适用(内网目标)时自动让出权重

检查项(21 项)

编号名称维度权重判定依据 / 可调参数
A1 robots.txt 对 AI 爬虫的放行情况
多数建站模板默认屏蔽 AI 爬虫,是最常见也最致命的『隐形死刑』
A 3 fail_blocked_min = 5
bots = GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、Claude-User、PerplexityBot、Google-Extended、CCBot、Bytespider
A2 llms.txt AI 内容导览
llmstxt.org 社区规范,主动向 AI 引擎介绍站点结构(加分项)
A 1 (无参数)
A3 原始 HTML 内容完整性(JS 依赖检测)
多数 AI 爬虫不执行 JS;纯前端渲染站点被抓到的是空壳
A 3 fail_text = 400
warn_text = 600
min_ratio = 0.008
containers = app、root、__next、__nuxt、q-app
A4 技术基础(HTTPS / 响应速度 / 页面体积)
HTTPS 是信任基础;速度与体积影响抓取效率
A 2 slow_warn_s = 4.0
size_warn_mb = 2.0
A5 sitemap.xml 站点地图
帮助 AI 爬虫系统性发现全站页面
A 1 (无参数)
A6 反爬 / WAF 拦截检测
人机验证会把真实 AI 爬虫挡在门外
A 3 markers = just a moment、cf-chl、challenge-platform、cf_chl、turnstile、滑动验证、请输入验证码、验证码、waf、punish、captcha
A7 noindex 检测(meta robots / X-Robots-Tag)
noindex 比 robots.txt 屏蔽更隐蔽,会让索引直接忽略页面
A 3 (无参数)
B1 JSON-LD 结构化数据
结构化数据让 AI 确定性地识别企业与问答实体
B 3 valuable_types = Organization、Corporation、LocalBusiness、Product、FAQPage、QAPage、Article、NewsArticle、BreadcrumbList、WebSite、AboutPage、ContactPage
B2 语义化 HTML 结构(标题层级)
标题大纲是 AI 理解页面结构的主要线索
B 2 (无参数)
B3 title / meta description / Open Graph
元信息是 AI 与搜索引擎理解页面的第一入口
B 2 complete_min = 4
partial_min = 2
og_keys = title、description、image
B4 FAQ / 问答式内容
AI 引擎回答用户问题时最倾向引用 Q&A 结构的内容
B 3 section_pattern = 常见问题|常见问答|FAQ|Q&A|问答
min_question_headings = 2
min_details = 3
B5 正文文本量与文本密度
没有文本就没有可摘录的内容
B 2 fail_text = 300
fail_ratio = 0.008
warn_text = 1200
warn_ratio = 0.025
B6 图片 alt 文本覆盖
alt 是 AI 理解图片语义的唯一线索
B 1 pass_alt = 0.9
warn_alt = 0.6
B7 canonical 规范化地址
多 URL 重复内容会稀释实体识别
B 1 (无参数)
B8 企业实体信息(名称/地址/电话/邮箱/备案)
一致且可机读的实体信息是 AI 建立企业知识的基础
B 3 pass_min = 4
warn_min = 2
B9 实体外部锚点(sameAs:百科/社媒/地图)
sameAs 帮助 AI 把官网与全网实体锚定为同一家企业(知识图谱一致性)
B 2 pass_min_categories = 2
warn_min_categories = 1
C1 内容具体性(事实密度)
普林斯顿论文:含统计数据的句子被引率提升 30~40%;关键词堆砌无效
C 3 pass_facts = 8
pass_case_kw = 2
warn_facts = 3
buzz_words = 领先、一流、卓越、顶尖、世界级、行业先进、极致、匠心、赋能、引领、知名
C2 数据引用与内容新鲜度
普林斯顿论文:引用来源/数据显著提升可见度;新鲜度是采信信号
C 2 min_pct = 2
min_amounts = 1
fresh_within_years = 1
C3 权威信号(资质/荣誉/团队/合作)
权威表述与第三方背书提升 AI 采信度
C 2 pass_min = 3
warn_min = 1
C4 引用就绪度测试(LLM 模拟客户提问)
规则测不了的『内容能否直接回答客户问题』由 LLM 判定;当前默认关闭以保持本地与线上形态一致,需要时把 enabled 改为 true 并配置 config/llm.json 即恢复
C 3 pass_ratio = 0.8
warn_ratio = 0.5
D1 Common Crawl 收录查询
主流开源爬虫联盟近期是否实际抓取过该站(许多 AI 的训练/检索数据源);被收录是被引用的必要非充分条件
D 1 (无参数)