Return to course: 让 AI 替你说话:GEO 权威指南
GEOBOK
Previous Lesson
Previous
Next
Next Section
第四章 · 章末测验
可抓取性与可提取性分别回答什么问题?
*
页面能否被下载下来 / 下载后正文能否与噪音分开
页面加载是否够快 / 图片压缩是否够清晰
页面收录了多少 / 关键词排到了第几位
服务器是否稳定 / 移动端是否完成适配
想快速判断页面核心内容是否依赖 JavaScript 渲染,最直接的初筛方法是?
*
在手机、电脑和无痕窗口分别打开页面,对比不同环境下的显示效果
打开浏览器开发者控制台,逐条查看网络请求和脚本是否存在报错
检查页面 URL 中是否包含 # 号或动态加载参数
查看页面源代码(Ctrl+U)搜索核心结论,搜不到即依赖 JS 渲染
关于 TTFB(首字节时间)与 AI 可见性的关系,正确的理解是?
*
存在公开的行业统一阈值,响应时间超过阈值的页面会被各家 AI 爬虫统一放弃
没有统一硬性门槛,但长期响应慢、不稳定会降低被可靠获取的机会
TTFB 只影响真实用户体验,与爬虫能否完成抓取完全无关
只要在网站前面加了一层 CDN,TTFB 就不再需要专门关注
网站两年前改版时在 robots.txt 写入「User-agent: * + Disallow: /product/」,上线后忘了删。这条规则的实际效果是?
*
只约束 Googlebot 这类传统搜索引擎爬虫,各类 AI 爬虫并不受 robots.txt 约束
只在改版维护期间临时生效,网站正式上线后就自动失效
只影响规则写入之后新发布的产品页,存量老页面不受影响
对所有遵守规则的爬虫生效,包括 AI 爬虫,整个产品目录对它们不可见
从 GEO 角度,对「检索类」与「训练类」两类 AI 爬虫的配置原则是?
*
两类都应当封锁,先保护内容版权,再考虑可见性问题
两类都应当放行,robots 配置越宽松对 GEO 越有利
检索类优先保证可访问;训练类按版权与品牌策略单独决策
检索类应封锁防止内容被搬运;训练类应放行,争取进入模型的长期记忆
Sitemap 的 lastmod 字段最常见的两个错误是?
*
把修改时间写成了未来的日期;时间戳缺少秒级精度导致解析直接失败
格式无效(非 W3C 规范);值不真实(写成生成时间而非实质修改时间)
使用了 UTC 时区;在日期中包含了年份信息
文件放错了目录位置;与 robots.txt 里的声明相互冲突
把产品核心参数全部做成图片表格,存在什么 GEO 风险?
*
图片资源加载缓慢,会直接导致整个页面被搜索降权
高清图片的文件体积过大,会显著拖慢抓取速度并很快耗尽网站的抓取预算
文本提取系统未必能稳定读出图中参数,核心参数应同时以文字存在
图片容易触发版权检测机制,可能导致页面被移出索引