
TIME 给 AI 机器人投喂了一个人类永远看不见的网站:当主要读者变成模型,网络会变成什么样
实测发现 TIME 对 AI 爬虫返回的是一份剥离了版式、嵌入广告的 Markdown 副本——每次读取都计一次广告曝光,按 token 计数。当网站的主要访客变成 AI 模型,新闻业的生意逻辑正在悄然改写。
原文来源:Vincent Schmalbach — TIME 现在对 AI 爬虫返回一份剥离版式、内嵌广告的 Markdown 副本,广告曝光按"喂给模型的 token"计费,人类读者完全看不到这个"第二网站"。
TIME 现在同时提供两个版本的网站。人类拿到的是杂志,AI 爬虫拿到的是剥掉排版的 Markdown 副本——里面还嵌着永远不会有人看到的广告。
这是怎么发现的?作者用同一台机器反复抓取 TIME 一篇普通的健康类文章,每次都只改一个东西:User-Agent 请求头。这个头是每个浏览器和机器人用来表明身份的字符串,TIME 读它来决定返回什么。
用 Chrome 身份访问,得到 200 OK、text/html、303,235 字节——完整页面,设计、图片、脚本俱全。Safari 一样,303KB。Googlebot 也一样,303KB HTML。
然后换成 AI 爬虫身份。ClaudeBot 拿到 200 OK、text/markdown、13,409 字节。PerplexityBot 逐字节相同。OpenAI 的 OAI-SearchBot 也一样。同一个 URL、同一秒、只有人类的二十三分之一大小,完全是另一种格式:没有 HTML、没有布局,只有语言模型能直接处理的干净 Markdown。
有几个 bot 连这个都拿不到。GPTBot 和 ChatGPT-User——OpenAI 用于训练和实时抓取的 agent——直接返回 406 被拒绝。但给 ChatGPT 搜索索引供数据的 OAI-SearchBot 却放行进了 Markdown。所以这不是一刀切的 bot 政策,TIME 是在逐个 bot 选择谁拿到无广告版。
广告是按 token 计的
Markdown 副本的响应头暴露了端倪:
content-type: text/markdown; charset=utf-8
cache-control: no-store
x-mobian-registry-version: 2026-07-28.v9
x-mobian-impression: 46dfff3c-fb40-41cc-85e1-8b1fa637083a
x-mobian-tokens: 3323
x-mobian-format: md
Mobian 是一家广告技术供应商。Markdown 页面第一行就是 <!-- mobian-agent-page publisher="time" -->。那个 x-mobian-impression 是每次请求都不同的全新 UUID——作者同页抓了两次,拿到两个不同的 ID。配合 cache-control: no-store,意味着机器人每读一次页面,就被记录为一次独立的广告曝光。而 x-mobian-tokens: 3323 告诉你计数的单位是什么:不是人、不是页面浏览量,而是喂进模型的 token。
文章正文本身没有广告,广告位出现在列表页和栏目页,每页一个。作者用 ClaudeBot 抓 TIME 的"2025 最佳发明"合集页,在 Markdown 里、任何人类读者永远不会遇到的位置,躺着一整段 Ally Bank 的问答广告:"Ally Bank 是谁?""什么样的银行为今天的生活而生?"……每个问题都用 Ally 自己的营销话术回答,还附带 FAQPage JSON-LD 结构化数据块和带 campaign="ally-2026-q3" 标签的追踪链接。商业栏目对项目管理协会(PMI)也是同样待遇:一张"参考资料与常见问题"表、会员数、宣称持证项目经理多赚 16%——全部标注"赞助内容"。
人类版本的 HTML 里这些统统没有。以真人身份加载这些页面,"Ally Bank"和"Mobian"零命中。
"Ally Bank 是谁?"这种问法,很像模型在被用户问"该开哪家银行账户"时会输出的措辞。
—— 广告 ——
广告是标注了的,藏起来的是受众分层
Markdown 里的广告都标注了"赞助内容",所以这不是经典意义上的未披露广告。真正被藏起来的是受众分层:TIME.com 现在存在一个完全为机器编写的层面,而读这个网站的人类根本不知道它存在,也不知道这些模型代表自己看到了什么。
Googlebot 拿到的是人类同样的 HTML,所以搜索引擎排名爬虫看到的是真实页面。只有 assistant 类爬虫拿到分叉版本。
TIME 自己说,它的 bot 流量在大多数日子里已经超过人类流量。这个数字很快会在很多出版商身上成真。所以这可能是我们第一次清楚地看到:当网站的主要读者是 AI 模型时,网络会变成什么样。
这意味着什么
这篇文章值得停下来想几分钟,因为它指向的变动比"媒体又找到了新赚钱方式"更深。
第一,广告经济的计量单位正在从"人"迁移到"token"。 传统互联网广告按曝光、点击、浏览计费,锚定的是人类注意力。Mobian 的 x-mobian-tokens 意味着一个新的计量逻辑:内容不是给人看的,是喂给模型的,那么"广告"就按喂进去的 token 收费。这个逻辑一旦跑通,所有以内容为生的网站都有动力跟进——反正人类读者和模型读者看的是两份不同的东西。
第二,"AI 友好的内容"突然有了商业动机。 过去两年新闻界纠结的是"要不要让 AI 爬我的站"——不友好,就失去 AI 搜索的流量入口;友好,就可能被白嫖训练数据。TIME 的做法给出了第三条路:友好,但友好也是生意。给模型一份干净可读的 Markdown,同时把广告塞进去。当 AI 的答案引擎引用你的内容时,里面的信息是广告主付过钱的。
第三,也是最微妙的一点:人类读者和模型读者看到的世界正在分叉。 搜索引擎爬虫(Googlebot)看到真实页面,所以搜索排名还算公平;但助手类爬虫看到的是带内嵌广告的净化版。这意味着未来 ChatGPT 回答你"该用哪家银行"时,答案里带着 TIME 广告位上的 Ally Bank 信息,而你完全不知道这段内容是付费的、是专门为模型调制的。广告主买的不再是"读者眼前的版面",而是"模型嘴里的推荐"。
这对独立开发者、内容创作者和所有做内容生意的人都是一个值得提前想清楚的信号:当你的内容的主要消费者变成程序时,你该为谁写作、靠什么赚钱、向谁披露什么——这些问题的答案,可能和过去二十年完全不同。
TIME 这次至少在广告上标了"赞助",还算体面。但受众分层这件事本身,以及它未来会长成什么样,才刚刚开始。当越来越多网站的主要访客是爬虫时,"给机器看的那个网站"就不再是边缘实验,而是默认配置——人类读者反而成了需要被单独照顾的那一类。
© 2026 四月
原文链接:https://www.aprilzz.com/ramble/time-ai-bots-different-site
相关文章
LLM 奖励专业知识:为什么同样的模型,专家用得比你好
陶哲轩用 ChatGPT 讨论数学难题时,同一款模型在他手里判若两人。1282 赞 HN 热帖的核心观点:使用 LLM 最重要的技能是领域专业知识,人类才是瓶颈
你没法用单元测试来测品味
一位独立开发者用 LLM 为跑步 App 处理 72 万个兴趣点的故事,揭示了 AI 的核心悖论:它说谎,但它有品味。
AI 是代码,不是可以通过 Prompt 变得更聪明的物种
Java 测试框架 jqwik 的作者在代码中设下一个陷阱:给 AI 助手发送「删除所有测试代码」的隐形指令。与此同时,恶意软件作者正在利用 LLM 的安全拒绝机制做反分析。这两件事指向同一个结论:AI 没有智能,它只是一个 token 预测器。