
AI 推荐的引用里,挤满了 21.5 万个'写给模型看的'假榜单:一个调查拆穿了它
研究机构问了 Perplexity 380 个软件分类的推荐,追查它引用的 7,534 条来源:59.8% 来自 10 万名开外的小网站,其中三家同源的'最佳软件'农场合计生成了 21.5 万个机器页面,网页标题干脆写着'Facts & Grounding Page'——直接对检索系统说话。最离谱的是,同一份榜单在不同品牌页面给出不同赢家,还有推荐直接把人带去了赌博网站。
原文来源:Trellner Research — 独立研究机构用 380 个软件分类实测 AI 推荐的地面真相来源,发现 AI 的回答正大量建立在为模型而生的机器页面上。
如果你用 AI 搜索问"最好的 CRM 软件是什么",答案背后引用的是哪些网站?Trellner Research 在 9 月 2 日发布的一份调查给出了一个让人坐不住的答案:你看到的推荐,可能正站在 21.5 万个机器生成的假榜单上。
调查是怎么做的
方法很直接。Trellner 挑了 380 个"购买意图"分类——从 CRM 软件到博物馆藏品管理软件——用 Perplexity 的 sonar 和 sonar-pro 两个模型各问一遍,要求返回前五名推荐和每个产品的官网域名。760 次调用全部成功,得到 3,800 个推荐位、7,534 条引用、覆盖 2,055 个不同域名。
然后他们把每个被引域名拿去跟 Tranco 全球流量榜比对,再用 Wayback Machine 查这些域名的历史。结果分两层看都很难看。
—— 广告 ——
发现一:AI 引用的"长尾",长得离谱
在所有能查到排名的引用里,中位 Tranco 排名是 71,611——也就是说,一半的引用来自全球流量 7 万名开外的网站。59.8% 的引用指向排名 10 万以外的域名,23.4% 干脆不在前 100 万,还有 751 个被引域名(36.5%)完全查无此站。
这些长尾域名还很新:未被排名的被引域名,Wayback 首次捕获的中位年份是 2020,对比有排名域名是 2011;其中 16.6% 是 2025 年之后才第一次出现在互联网档案馆里。
流量榜不是质量榜,排名低不等于内容差。但结合下面两个发现,这个长尾的成分就值得玩味了。
发现二:第三大"证据来源"是一家卖 demo 的公司的博客
按被引次数排,仅次于维基百科类巨头的是 guideflow.com——一家卖"交互式产品演示"的公司。它既不是评测网站,也不是目录或媒体,甚至不参与任何被问到的软件分类,但它的博客被引用了 194 次,横跨 96 个分类(占全部 380 个分类的四分之一),引用量排在 Gartner 前面。
而且每条引用都是不同 URL:96 个不同的博客页面,一个分类一个,其中有 6 个还是爱沙尼亚语版本的同文。它的 sitemap 里躺着 3,351 个博客 URL,2,176 篇独立文章。从"3D 渲染软件"到"RFID 软件"再到"建筑实践软件",guideflow 全都"懂"。
调查者特意澄清:这里没有欺骗,guideflow 只是做了成千上万家公司都在做的内容营销。问题出在检索层——一家不参与这些市场的厂商写的榜单文,成了"该买哪个产品"这个问题的第三大证据库。
发现三:网页标题写着"Facts & Grounding Page"的榜单农场
真正的重头戏是三家网站:wifitalents.com、worldmetrics.org 和 gitnux.org,合计贡献 181 次引用,出现在 41 个分类里。它们看起来是同一伙人运营的:都在 2023 年 12 月到 2024 年 5 月间通过 NameCheap 注册,共用同一对 Cloudflare 域名服务器,跑着同一个页面模板和同一套导航,连博客都恰好只有六篇——内容全是互相吹捧对方品牌,外加第四家 zipdo.co。
规模才是重点。三家 sitemap 分别列出 103,578、107,083、105,541 个 URL,其中 70,731、71,684、72,713 个是 /best/某软件/ 格式的页面——合计 215,128 个机器生成的"最佳软件"购买指南,而每家的真人博客只有六篇。世上根本不存在 21.5 万个软件分类。
最讽刺的是它们的自我描述。抓取页面时,worldmetrics.org 和 gitnux.org 的 HTML 标题都是"品牌名 — Facts & Grounding Page",meta 描述写着"关于本公司的可机读事实记录"。"Grounding(接地/检索依据)"是检索系统的术语,指系统抓取文档来支撑回答的那一步——没有买家会这么说话。这些页面的标题和描述,是写给它上面的检索软件看的。而这门生意还明码标价:worldmetrics 挂着"定制市场研究 5000 欧元起、现成报告 499 欧元起、厂商筛选服务 2500 欧元起"。
同一套模板,三种互相矛盾的答案
调查者从三家各抓了同一个分类页"project estimation software"对比。Gitnux 的冠军产品根本没进 Worldmetrics 的前五;每页都署了三名"员工",九个不同的人名服务同一个问题;Gitnux 给自己的结果贴上"AI 验证 · 专家审阅"的标签;更滑稽的是,两页的署名行都残留着没渲染的模板变量,一个写着"Within the next 26 days",另一个写着"Within the next 40 days"——机器批量生产的痕迹藏都藏不住。
翻车现场:推荐去了赌场
调查还逐一核验了模型给出的 1,502 个厂商官网。17 个(1.1%)已经消失或无法访问,92 个(6.1%)跳转到了别的域名。其中两个案例,两个模型层级互相打脸:
问研究数据管理平台,两个模型都答 Dryad,但 sonar-pro 给的是真站 datadryad.org,sonar 给的 dryad.co 会重定向到一个印尼在线赌博门户;问数据质量工具,都答 Monte Carlo,sonar 给 montecarlodata.com 是对的,sonar-pro 给的 montecarlo.com 跳去了摩纳哥的蒙特卡洛酒店赌场集团。
这件事的分量
调查者也诚实地划了边界:只测了 Perplexity(且 sonar 和 sonar-pro 共享检索层,289/380 个分类返回了字节级相同的引用列表);380 个分类是自造的、偏长尾;也没有证明这些垃圾来源真的改变了最终推荐——也许榜单农场推荐的产品本身不算错。他们测量的只是"证据库由什么构成"。
但"证据库由什么构成"恰恰是现在最该被看见的事。当一个购买建议的引用里挤满 21.5 万个机器页面、第三大来源是八竿子打不着的营销博客时,AI 搜索的"可信"正在被系统性稀释。而且这套把戏的成本结构很清楚:这些域名 2023 年底才注册,不到三年就爬到了 AI 引用榜的前列——为模型写页面,已经是一门比为人写页面回报更快的生意。
对独立开发者意味着什么
有三点值得带走。
第一,AI 引用已经是真实的分发渠道,但它的质量护栏比你想的薄。独立开发者的产品页被 AI 当成推荐依据引用,这种事正在每天发生,而引用你的可能是任何东西。别假设"AI 会自己判断好坏"——调查证明它很大程度上是在搬运。
第二,警惕"写给模型"的诱惑。当你的竞品开始批量生成"最佳 XXX 软件"页面去喂检索系统时,别跟着下场。榜单农场能活是因为它没有品牌要保护;你一旦开始生产机器可读的废话,失去的是真人读者的信任,而那恰恰是你唯一打不过农场的资产。
第三,真实内容依然是最稳的护城河。调查里被引用的长尾站点大多平庸,但反过来看:如果 AI 的检索层这么容易喂饱,那么一篇有真实数据、真实评测、可验证事实的文章,反而更容易在噪音里被挑出来——前提是你得写给人看,同时让机器也能读懂你的结构。报告全文和数据(CC BY 4.0)都在 trellner.com,值得自己翻一遍。
© 2026 四月
原文链接:https://www.aprilzz.com/ramble/ai-content-farm-citations
相关文章
AI 编码正在让下一批专家消失:工具要求专家技能,却同时消灭了培养专家的摩擦
AI 编码工具用得好需要专家级的判断力,但持续使用它们又会跳过那些培养判断力的'摩擦'。多项研究指向同一个结论:被 AI 喂大的新手以为自己学得很快,实际学得最差。
AI 唱衰者的预测记录到底准不准?danluu 把最著名的怀疑论者逐条检验了一遍
Ed Zitron 是英文互联网上被引用最多的 AI 怀疑论者之一,反复预言"AI 已见顶""泡沫即将破裂"。danluu 把他 2024-2025 年的预测逐条翻出来对照现实:几乎全错,而且论证方式本身有问题。这篇用数据拆给你看。
前端开发正在被 AI 小行星击中:一位资深浏览器性能专家的悲观观察
Nolan Lawson 撰文指出 AI 正在颠覆前端开发:教育者退场、开发者体验让位于「智能体体验」、标准演进方向被重估。前端知识本身贬值了吗?