
HN 正在被 AI 淹没吗?安全研究员 lcamtuf 用两个月的数据说:2 月占四成,6 月占六成
知名安全研究员 lcamtuf 抽样统计 Hacker News 每日榜单:AI 相关内容占比从 2 月的 40% 涨到 6 月的 60%,还有相当一部分文章本身就是 AI 写的。他对'AI 检测器'的辩护也值得一读。
原文来源:How much of HN is AI? — 安全研究员 Michal Zalewski 用两次抽样统计量化 Hacker News 上 AI 内容的占比,并辩护 AI 检测器的有效性。
如果你每天刷 Hacker News,大概会有一种模糊的感觉:怎么全是 AI?知名安全研究员 Michal Zalewski(网名 lcamtuf,写过《Silence on the Wire》,做过 Google 零日研究团队负责人)把这种感觉变成了数据。他对 HN 的感情很复杂——"这是极客新闻最重要的聚合器,也是我这个博客的主要流量来源,但评论区的毒性同样稳定供应"。2026 年 2 月和 6 月,他做了两次系统性抽样,回答两个问题:HN 的榜单上有多少 AI 相关内容?又有多少文章本身是 AI 写的?
数据:从 40% 到 60%
2 月的统计方法是把当月每天的前 5 名故事全量采样。结果相当惊人:2 月 4 日和 12 日,前 5 名里有 4 个是 AI;2 月 5 日几乎整榜都是 AI(第 3 名还是某 AI 厂商的"潜艇式营销"贴)。整个 2 月,只有 3 天前 5 名里完全没有 LLM 新闻——2 月 1 日(第一条 AI 在第 7 位)、2 月 9 日(第 8 位)和 2 月 25 日(第 6、9、10 位)。
6 月的统计更细致:纯 AI 内容用纯黑色标记,AI 相关但有更广泛影响的故事(比如 Instagram 的 AI 客服账号被黑)用斜纹标记,只是沾边的(比如内存涨价)不标记。结果:6 月上半月每天榜单约 60% 是 AI 相关或 AI 生成,到月底回落到约 50%,而 2 月只有 40%。
顺带一提,7 月 21 日那天他截图留了个纪念——"AI 单曲榜",整个榜单几乎被 AI 屠榜。他特意说明那是特别糟的一天,但"感觉上每天都差不多"。
—— 广告 ——
有多少文章是 AI 写的?
第二个问题是识别 AI 写作的文章。他用的工具叫 Pangram,一个"异常保守但相当准"的 LLM 文本检测模型。
这里他花了不少篇幅给检测器辩护。技术圈对 AI 检测器普遍嗤之以鼻,但他认为很多反对意见建立在过时的假设上:"要让检测工具生效,AI 写作根本不需要'非人类'。只要当前这批 LLM 的默认声音是准确定性的就够了——同一篇作文让它写两遍,风格上会高度相似。单个习惯可能像人,但你的写作恰好同时命中同一组习惯的概率极低。"
他人工复核了所有被标记的故事,认为结论站得住,"如果有偏差,也是漏报多过误报"。举例:2 月 19 日排名第 3 的《AI 不是同事,是外骨骼》,500+ 赞 500+ 评论,在他看来"红旗拉满"。
这意味着什么
HN 是技术圈的风向标,榜单被 AI 占领这件事本身,比任何一篇 AI 文章都更值得琢磨。
第一,这是激励结构的问题,不是品味的问题。 AI 内容的边际生产成本趋近于零,一篇"AI 行业观察"从选题到成文到润色,全程自动化只需要几分钟。当生产端成本塌陷而分发端(HN 的排名机制)只看热度时,供给爆发是必然结果。这跟 2018 年前后加密货币霸榜 HN 是同一个机制——只是 AI 的内容供给能力比当年的币圈自媒体强了一个数量级。
第二,"AI 相关"和"AI 生成"要分开看。 60% 的占比里,有一部分是真实的行业进展(模型发布、技术突破),另一部分是纯粹的 AI 自嗨(厂商公告、无信息量的观点文)。lcamtuf 的统计把前者算作"相关但有更广泛影响",后者算"纯 AI 自嗨"——这个区分值得每个读者自己心里也有一份。真正该警惕的不是 AI 新闻多,而是信息密度趋零的 AI 新闻多。
第三,检测器的价值被低估了,但局限也真实存在。 lcamtuf 的辩护在逻辑上是成立的:检测不需要抓"非人特征",只需要抓"统计上可识别的风格指纹"。但检测永远是对抗性的——写作风格可以模仿,检测器会误报,真实作者被冤枉的代价远大于 AI 文章被漏掉。检测器适合当"红旗提示"而不是"裁决依据"。
第四,对中文技术社区同样成立。 如果你觉得自己的信息流里 AI 内容的比例也在失控——那不是错觉。而且中文内容生态的 AI 化程度只会更高:低质 AI 内容在搜索和信息流里泛滥,靠的是同一个成本逻辑。对抗手段也相同:追一手来源、看数据而非观点、对"AI 写了什么"保持怀疑,对"人写了什么"保持耐心。
HN 会不会从"AI 含量 60%"回落到正常水平?可能不会。当年的加密货币潮退是因为泡沫破裂,而 AI 是真实的产业趋势——它只是把内容生态的激励机制扭曲放大了。我们能做的,不是拒绝 AI 内容,而是学会快速区分"值得读的 AI 内容"和"AI 写的内容"。这两者的交集,远没有你以为的那么大。
© 2026 四月
原文链接:https://www.aprilzz.com/ramble/how-much-of-hn-is-ai
相关文章
AI 编码正在让下一批专家消失:工具要求专家技能,却同时消灭了培养专家的摩擦
AI 编码工具用得好需要专家级的判断力,但持续使用它们又会跳过那些培养判断力的'摩擦'。多项研究指向同一个结论:被 AI 喂大的新手以为自己学得很快,实际学得最差。
我正在变成 AI 盲:当大脑学会自动忽略 AI 写的文档
一位工程师发现自己读不进去同事发来的文档——因为它们都带着明显的 AI 痕迹。他的大脑被训练成了 AI 内容过滤器:扫一眼就知道是 AI 写的,然后直接忽略。本应提高生产力的 AI,正在以意想不到的方式拖慢协作。
为什么技术社区对 AI 态度如此两极分化?——来自 Hacker News 近千条评论的观察
Hacker News 上一条爆火提问引发了近 640 条讨论:为什么这个以技术闻名的社区对 AI 表现得如此反感?从代码工匠到快速迭代派,谁说得对?