一个读者对应5万次抓取,AI机器人抽干媒体内容
Cloudflare的数据显示,某些AI机器人抓取页面的次数可达真实读者访问量的5万倍。与此同时,59%的德国人已经在使用AI工具,但81%的人要求对训练数据作出标注。

论点:“抓取量与访问量之比”已经不再是交换,而变成了对内容经济的剥夺。没有授权,信息质量就会变成谁也不愿承担的成本。
Cloudflare在2026年7月1日发布了《Attribution Business Insights》报告。报告把机器人抓取页面的次数与真实读者访问量放在一起比较,得出的比值从118:1一直到接近50000:1。也就是说,在最极端的情况下,每一个真正打开网页的人,对应着自动化程序近5万次的抓取。Cloudflare把流量分为训练、搜索和智能体三类,只有第二类能给出版方带来收益。
市场开始作出反应,因为自愿的时代已经结束。Cloudflare针对同时承担多种功能的“混合型”机器人制定了规则:从9月15日起,这类机器人在带广告的页面上默认放行搜索流量,但阻止训练和智能体操作。这被称为免费搭车的终结。授权协议也在陆续签署。Netflix与Penske Media达成协议,后者是《Variety》和《Rolling Stone》的出版方。大型玩家宁愿为内容付费,也不愿等待监管。
用户这一端的期待很明确,ARD/ZDF Medienstudie 2026的调查给出了具体数字。14岁以上的德国人中,有59%偶尔使用AI工具,37%每周使用,而一年前这个比例是22%。在14至29岁的最年轻群体中,使用比例达到92%,在70岁以上的最年长群体中为15%。与此同时,54%的人对模型给出的结果持怀疑态度,会检查其中的错误,81%的人认为透明标注训练数据和来源很重要。受众并不想要免费的魔法,他们想知道答案来自哪里。
这种组合中隐藏着严重的利益冲突。那些要求标注的用户,使用的正是未经授权、未付报酬就抓取内容的工具。原本靠广告资助新闻业的出版方正在失去收入,同时又在提供素材,让那些取代它们成为信息获取中介的模型得以建立。这里没有对称性:信息经纪人并不承担生产信息的成本,却从中获利。
解决办法不是关闭访问,而是定价。有三个要素必不可少:机器人及其功能的公开登记,同样面向小型出版方的标准化授权机制,以及在模型回答中透明标明来源。没有第一项,我们不知道是谁在抓取;没有第二项,只有最大的编辑部才能拿到协议;没有第三项,读者无法区分综合结论与事实。Cloudflare已经证明数据是存在的。现在需要把这些数据变成协议的基础,而不是抱怨的理由。
资料来源
3- 01Cloudflare exposes AI crawlers hitting sites 50,000 times per visitorEN
- 02Declared good bots, mixed-use crawlers, gray scrapers: how AI accesses publisher contentEN
- 03ARD/ZDF-Medienstudie 2026: So nutzen die Deutschen KIDE
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。