AI 机器人流量负担令维基百科管理者忧心忡忡

1个月前 科技 7观看
摘要 由于人工智能模型训练对在线内容有着无止境的需求,网络爬虫机器人已经成为维基媒体社区无法承受的负担。维基媒体基金会 (负责管理维基百科及类似社区项目) 的代表表示,自 2024 年 1 月以来,用

由于人工智能模型训练对在线内容有着无止境的需求,网络爬虫机器人已经成为维基媒体社区无法承受的负担。2l3喜好网-记录每日喜好的科技时尚娱乐生活

维基媒体基金会 (负责管理维基百科及类似社区项目) 的代表表示,自 2024 年 1 月以来,用于处理多媒体文件请求的带宽使用量增加了 50%。2l3喜好网-记录每日喜好的科技时尚娱乐生活

维基媒体基金会的 Birgit Mueller、Chris Danis 和 Giuseppe Lavagetto 在一份公开帖子中解释道:"这种增长并非来自人类读者,而主要来自自动化程序,这些程序在抓取维基共享资源中的开放许可图片,用于训练 AI 模型。"2l3喜好网-记录每日喜好的科技时尚娱乐生活

"我们的基础设施本是为了应对重大事件期间人类用户造成的突发流量高峰而建立的,但爬虫机器人产生的流量规模前所未有,带来了日益增长的风险和成本。"2l3喜好网-记录每日喜好的科技时尚娱乐生活

据维基媒体人士透露,维基媒体基金会数据中心处理的最耗资源内容中,至少 65% 的流量是由机器人产生的,尽管这些软件代理仅占页面访问量的约 35%。2l3喜好网-记录每日喜好的科技时尚娱乐生活

这是因为维基媒体基金会采用了缓存策略,将热门内容分发到全球各地的区域数据中心以提升性能。机器人访问页面时不考虑内容的热门程度,它们对冷门内容的请求意味着这些内容必须从核心数据中心获取,这会消耗更多计算资源。2l3喜好网-记录每日喜好的科技时尚娱乐生活

正如维基媒体人士通过引用我们最近的相关报告所指出的,在过去一年左右的时间里,行为不当的机器人一直是开源项目计算基础设施运营者的普遍抱怨。2l3喜好网-记录每日喜好的科技时尚娱乐生活

上个月,Git 托管服务 Sourcehut 公开批评了那些为 AI 公司疯狂抓取内容的网络爬虫。Diaspora 开发者 Dennis Schubert、维修网站 iFixit 以及 ReadTheDocs 等也都对激进的 AI 爬虫表示反对。2l3喜好网-记录每日喜好的科技时尚娱乐生活

大多数网站都认识到为机器人查询提供带宽是经营成本的一部分,因为这些脚本化访问通过为搜索引擎建立索引,有助于在线内容更容易被发现。2l3喜好网-记录每日喜好的科技时尚娱乐生活

但自从 ChatGPT 上线和生成式 AI 兴起以来,机器人变得更加肆无忌惮,大量抓取整个网站的内容用于训练 AI 模型。这些模型最终可能成为商业竞争对手,通过收费订阅或免费方式提供它们收集的聚合知识。这两种情况都可能减少对源网站的需求,或减少产生在线广告收入的搜索查询。2l3喜好网-记录每日喜好的科技时尚娱乐生活

维基媒体基金会在其 2025/2026 年度规划文件的"基础设施负责任使用"部分中提出了一个目标:"在请求率方面将爬虫产生的流量减少 20%,在带宽使用方面减少 30%。"2l3喜好网-记录每日喜好的科技时尚娱乐生活

该规划文件指出,虽然维基百科及其多媒体库维基共享资源对训练机器学习模型来说是无价之宝,但"我们必须优先考虑为谁提供这些资源,我们希望优先考虑人类使用,并优先支持维基媒体项目和贡献者使用我们有限的资源。"2l3喜好网-记录每日喜好的科技时尚娱乐生活

除了网站可靠性工程师已经采取的针对性干预措施来封禁最恶劣的机器人外,如何实现这一目标仍有待探索。2l3喜好网-记录每日喜好的科技时尚娱乐生活

由于对 AI 内容滥用性采集的担忧已存在一段时间,已经出现了许多用于阻止激进爬虫的工具。这些包括:数据投毒项目如 Glaze、Nightshade 和 ArtShield;以及基于网络的工具,包括 Kudurru、Nepenthes、AI Labyrinth 和 Anubis。2l3喜好网-记录每日喜好的科技时尚娱乐生活

去年,当网络对 AI 爬虫的不满传到主要的 AI 机器人赞助商 (如 Google、OpenAI 和 Anthropic 等) 耳中时,他们做出了一些努力,通过应用 robots.txt 指令来提供防止 AI 爬虫访问网站的方法。2l3喜好网-记录每日喜好的科技时尚娱乐生活

但这些存储在网站根目录供到访网络爬虫读取的指令并未得到普遍部署或遵守。而且,如果不使用通配符来覆盖所有可能性,这种可选的声明式防御协议也无法跟上仅需更改名称就能躲避封禁列表条目的步伐。网站运营者普遍反映,行为不当的机器人会将自己伪装成 Googlebot 或其他广泛容忍的爬虫,以避免被封禁。2l3喜好网-记录每日喜好的科技时尚娱乐生活

例如,Wikipedia.org 的 robots.txt 文件并没有封禁来自 Google、OpenAI 或 Anthropic 的 AI 爬虫。它封禁了一些因贪婪抓取整个网站而被认为有问题的机器人,但未能包括主要商业 AI 公司的条目。2l3喜好网-记录每日喜好的科技时尚娱乐生活

The Register 已就维基媒体基金会为何没有更全面地禁止 AI 爬虫一事向其询问。2l3喜好网-记录每日喜好的科技时尚娱乐生活

展开全文
猜你感兴趣
研究人员开发自动识别古代楔形文字片的AI软件

研究人员开发自动识别古代楔形文

11月2

11-19 71阅读
曝iPhone 17全系首发3nm A19系列芯片:无缘台积电2nm工艺制程

曝iPhone 17全系首发3nm A19系列

11月19日

11-19 61阅读
焦虑的开发者,涌向“纯血鸿蒙”培训班

焦虑的开发者,涌向“纯血鸿蒙”培

有两

11-19 64阅读
徐工集团CVC基金备案成功

徐工集团CVC基金备案成功

2024

11-19 63阅读
腾讯的AI困局

腾讯的AI困局

文章来源:科技新知图片来源:由无界

11-19 64阅读
为什么说当下是最适合李子柒回归的时候?

为什么说当下是最适合李子

作者 / 向   向运营 / 狮子座携“

11-19 63阅读
《令人心动的offer6》:职综天花板如何让英雄主义落地现实

《令人心动的offer6》:职综

  《令人心动的offer》第六季以豆瓣

11-19 65阅读
长江文化艺术季闭幕式圆满落幕 平安携手金莎合唱《何以家国》

长江文化艺术季闭幕式圆满

  4日晚,长江文化艺术季闭幕式在宜昌

11-19 66阅读
微念称与李子柒的案件已完全和解:账号其本人运营 品牌由微念经营

微念称与李子柒的案件已完

11月13日消息,日

11-19 63阅读
文化输出第一人!网红博主李子柒回归 时隔三年更新视频

文化输出第一人!网红博主李

11月12日消息,今

11-19 61阅读
Steam传播仇恨指控引人质疑:青蛙表情包占一半以上

Steam传播仇恨指控引人质

在海外的许多网友都喜欢用一个名为“P

11-19 66阅读
原神终将结束的花神诞祭全任务攻略一览

原神终将结束的花神诞祭全

终将结束的花神诞祭是原神须弥地区主线

11-19 67阅读
原子之心武器蓝图攻略_全武器蓝图获取方法详细介绍

原子之心武器蓝图攻略_全

原子之心游戏里面玩家可以通过获取武器

11-19 68阅读
饥荒存档在哪个文件夹?饥荒存档位置一览

饥荒存档在哪个文件夹?饥

饥荒存档在哪个文件夹?饥荒游戏里面玩家

11-19 164阅读
饥荒南瓜可以做什么?饥荒超全南瓜食谱分享

饥荒南瓜可以做什么?饥荒

南瓜是饥荒游戏里面的一种蔬菜,玩家可以

11-19 68阅读