文章摘要
Cloudflare观察到网络自动化流量占比攀升,针对网站管理者在搜索引擎爬虫与AI智能体方面的两难困境,推出AI流量控制工具和变现新功能。新工具将爬虫按用途分类,网站管理者可设置访问权限,规则9月15日生效;还推出BotBase数据库辅助控制。变现工具可向指定访问者收费,未正式发布。这将改变网络数据爬取格局,“公平使用”边界待明确。

作为为全球近20%互联网流量提供内容分发网络服务的科技公司,Cloudflare观察到当前网络自动化流量占比正快速攀升,其内部统计显示目前超过57.5%的HTTP请求都来自自动化系统而非人类用户。不少网站管理者正陷入两难境地:一方面需要依赖搜索引擎爬虫获取自然流量,另一方面已有不少站长选择退出谷歌搜索,原因正是不希望自己的内容被AI智能体绕过广告,或是被用于训练AI模型。针对这一行业痛点,Cloudflare推出了全新的AI流量控制工具,同时上线了一项面向网站的变现新功能。

精细化的爬虫访问控制

Cloudflare的这套新功能将自动化爬虫按用途分为三类:为搜索引擎建立内容索引的搜索爬虫、用于收集AI训练数据的训练机器人,以及代表用户执行任务的AI智能体。网站管理者可以针对每一类爬虫单独设置访问权限,共有三个可选方案:完全阻止该类爬虫访问、仅阻止其访问包含广告的页面,或是开放全部权限。

该套控制规则将于9月15日正式生效,默认情况下,包含广告的页面会自动拦截训练爬虫和AI智能体,同时也会限制那些兼具搜索索引和数据收集功能的多用途爬虫——比如来自谷歌、苹果和必应的官方爬虫,但会保留对专用搜索爬虫的访问权限。如果管理者选择阻止训练爬虫,那么所有涉及数据收集的爬虫都将被拦截,包括原本用于搜索的多用途爬虫。

同时Cloudflare还推出了BotBase数据库,这是一个公开的已知机器人和智能体信息库,可以根据行为特征对自动化访问进行分类追踪。带有Cloudflare Verified(已验证)标签的机器人,意味着其运营方已经完成身份验证,严格遵守robots.txt指令,不会尝试绕过网站设置的访问限制。借助这套系统,管理者甚至可以实现更细粒度的控制,比如只拦截某一家公司的特定类型爬虫,而允许其他厂商的机器人正常访问。

面向AI智能体的收费变现工具

除了流量控制功能,Cloudflare还推出了一项全新的变现工具,允许网站管理者向指定访问者——包括人类用户和AI智能体——收取访问网页、数据集、API或Model Context Protocol(MCP)资源的费用。当AI智能体请求访问受保护的资源时,Cloudflare会在转发请求前完成付款验证,在网络层直接完成收费流程。目前该工具尚未正式发布,有需求的客户可以加入等待名单申请试用。

对行业格局的影响

这项新功能的推出,将直接改变当前的网络数据爬取格局。对于那些已经将搜索爬虫和训练爬虫分开运营的AI公司(比如OpenAI)来说,他们可以继续通过合规的方式获取训练数据,同时不会影响搜索相关的流量。但对于谷歌、苹果、微软这类同时运营多用途爬虫的企业来说,这套默认规则会对他们的数据收集行为造成一定限制。

当前获取高质量的公开网络数据仍是AI模型开发的核心需求,但站长和服务提供商对数据访问的限制正在不断增加,由此产生的技术和经济成本,对中小规模的AI开发者影响尤为明显。这类开发者往往缺乏与网站管理者达成合作协议的资源,也更难获取大型科技公司已经整合到自有数据集中的网络知识。

关于公平使用的争议

Cloudflare希望通过这套工具,在AI公司和网站管理者之间建立新的利益平衡,自己则扮演网络访问收费关卡的角色。但这一模式直接触碰了当前AI行业的一项核心原则:许多AI公司认为,利用公开网络数据进行模型训练属于合理使用范畴。Cloudflare是否拥有足够的行业影响力来推行这套收费机制,最终是由Cloudflare还是AI行业来定义“公平使用”的边界,目前仍有待观察。

以上内容不代表本平台立场,仅供读者参考