#bot-management

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Rajarshi Chowdhury

该论文针对「AI 爬虫与智能体正在瓦解开放互联网默认契约」这一现实问题,提出了一套面向机器访问的授权与补偿协议。作者首先指出现状:开放网络长期依赖一项未写入合同的默契——网站允许爬虫抓取,搜索引擎以回送访客作为回报。公开测量数据显示这一默契正在失效:自动化客户端已占据多数请求流量;以 Cloudflare 分类口径统计,训练类抓取占比最高;头部 AI 平台每回送一名访客,平均要抓取数千个页面。问题的根源在于,网络通用控制文件 robots.txt 的表达能力严重不足:它无法表达访问者身份、访问目的、使用条款或价格,并且本身可被绕过;而近期出现的一些替代机制多为 CDN 厂商的专有功能,缺乏跨平台互操作性。为此作者设计并规范了 terms.txt:一种仿照 robots.txt 的文件格式,用于按路径、按用途声明机器访问条款;并配套设计了一套由源站强制执行(origin-enforced)的交换流程,其组成包括 Web Bot Auth 签名、签名意图声明(signed intent)、委托令牌(delegation token)、基于 HTTP 402 的协商机制,以及签名收据(signed receipt)。论文进一步明确了该交换机制能够强制执行什么、能够审计什么、以及哪些部分只能留给线下合同与法律途径解决,从而划清了技术手段与法律手段的边界。在工程可行性方面,作者实现了一个无外部依赖的原型,在单 vCPU 上每请求仅增加 0.20 至 0.65 毫秒开销,说明该方案在性能上具备落地可能。该工作属于协议与治理层面的设计研究,适合关注爬虫治理、智能体身份与授权、机器人流量管理、内容补偿机制的研究者、CDN/源站运维与平台政策制定者阅读。

💡 推荐理由: AI 智能体抓取已占多数请求流量,robots.txt 无法表达身份、目的与价格且可被绕过,传统「抓取换流量」默契失效。terms.txt 提供了可互操作、可审计、源站可强制的机器访问条款与付费协商路径,并给出可量化的性能开销,是防御方在机器人治理与授权审计上值得评估的方向。

🎯 建议动作: 研究跟进:由平台工程与安全团队评估 terms.txt 与本组织爬虫治理、Agent 出站访问策略的适配性,并在非生产源站做小规模原型验证

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)