Files
llm-wiki/concepts/ai-crawler-governance.md
T
2026-07-03 00:38:05 +09:00

5.8 KiB

title, created, updated, type, tags, sources, confidence
title created updated type tags sources confidence
AI Crawler Governance 2026-07-01 2026-07-02 concept
agent
automation
information-integrity
media
public-interest
raw/articles/cloudflare-ai-traffic-options-2026.md
raw/articles/cloudflare-content-independence-day-ai-options-2026.md
raw/articles/hakuhodo-human-verified-ad-2026.md
raw/articles/cloudflare-content-independence-day-2025.md
raw/articles/cloudflare-monetization-gateway-x402-2026.md
medium

AI Crawler Governance

AI crawler governance は、検索、AI agent、model training crawler などの自動アクセスを、サイト運営者・読者・広告・AI 事業者の利害に合わせて分類し制御する設計領域。Cloudflare の 2026-07-01 changelog は、AI traffic を Search、Agent、Training の 3 種類へ分け、顧客がそれぞれ allow / block / 広告表示ページだけ block を選べるようにした。

この分類は、従来の bot 対策より細かい。Search は質問回答や検索で後から referral や補償が期待される crawling、Agent は chat fetch bot や browser-use agent のように人の代理でリアルタイムに動く activity、Training は model の training / fine-tuning のために content を持ち帰る activity とされる。Cloudflare は 2026-09-15 から新規 domain では Training と Agent を広告表示ページ上で既定 block、Search は allow にする予定だとしている。^[raw/articles/cloudflare-ai-traffic-options-2026.md]

Cloudflare の同日 blog は、単に「AI bot」を定義するのではなく、サイト上で何をしているか、何を保存するか、どう再共有するかで分類する姿勢を明確にした。特に、多目的 crawler は Search / Agent / Training を一つの user-agent に混ぜるのではなく目的別に分けるべきだとし、site owner が用途ごとに許可・拒否・広告付きページのみ拒否を選べる状態を透明性の条件としている。これは ai-agent-identity-security の認可・監査だけでなく、agentic-web-monetization のような支払い付き access policy の前提にもなる。^[raw/articles/cloudflare-content-independence-day-ai-options-2026.md]

なぜ重要か

この論点は information-integrity の「情報基盤の責任」を、AI 時代の web access policy へ移したものとして読める。記事を読む bot がすべて同じではないなら、robots.txt 的な単純な allow/deny だけでは、検索流入を残しつつ training だけ拒否する、あるいは人の代理 agent は許すが広告収益を奪う crawling は止める、といった判断ができない。

また、human-verified-advertising と同じく、非人間トラフィックが広告やメディアの収益モデルをどう壊すかという問題でもある。広告付きページ上で Agent / Training を既定 block する設計は、AI crawler が content だけでなく広告露出・読者接触・効果測定の前提を迂回しうることを認めている。

Cloudflare の “Content Independence Day” 投稿は、この制御を単なる bot 管理ではなく web の経済モデル再設計として位置づける。旧来の検索は「content をコピーする代わりに traffic を返す」取引だったが、AI answer / AI Overview では derivative answer が消費され、元サイトへの流入が大きく減る。Cloudflare は 2025-07-01 に AI crawler を既定で block し、支払いなしの crawl を拒む方向を示し、将来的には traffic ではなく「AI engine の知識の穴をどれだけ埋めるか」で content value を測る marketplace を構想している。これは Search / Agent / Training の分類に、補償・価値測定・publisher bargaining power の層を足す。^[raw/articles/cloudflare-content-independence-day-2025.md]

2026-07-01 の Cloudflare Monetization Gateway 発表は、この流れを agentic-web-monetization としてさらに広げる。Pay Per Crawl が crawler に content への支払いを求める段階だったのに対し、Monetization Gateway は API、dataset、MCP tool call など任意の resource に x402 payment rule を置き、agentic buyer が request ごとに支払う構想である。つまり crawler governance は allow/block の policy だけでなく、価格、payment proof、identity、origin protection を含む access economy の設計へ進んでいる。^[raw/articles/cloudflare-monetization-gateway-x402-2026.md]

見るべき軸

  • 分類の説明可能性: crawler が Search / Agent / Training のどれに分類されたかを、サイト運営者が後から理解できる必要がある。
  • 補償と referral: Search は許す、Training は拒否するという区別は、content が reader/revenue を返すかどうかを中心にしている。
  • 人の代理性: Agent traffic は bot だが、背後に人間の意図がある場合がある。ここは ai-agent-identity-security の「誰の権限で行動しているか」と接続する。
  • 既定値の政治性: Cloudflare のような edge provider が新規 domain の default を決めると、個々の publisher だけでなく web 全体の AI access norm を形作る。

Open questions

  • AI crawler の self-identification が信頼できないとき、分類は header、IP reputation、behavior、契約のどれに依存するべきか。
  • 個人サイトや OSS docs は、AI agent に読ませたい場合と training を拒否したい場合をどう分けるべきか。
  • Search / Agent / Training の区別は、llm-wiki-pattern のような source ingestion とどう折り合うか。個人の知識管理のための読み取りと、大規模 training の収集は同じ「AI が読む」ではない。