論文の概要: Do Generative AI Assistants Respect robots.txt? Tracing Web Access Beyond Visible Answers
- arxiv url: http://arxiv.org/abs/2607.14447v2
- Date: Sun, 19 Jul 2026 00:51:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.602487
- Title: Do Generative AI Assistants Respect robots.txt? Tracing Web Access Beyond Visible Answers
- Title(参考訳): ジェネレーティブAIアシスタントはロボット.txtを尊重するのか?
- Authors: Gabriel Lopez-Fonseca, David Rodriguez, Stefan Bechtold, Jose M. Del Alamo,
- Abstract要約: AIアシスタントは、新たな回答を提供するために、推論時にWebコンテンツを検索するようになっている。
これらの検索強化機能は、ロボット$.$txtで表現されるウェブサイト所有者の制限を尊重するかどうかは不明だ。
広告付きWeb検索機能を備えたAIアシスタント10種について,実証実験を行った。
- 参考スコア(独自算出の注目度): 0.3499870393443268
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: AI assistants increasingly retrieve web content at inference time to provide fresh and grounded answers, yet it remains unclear whether these search-augmented capabilities respect website-owner restrictions expressed through robots$.$txt. We present a controlled empirical study of ten widely used AI assistants with advertised web-search capabilities. For each assistant, we first identify a configuration that actually produces observable web-browsing behavior and record the user-agent exposed during retrieval. We then evaluate compliance with controlled robots$.$txt rules across four complementary conditions: allowed for all user-agents, disallowed for all user-agents, allowed only for the assistant-specific user-agent, and disallowed only for that user-agent. Using server-side logs and secret codes embedded in target pages, we distinguish actual page access from user-visible answer correctness across 200 trials. Our results show substantial variation across assistants. Some systems followed the expected allowed/disallowed access pattern, whereas others accessed restricted resources without requesting robots$.$txt or used generic user-agents that complicated attribution. We also find that retrieval behavior and answer correctness can diverge: assistants may access pages without surfacing the retrieved content, or fail to access even allowed resources. These findings raise broader legal and governance concerns about whether AI-assisted web access adequately respects content owners' rights and restrictions. Furthermore, our observations provide valuable insight into the growing erosion of traditional web governance protocols, highlighting the urgent need for updated, enforceable standards that guarantee publisher autonomy in the age of search-augmented AI assistants.
- Abstract(参考訳): AIアシスタントは、新鮮で根拠のある回答を提供するために、推論時にWebコンテンツを検索する傾向にあるが、これらの検索強化機能は、ロボットによって表現されるウェブサイト所有者の制限を尊重するかどうかは不明だ。
txt
広告付きWeb検索機能を備えたAIアシスタント10種について,実証実験を行った。
各アシスタントに対して、まず、観測可能なWebブラウジング動作を実際に生成する構成を特定し、検索中に露出したユーザエージェントを記録する。
次に、制御されたロボットによるコンプライアンスを$で評価する。
すべてのユーザエージェントを許可し、すべてのユーザエージェントを許可し、アシスタント固有のユーザエージェントのみを許可し、そのユーザエージェントのみを許可する。
ターゲットページに埋め込まれたサーバ側のログとシークレットコードを用いて、200のトライアルにおいて、実際のページアクセスとユーザ可視の回答の正しさを区別する。
以上の結果から, アシスタント間ではかなりの変動がみられた。
一部のシステムは、期待されたアクセスパターン/許可されていないアクセスパターンに従っているが、他のシステムは、ロボットを要求せずに制限されたリソースにアクセスしている。
あるいは、複雑な属性を持つジェネリックユーザエージェントを使用する。
また、検索行動や回答の正当性もばらばらになり、アシスタントは検索したコンテンツを見逃さずにページにアクセスしたり、許可されたリソースにさえアクセスできなくなる。
これらの調査結果は、AI支援Webアクセスがコンテンツ所有者の権利と制限を適切に尊重するかどうかに関する、より広範な法的およびガバナンス上の懸念を提起する。
さらに、我々の観察は、従来のWebガバナンスプロトコルの侵食の増加に関する貴重な洞察を提供し、検索強化されたAIアシスタントの時代におけるパブリッシャーの自律性を保証する、更新され強制可能な標準の必要性を強調しています。
関連論文リスト
- Developer Experience with AI Coding Agents: HTTP Behavioral Signatures in Documentation Portals [0.0]
AIコーディングエージェントとAIアシスタントWebサービスの急速な採用は、開発者が技術ドキュメントを発見し、消費し、操作する方法を根本的に変えている。
本稿では,文書のアクセシビリティ,コンテンツ分析,フィードバックシステムという3つの相互接続領域の変換について検討する。
我々は、9つのAIコーディングエージェント(Aider、Antigravity、Claude Code、Cline、Cursor、Junie、OpenCode、VS Code、Windsurf)と6つのAIアシスタントサービス(ChatGPT、Claude、Google Gemini、Google NotebookLM、MistralAI、Perplexity)から、ライブ開発者ドキュメントエンドポイントにアクセスするHTTPリクエスト指紋に関する実証的研究を提示する。
論文 参考訳(メタデータ) (2026-04-02T21:54:07Z) - Nested Browser-Use Learning for Agentic Information Seeking [60.775556172513014]
情報検索(IS)エージェントは広範囲にわたる検索タスクで高いパフォーマンスを達成しているが、ツールの使用はAPIレベルのスニペット検索やURLベースのページフェッチに限られている。
我々はNested Browser-Use Learning (NestBrowse)を提案する。NestBrowseは、ネストされた構造を通してページ探索からインタラクション制御を分離する最小かつ完全なブラウザアクションフレームワークである。
論文 参考訳(メタデータ) (2025-12-29T17:59:14Z) - Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web [2.370481325034444]
評価可能なニュースサイトと誤報サイトがロボット.txtファイルの設定方法に異なるかどうかを検討する。
回答可能なサイトの60.0%は、ロボット.txtファイル内の偽情報サイトの9.1%に対して、少なくとも1つのAIクローラを禁止している。
我々の研究は、大規模言語モデルで利用可能なトレーニングデータを形成することができるコンテンツアクセシビリティの非対称性の増大に注目した。
論文 参考訳(メタデータ) (2025-10-11T18:47:14Z) - AccessGuru: Leveraging LLMs to Detect and Correct Web Accessibility Violations in HTML Code [11.11923891120399]
本稿では,Webアクセシビリティ違反をSyntactic,Semantic,Layoutの3つの重要なカテゴリに分類する新しい分類法を提案する。
本稿では,既存のアクセシビリティテストツールとLarge Language Models(LLM)を組み合わせた新しい手法であるAccessGuruを提案する。
本ベンチマークでは,構文およびレイアウトのコンプライアンスを定量化し,人間の専門家による補正との比較分析により意味的精度を判定する。
論文 参考訳(メタデータ) (2025-07-24T17:59:30Z) - AgentDAM: Privacy Leakage Evaluation for Autonomous Web Agents [66.29263282311258]
我々は、AIウェブナビゲーションエージェントがデータ最小化のプライバシー原則に従うかどうかを測定する新しいベンチマークAgentDAMを紹介する。
我々のベンチマークは、現実的なWebインタラクションシナリオをエンドツーエンドでシミュレートし、既存のWebナビゲーションエージェントに適応する。
論文 参考訳(メタデータ) (2025-03-12T19:30:31Z) - Consent in Crisis: The Rapid Decline of the AI Data Commons [74.68176012363253]
汎用人工知能(AI)システムは、大量の公開Webデータに基づいて構築されている。
我々は,AIトレーニングコーパスに基づくWebドメインに対する同意プロトコルの大規模かつ長期的監査を行う。
論文 参考訳(メタデータ) (2024-07-20T16:50:18Z) - User Attitudes to Content Moderation in Web Search [49.1574468325115]
我々は、Web検索における誤解を招く可能性のあるコンテンツや攻撃的なコンテンツに適用される様々なモデレーションプラクティスに対するサポートレベルについて検討する。
最も支持されている実践は、誤解を招く可能性のあるコンテンツや不快なコンテンツについてユーザーに知らせることであり、最も支持されていないものは、検索結果を完全に削除することである。
より保守的なユーザーやウェブ検索結果に対する信頼度が低いユーザーは、ウェブ検索におけるコンテンツモデレーションに反する傾向にある。
論文 参考訳(メタデータ) (2023-10-05T10:57:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。