論文の概要: Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off
- arxiv url: http://arxiv.org/abs/2607.05217v1
- Date: Mon, 06 Jul 2026 15:32:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.210392
- Title: Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off
- Title(参考訳): 公開AI情報サービスにおけるオープンウェブ検索とキュレートされた検索:カバレッジトラストのトレードオフ
- Abstract要約: Evrpuvefurはアイスランド大学が運営し、欧州連合(EU)に関する質問に答えるサービスである。
5つのドメインの専門家が、AI生成の回答449の51評価を作成した。
レビューされたウェブ検索回答の3分の1以上(35%、187件中65件)で、少なくとも1つの引用されたソースがフラグ付けされ、ほぼ常に信頼できないか無関係である。
我々は、情報源の信頼性は公的なAIサービスにおける情報品質の計測可能ながらほとんど見えない次元であると主張している。
- 参考スコア(独自算出の注目度): 2.0182585935522845
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Public institutions increasingly use large language models (LLMs) to answer citizens' questions, often pairing a curated knowledge base with live web search, yet whether the sources behind these answers can be trusted has received little empirical scrutiny. We report a pre-launch expert evaluation of Evrópuvefur, an independent, government-funded service run by the University of Iceland that answers questions about the European Union, conducted as Iceland prepared for its referendum of 29 August 2026 on whether to resume EU accession talks. Five domain experts produced 551 evaluations of 449 AI-generated answers, scoring each against a seven-criterion quality rubric and, separately, flagging individual cited sources. We compared two retrieval paths: a curated local corpus (RAG) and open web search. In more than a third of the reviewed web-search answers (35%, 65 of 187), at least one cited source was flagged, almost always as untrustworthy or irrelevant; curated sources were flagged far less often and only for being out of date. Web search answered more questions, but at the cost of source quality; the curated corpus was trustworthy yet limited in coverage, and the model declined to respond when it fell short. The citation mix also passed over strong sources: across all 287 web-search answers, the system never cited RÚV, the public broadcaster and the country's most widely used news source. A companion prompt ablation shows how weak prompt-level steering is: a trusted-domain list in the system prompt raised the share of citations to listed domains only from 12% to 21%. Fluency and topical fit did not predict source trustworthiness. We argue that source trustworthiness is a measurable yet largely invisible dimension of information quality in public AI services, and we discuss transparency-oriented responses and their trade-offs.
- Abstract(参考訳): 公共機関は、市民の質問に答えるために大規模言語モデル(LLM)をますます利用し、しばしば、キュレートされた知識ベースとライブウェブ検索を組み合わせている。
我々は、アイスランドが2026年8月29日の国民投票に備えて実施した、欧州連合に関する質問に答える、アイスランド大学が運営する独立した政府支援サービスであるEvrópuvefurの、開始前の専門家評価を報告する。
5つのドメインの専門家が、AI生成の回答449の51評価を作成した。
ローカルコーパス(RAG)とオープンウェブ検索の2つの検索パスを比較した。
レビューされたウェブ検索回答の3分の1以上(35%、187件中65件)で、少なくとも1つの引用されたソースがフラグ付けされ、ほぼ常に信頼できないか無関係である。
Web検索はもっと多くの質問に答えたが、ソースの品質の犠牲で、キュレートされたコーパスは信頼できるが、カバー範囲は限られていた。
引用は287件のウェブ検索の回答の全てに及んだが、このシステムは一般の放送局、そして国内で最も広く使われているニュースソースを決して引用しなかった。
システム内の信頼できるドメインリストは、リストされたドメインへの引用のシェアをわずか12%から21%に引き上げる。
頻度とトピックの適合性は、ソースの信頼性を予測しなかった。
我々は、情報源の信頼性は公的なAIサービスにおける情報品質の計測可能かつほとんど見えない次元であり、透明性指向の応答とそのトレードオフについて議論する。
関連論文リスト
- Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries [0.93058777168429]
1,140の応答と1,713のユニークなドメインで15,942の励起を記録しました。
最も暗唱された10のドメインは43.6%のイングランドの引用であった。
プラットフォームは典型的な引用量ではほとんど異なりませんでしたが、一貫性と、彼らが好んだソースタイプは著しく異なりました。
論文 参考訳(メタデータ) (2026-08-31T20:09:28Z) - MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents [76.60965179634664]
ディープリサーチエージェントは、プライベートなローカルドキュメントをWeb検索のような外部ツールと組み合わせて、プライバシーリスクを生じさせている。
プライベートなエンタープライズドキュメントとパブリックなWebコーパスをチェーンする1,001のディープリサーチタスクのベンチマークであるMosaicLeaksを紹介します。
私たちは、家族やサイズにわたるモデルが3つのレベルすべてに頻繁にリークしていることに気付きました。
論文 参考訳(メタデータ) (2026-05-29T01:44:35Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact [10.145178533574695]
Google AI Overviews(AIOs)は間違いなく、生成AIの最も広く普及しているデプロイメントであり、AIが生成した回答に気づかない20億人のユーザにリーチしている。
2026年3月13日から4月21日にかけて,40日間の窓越しに,19の話題カテゴリーに55,393のトレンドクエリを発行した。
まず、AIOアクティベーションは13.7%、質問形式のクエリでは64.7%、政治的に敏感なトピックは著しく低い。
論文 参考訳(メタデータ) (2026-05-13T18:34:39Z) - Answer Bubbles: Information Exposure in AI-Mediated Search [14.377773240202849]
バニラGPT,検索GPT,Google AI概要,従来のGoogle検索という,4つのシステムにわたる11,000のリアルタイム検索クエリに対する応答について検討する。
生成検索システムは,その引用に有意なテキストソース選択バイアスを示すことがわかった。
論文 参考訳(メタデータ) (2026-03-17T05:41:39Z) - Assessing Web Search Credibility and Response Groundedness in Chat Assistants [4.0127354590894955]
本稿では,アシスタントのWeb検索行動を評価するための新しい手法を提案する。
GPT-4o, GPT-5, Perplexity, Qwen Chatの5項目を100件のクレームで評価した。
論文 参考訳(メタデータ) (2025-10-15T16:55:47Z) - DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence [50.97612134791782]
生成検索エンジンと深層研究のLLMエージェントは、信頼できるソース・グラウンドの合成を約束するが、ユーザーは常に過剰な自信、弱いソーシング、紛らわしい引用の慣行に遭遇する。
DeepTRACEは、社会技術的に基礎をおく新しい監査フレームワークで、コミュニティが特定した失敗事例を、回答テキスト、情報源、引用にまたがる8つの測定可能な次元に変換する。
論文 参考訳(メタデータ) (2025-09-02T00:32:38Z) - News Source Citing Patterns in AI Search Systems [6.976269683687743]
我々は,AI検索システムを対象としたヘッド・ツー・ヘッド評価プラットフォームであるAI Search Arenaのデータを分析した。
データセットは、OpenAI、Perplexity、Googleの3大プロバイダにわたるモデルから24,000以上の会話と65,000のレスポンスで構成されている。
異なる提供者によるモデルは、異なるニュースソースを引用する一方で、引用行動における共有パターンを示す。
論文 参考訳(メタデータ) (2025-07-07T02:17:57Z) - Tracking the Newsworthiness of Public Documents [107.12303391111014]
この研究は、サンフランシスコ・クロニクル(San Francisco Chronicle)によるサンフランシスコ・ベイエリアにおける地方公共政策のニュース報道に焦点を当てている。
まず、新聞記事、公共政策文書、会議記録を収集し、確率的関係モデルを用いてそれらをリンクする。
第二に、ポリシー項目がカバーされるかどうかを予測するために、ニューズサステイネス予測という新しいタスクを定義します。
論文 参考訳(メタデータ) (2023-11-16T10:05:26Z) - ExpertQA: Expert-Curated Questions and Attributed Answers [51.68314045809179]
我々は,様々な属性と事実の軸に沿って,いくつかの代表システムからの応答を人為的に評価する。
我々は32分野にわたる484人の被験者から専門家による質問を収集し、同じ専門家に自身の質問に対する反応を評価する。
分析の結果は,32分野にまたがる2177の質問と,回答の検証とクレームの属性を備えた高品質な長文QAデータセットであるExpertQAである。
論文 参考訳(メタデータ) (2023-09-14T16:54:34Z) - Evaluating Verifiability in Generative Search Engines [70.59477647085387]
生成検索エンジンは、インラインの引用とともに、ユーザークエリへの応答を直接生成する。
我々は,一般的な4つの生成検索エンジンの評価を行う。
既存の生成検索エンジンからの応答は流動的であり、情報的に見えるが、しばしばサポートされていない文や不正確な引用を含んでいる。
論文 参考訳(メタデータ) (2023-04-19T17:56:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。