論文の概要: CIVI: A Framework for Diagnosing Search Agent Failures in Civic Information
- arxiv url: http://arxiv.org/abs/2609.08094v1
- Date: Tue, 08 Sep 2026 01:09:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.543457
- Title: CIVI: A Framework for Diagnosing Search Agent Failures in Civic Information
- Title(参考訳): CIVI: 市民情報における検索エージェント障害の診断フレームワーク
- Authors: Dingying Liu, Yunshun Zhong, Wentao Zhang, Yiyuan Li,
- Abstract要約: 市民情報における検索エージェントの故障を診断する最初のフレームワークであるCIVIを紹介する。
CIVIは、検索実行率、選択されたno-search精度、エージェントが権威のある政府ソースを引用する頻度を測定する。
ARISEは、観測された全ての失敗の72.1%が、モデルのパラメトリック知識のギャップよりも、検索バウンドな原因によるものである。
- 参考スコア(独自算出の注目度): 7.820984797455053
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models are increasingly deployed in public-sector settings, where incorrect guidance can cause irreversible harm. We introduce CIVI, the first framework for diagnosing search agent failures in civic information. Its benchmark instantiation jointly spans cross-national, interjurisdictional government contexts (federal, state, and local) and functional categories from an internationally adopted United Nations standard. We evaluate ten frontier search agents and find that none matches an attentive human baseline. Alongside accuracy, CIVI measures search invocation rate, selective no-search accuracy, and how often agents cite authoritative government sources. To perform this diagnosis, we introduce ARISE, which decomposes agentic search failures into four mutually exclusive modes, isolated via source-injection ablation. ARISE attributes 72.1% of all observed failures to retrieval-bound causes rather than to gaps in the models' parametric knowledge.
- Abstract(参考訳): 大規模言語モデルは、誤ったガイダンスが不可逆的な害を引き起こす可能性があるパブリックセクター設定にますますデプロイされている。
市民情報における検索エージェントの故障を診断する最初のフレームワークであるCIVIを紹介する。
そのベンチマークのインスタンス化は、国際的に採用されている国連標準の国際的、連邦的、州的、地方的な政府コンテキストと機能的カテゴリを共同で行う。
10個のフロンティアサーチエージェントを評価し、注意深い人間のベースラインに合わないことを発見した。
CIVIは、正確性に加えて、検索の呼び出し率、選択的なno-search精度、そして権威のある政府の情報源を引用するエージェントの頻度を計測する。
この診断を行うために,エージェント検索障害をソースインジェクションアブレーションにより分離した4つの排他的モードに分解するARISEを導入する。
ARISEは、観測された全ての失敗の72.1%が、モデルのパラメトリック知識のギャップよりも、検索バウンドな原因によるものである。
関連論文リスト
- Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents [63.2133766267587]
ディープサーチエージェントは、証拠収集のために検索クエリを反復的に発行することで、難解な情報検索質問に答える。
本研究では,長軸探索エージェントの軌跡レベル診断を用いてこれらの質問について検討する。
我々は,各探索ステップで得られた証拠を評価し,エージェントの行動の2つの段階を分離する。
論文 参考訳(メタデータ) (2026-08-03T08:46:48Z) - HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning [14.484579581234327]
マルチホップ検索における拒絶の最初のベンチマークであるHopRefusalBenchを紹介する。
根、中、終端位相の3つの解答不可能な原因を横切る。
本稿では,目標認識の拒絶,疑似拒絶,幻覚的完了,探索予算の枯渇にまたがる最終アウトカム分類を提案する。
論文 参考訳(メタデータ) (2026-08-02T16:20:55Z) - Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents [4.309840398782996]
階層的推論では、失敗はエージェントが間違ったブランチにコミットする中間的な決定ポイントから生じることが多い。
本稿では,エージェントの行動空間内での明確化をナビゲーションと共有順序尺度で表す定式化であるACTION-Ratingを提案する。
エージェント自身の評価から2つの構造的に異なる情報探索モードが出現する:強制的(実行可能分岐なし)と機会的(主要な候補であるにもかかわらず残留不確実性)。
論文 参考訳(メタデータ) (2026-06-09T18:25:57Z) - To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention [61.82680155643223]
我々は,不整合決定境界の根本原因を同定し,蓄積した情報が回答するのに十分であるかどうかをしきい値に判定する。
これにより、過剰探索(十分な知識にもかかわらず冗長探索)と過度探索(早期終了)が誤った答えをもたらす。
まず,境界誤差を識別する因果的介入に基づく診断手法を提案する。
第2に,Deep Search Agent(DAS)のための決定境界アライメントを開発する。
我々のDAS法はこれらの境界を効果的に校正し、オーバーサーチとアンダーサーチの両方を緩和し、精度と効率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-02-03T09:29:06Z) - AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning [61.974530499621274]
検索への過度な依存は、ノイズや悪意のあるコンテンツに対する不必要なコストとリスクをもたらす。
本稿では,探索を起動するか否かの判断から問題を解き放つ2段階の結果駆動型RLフレームワークを提案する。
AdaSearchは知識境界認識を大幅に改善し、不要な検索コールを削減し、タスクパフォーマンスを強く保ち、透明性と解釈可能な意思決定行動を提供する。
論文 参考訳(メタデータ) (2025-12-18T18:50:01Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Fair Deepfake Detectors Can Generalize [51.21167546843708]
共同設立者(データ分散とモデルキャパシティ)の制御により,公正な介入による一般化が向上することを示す。
この知見を応用して, 逆正当性重み付けとサブグループワイド特徴正規化を併用し, 新たなアライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・インセンティブ・インターベンション・インベンション・インテクション(DAID)を提案する。
DAIDは、いくつかの最先端技術と比較して、公平性と一般化の両方において一貫して優れた性能を達成する
論文 参考訳(メタデータ) (2025-07-03T14:10:02Z) - Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty [21.96443267949563]
エージェント検索型Augmented Generation (RAG) システムは,動的かつ多段階の推論と情報検索を可能にし,Large Language Models (LLM) を強化する。
これらのシステムは、オーバーサーチ(冗長な情報を取得する)やアンダーサーチ(必要な情報を取得するのに失敗する)のような準最適探索行動を示すことが多い。
この研究は、これらの振る舞いを公式に定義し、定量化し、複数のQAデータセットとエージェントRAGシステムにまたがるそれらの頻度を明らかにする。
論文 参考訳(メタデータ) (2025-05-22T20:57:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。