論文の概要: The Vocabulary Gap Is an Equity Gap: Register Mismatch in Retrieval Systems for Public-Benefits Access
- arxiv url: http://arxiv.org/abs/2609.01645v1
- Date: Fri, 28 Aug 2026 21:56:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.583886
- Title: The Vocabulary Gap Is an Equity Gap: Register Mismatch in Retrieval Systems for Public-Benefits Access
- Title(参考訳): Vocabulary Gapはequity Gap: パブリック・ベネフィット・アクセスのための検索システムにおけるレジスタミスマッチ
- Authors: Krish Sapru,
- Abstract要約: レジスタミスマッチは、高性能な検索システムを不平等なものにすることができることを示す。
我々は、51の公文書化された連邦給付適格規則と25の情報要求の制御されたベンチマークを構築した。
故意にシンプルで監査可能なプレーン・ツー・フォーマル・レキシコン・ブリッジは、失敗の多くを回復する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented question answering is increasingly used to help people navigate public-benefits eligibility, yet the documents these systems retrieve from are written in agency register while intended users often ask questions in plain, informal, or non-native English. We show that this register mismatch can turn a high-performing retrieval system into an inequitable one. We construct a controlled benchmark of 51 publicly documented federal benefit-eligibility rules and 25 information needs, each phrased in both agency register and plain user register while keeping the gold passage fixed. Across BM25, TF-IDF, and a term-graph retriever, formal-register evaluation is nearly perfect (Recall@5 96-100%), but plain-register retrieval collapses (Recall@5 36-44%). For BM25, Recall@1 falls from 84% to 16% and Recall@5 from 100% to 44%, a 56-point equity gap on identical information needs. We trace the mechanism to a measurable vocabulary gap: formal queries share 0.63 of their content terms with the gold passage, while plain queries share only 0.11, a 5.9x reduction. A deliberately simple, auditable plain-to-formal lexicon bridge recovers much of the failure, lifting plain-query BM25 Recall@5 from 44% to 80%. The contribution is not a new retriever; it is an evaluation protocol, benchmark, mechanistic diagnosis, and transparent mitigation for a high-stakes social-impact failure mode that standard retrieval evaluation hides.
- Abstract(参考訳): Retrieval-augmented question answeringは、公益の適格性をナビゲートするのに役立つが、これらのシステムが取得した文書は代理店の登録簿に書かれており、意図されたユーザは、通常、非公式、あるいは非ネイティブの英語で質問することが多い。
このレジスタミスマッチは、高性能な検索システムを不平等なものにすることができることを示す。
我々は、51の公文書化された連邦給付適格規則と25の情報要件の制御されたベンチマークを構築し、それぞれが金の通路を固定しつつ、各機関登録簿と平易なユーザ登録簿に記述されている。
BM25、TF-IDF、および項グラフ検索器を通じて、正式な登録者評価はほぼ完璧である(Recall@5 96-100%)が、プレーン登録者検索は崩壊する(Recall@5 36-44%)。
BM25の場合、Recall@1は84%から16%に、Recall@5は100%から44%に低下する。
フォーマルなクエリはゴールドパスとコンテント用語の0.63を共有し、プレーンなクエリは0.11と5.9倍しか共有していない。
故意にシンプルで監査可能なプレーン・ツー・フォーマル・レキシコン・ブリッジは、ほとんどの障害を回復し、プレーン・クエリのBM25 Recall@5を44%から80%に引き上げる。
コントリビューションは、評価プロトコル、ベンチマーク、機械的診断、および標準的な評価評価が隠蔽する高い社会的インパクト障害モードに対する透過的な緩和である。
関連論文リスト
- HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries [1.5965246343492343]
HIRAは、トレーニング不要でオンプレミスの検索拡張された、規制されたデプロイメントにおけるドキュメント分類のためのカスケードである。
信頼された文書は、検索によって直接分類され、不確実または視覚的に不確実な文書は、ローカルにホストされた検証者に渡される。
プライベートな80クラスのトレーディングファイナンスコーパスでは、HIRAが30,233のドキュメント生成ストリームを処理し、わずか1,945のドキュメントに対して人間の修正を要求する。
論文 参考訳(メタデータ) (2026-08-22T06:19:19Z) - Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling [8.467936416935986]
Admitorは、校正された外部行動証拠に基づいて構築された入場ゲートである。
これは、明確に校正された偽発見ターゲットを中心に設計された最初のラベルなし入場機構である。
論文 参考訳(メタデータ) (2026-08-16T06:18:54Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers [77.95933562142014]
ITPEvalは、4つの主要なIPP間で自動形式証明翻訳を評価するための最初のベンチマークである。
itpevalは、状態が分離されたウォームバックエンドを備えた、統合されたマルチITP認証インフラストラクチャです。
論文 参考訳(メタデータ) (2026-07-07T22:05:55Z) - Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning [16.398764816978584]
リーンは、自然言語の数学的答えを判断するのにますます使われていますが、その信号は部分的です。
このシグナルは (i) 急激なカバレッジ依存であり, 証明に勝つ答えは高いカバレッジでは96%の確率で正しいが, 20%は低い。
7Bオートフォーマライザはわずか28%の問題でクラスを証明し、マニュアル監査ではその約43%が忠実であることがわかった。
受理された回答や棄権に縛られた有限サンプル選択リスクを認証する,リーントレース診断のためのセレクタであるCOVCALを提案する。
論文 参考訳(メタデータ) (2026-05-27T11:59:28Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。