論文の概要: Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
- arxiv url: http://arxiv.org/abs/2609.04579v2
- Date: Mon, 07 Sep 2026 16:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.98354
- Title: Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
- Title(参考訳): 選択されたオブジェクトが読者に届くか? 接地された言語モデルパイプラインにおけるアイデンティティハンドオフの監査
- Authors: Siddharth Vohra, Runmin Jiang, Xiaomo Li, Min Xu,
- Abstract要約: 接地された言語モデルパイプラインは、オブジェクトの選択、パスの取得、そしてそのエビデンスを使って答える3つのステージに分けられる。
我々は3つのセレクタファミリーで600のHybridQA質問を監査する。
- 参考スコア(独自算出の注目度): 6.010966712043181
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Grounded language-model pipelines can be divided into three stages: selecting an object, retrieving passages for it, and using that evidence to answer. If the selected object must reach the reader, losing it breaks the handoff. Benchmark recall checks the dataset-linked object, which can differ. We audit 600 HybridQA questions across three selector families. On 1,463 resolvable records where the selected object matches the dataset-traced passage, exact key lookup and exact title matching return the object every time. With every ranked rule given the same decoded selected title, body-only BM25 omits it on 389 records (26.6%) at cutoff five, while hybrid retrieval with reranking omits it on 14 (1.0%). The two identities differ on 329 of 1,792 resolvable records. With original-question rankings, their top-five checks disagree on 106 records (5.9%). Frozen reader comparisons associate the aligned object's presence with 28.6 to 31.0 points higher exact match. In a deliberately selected 64-item cohort, removing that passage sharply lowers exact match, while removing a similar-length comparison passage does not reproduce the drop. We release the Returned-Object Profile (ROP), an executable record of the target, returned-ID field, cutoff, membership rule, and complete expected population, with data and an offline replay.
- Abstract(参考訳): 接地された言語モデルパイプラインは、オブジェクトの選択、パスの取得、そしてそのエビデンスを使って答える3つのステージに分けられる。
選択したオブジェクトがリーダーに到達しなければならない場合、そのオブジェクトを失うとハンドオフが壊れる。
ベンチマークリコールはデータセットにリンクされたオブジェクトをチェックする。
我々は3つのセレクタファミリーで600のHybridQA質問を監査する。
1,463の解決可能なレコードでは、選択されたオブジェクトがデータセットが処理したパスにマッチし、正確なキールックアップと正確なタイトルマッチングが毎回オブジェクトを返す。
ボディーオンリーのBM25は389レコード(26.6%)をカットオフ5で省略し、ハイブリッド検索では14レコード(1.0%)を省略する。
2つの身元は1,792件の解決可能な記録のうち329件で異なる。
オリジナル・クエストランキングでは、トップ5のチェックは106レコード(5.9%)で一致しない。
凍結した読み手の比較は、一致したオブジェクトの存在を28.6から31.0ポイントの正確な一致で関連付ける。
故意に選択された64イテムコホートにおいて、その経路を除去すると正確な一致が著しく低下する一方、類似した長さの比較通路を除去してもドロップを再生しない。
我々は、ターゲット、返却IDフィールド、カットオフ、メンバーシップルール、および完全な期待された人口をデータとオフラインで再生する実行可能な記録であるReturned-Object Profile (ROP)をリリースする。
関連論文リスト
- From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering [0.0]
公開資料のみから、AIレコードがクレームを表現できるかどうか、宣言された場所を保持できるかどうかを測定する。
188個の二重グレード細胞で、デフォルトレコードが行動システムのコンテンツアイデンティティを出力するプラットフォームは見つからなかった。
計器は、パイプラインが発行した排気のみからの保証深度を計算し、宣言された深さと比較する。
論文 参考訳(メタデータ) (2026-08-21T16:45:00Z) - VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval [65.89247522243959]
VisDocAgentBenchは、静的検索とエージェント検索を比較したクローズドコーパスベンチマークである。
100の文書から2,375ページ、120のユニークなターゲットクエリが直接、一橋、二橋のエビデンス構造でバランスを取っている。
強力な遅延対話型ビジュアルレトリバーは、直接アイテムで97.50%のRecall@1に達するが、2ブリッジアイテムでは2.50%に達し、関連性がコーパスコンテキストに依存する場合のクエリ-ターゲットマッチングの限界を明らかにする。
論文 参考訳(メタデータ) (2026-08-18T15:23:06Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Schema-First Retrieval: Embedding Catalogs for Natural Language Analytics [0.10210859604701106]
現代の倉庫には、数千のテーブル、短縮された列、非公式なメトリクス、隠れた結合規約、および生のテーブル名によってキャプチャされない許可境界が含まれている。
倉庫の行ではなくカタログメタデータを埋め込んだ検索層であるEnterprise-First Retrievalを紹介します。
このシステムは、オブジェクト固有のテキストテンプレートを使用して、5つの型付きカタログオブジェクト、テーブル、列、メトリクス、リレーションシップ、クエリ履歴をインデックスする。
論文 参考訳(メタデータ) (2026-06-23T02:20:36Z) - Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations [2.6382975801439836]
セグメントは最小限のキーワードのブックマークに置き換えられ、モデルはオンデマンドで全コンテンツを取得するリコール()ツールが与えられる。
LoCoMoベンチマークでは、コラボレーティブページングは、トランケーション、BM25、ワードオーバーラップ検索、検索ツールベースライン、フルコンテキストの6つのメソッドの中で、最も高い回答品質を達成する。
次に、境界戦略と消去政策(3,176個の合成プローブ、1,600個のLoCoMoプローブ)に対する5×4のアブレーションでページング設計空間を研究する。
論文 参考訳(メタデータ) (2026-04-14T07:06:35Z) - WeDetect: Fast Open-Vocabulary Object Detection as Retrieval [74.39703419628829]
Open-vocabularyオブジェクト検出は、テキストプロンプトを通じて任意のクラスを検出することを目的としている。
クロスモーダル融合層(ノンフュージョン)を持たない手法は、認識を検索問題として扱うことにより、より高速な推論を提供する。
WeDetectという名前のモデルファミリを開発し、推論効率の高い15ベンチマークで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-13T12:40:28Z) - ByteTrack: Multi-Object Tracking by Associating Every Detection Box [51.93588012109943]
マルチオブジェクトトラッキング(MOT)は、ビデオ内のオブジェクトのバウンディングボックスとIDを推定することを目的としている。
ほとんどの方法は、スコアがしきい値よりも高い検出ボックスを連想させることでアイデンティティを得る。
本稿では,BYTEと呼ばれるシンプルで効果的で汎用的なアソシエーション手法を提案する。
論文 参考訳(メタデータ) (2021-10-13T17:01:26Z) - Chained-Tracker: Chaining Paired Attentive Regression Results for
End-to-End Joint Multiple-Object Detection and Tracking [102.31092931373232]
そこで我々は,3つのサブタスク全てをエンド・ツー・エンドのソリューションに統合する簡単なオンラインモデルである Chained-Tracker (CTracker) を提案する。
鎖状構造と対の注意的回帰という2つの大きな特徴は、CTrackerをシンプルに、速く、効果的にする。
論文 参考訳(メタデータ) (2020-07-29T02:38:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。