論文の概要: Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
- arxiv url: http://arxiv.org/abs/2607.18225v1
- Date: Mon, 20 Jul 2026 17:57:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.72947
- Title: Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
- Title(参考訳): ベクター検索が最近傍のマッチング: 因果推論におけるRAGに基づくポリシー学習
- Abstract要約: 検索強化世代(RAG)を用いた政策学習の一段階と二段階の手法を提案する。
我々はこの2段階の手法の後悔を、候補世代の後悔と候補内選択の後悔に分解する。
我々は,その中間計算が観測されていないため,一段階法を直接ポリシーとして評価する。
- 参考スコア(独自算出の注目度): 5.457279006229211
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We propose one-step and two-step methods for policy learning with retrieval-augmented generation (RAG). We formulate RAG-based action selection under the potential outcome framework. In the two-step method, vector search retrieves action-specific neighboring evidence in an embedding space, the generator estimates conditional expected outcomes or their contrasts, and a plug-in rule selects an action. This formulation connects action-specific vector search with nearest-neighbor matching in causal inference. We decompose the regret of the two-step method into candidate-generation regret and within-candidate choice regret, and we bound the latter using prediction-error guarantees for nearest-neighbor estimators and transformers. We evaluate the one-step method directly as a policy because its intermediate computation is unobserved.
- Abstract(参考訳): 検索強化世代(RAG)を用いた政策学習の一段階と二段階の手法を提案する。
我々はRAGに基づく行動選択を潜在的結果の枠組みで定式化する。
二段階の方法では、ベクトル探索は埋め込み空間において行動特異的に隣接する証拠を検索し、生成元は条件付き期待結果またはそれらのコントラストを推定し、プラグインルールはアクションを選択する。
この定式化は、行動固有のベクトル探索と、因果推論における最も近い隣のマッチングを結びつける。
我々は,この2段階の手法の後悔を,候補世代の後悔と候補内選択の後悔に分解し,最寄りの推定器と変圧器の予測エラー保証を用いて後者を拘束する。
我々は,その中間計算が観測されていないため,一段階法を直接ポリシーとして評価する。
関連論文リスト
- Don't double it: Efficient Agent Prediction in Occlusions [1.1338062042380708]
密集した交通機関は、隠れた歩行者や車両が予期せず現れるため、自動運転車にとって重大な課題となる。
既存の学習ベースの手法は、1つのエージェントが複数回識別された場合、冗長な占有率予測を生成することが多い。
我々は、最先端のSceneInformerアーキテクチャをベースにした、新しいトランスフォーマーベースのアプローチであるMatchInformerを紹介する。
論文 参考訳(メタデータ) (2026-01-29T10:22:38Z) - Explaining the Success of Nearest Neighbor Methods in Prediction [20.63799450632279]
予測手法は近接探索を利用して過去のトレーニング例をテスト例と最もよく似たものにする。
この本は、理論上も実際においても、これらの手法の成功を説明することを目的としている。
論文 参考訳(メタデータ) (2025-02-21T19:37:57Z) - Improving action segmentation via explicit similarity measurement [5.303583360581161]
本稿では,セグメント化精度を高めるために,フレーム間および予測間の明らかな類似性評価を提案する。
教師付き学習アーキテクチャでは,トランスフォーマーエンコーダへの入力として,フレームレベルのマルチレゾリューション機能を利用する。
本稿では,連続フレーム間の特徴類似性に基づいた境界補正アルゴリズムを提案する。
また,非教師付き境界検出補正を提案する。
論文 参考訳(メタデータ) (2025-02-15T08:02:38Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning [93.77763753231338]
CLIP画像エンコーダを微調整し、2つの中間対向クエリに対して同様の埋め込みを抽出するために、ACPT(Adversarial Contrastive Prompt Tuning)を提案する。
我々は,ACPTが7つの最先端クエリベースの攻撃を検出できることを示す。
また,ACPTは3種類のアダプティブアタックに対して堅牢であることを示す。
論文 参考訳(メタデータ) (2024-08-04T09:53:50Z) - Pure Exploration under Mediators' Feedback [63.56002444692792]
マルチアームバンディット(Multi-armed bandits)は、各インタラクションステップにおいて、学習者が腕を選択し、報酬を観察する、シーケンシャルな意思決定フレームワークである。
本稿では,学習者が仲介者の集合にアクセスできるシナリオについて考察する。
本稿では,学習者には仲介者の方針が知られていると仮定して,最適な腕を発見するための逐次的意思決定戦略を提案する。
論文 参考訳(メタデータ) (2023-08-29T18:18:21Z) - Large-Scale Sequential Learning for Recommender and Engineering Systems [91.3755431537592]
本稿では,現在の状況に適応してパーソナライズされたランキングを提供する自動アルゴリズムの設計に焦点を当てる。
前者はSAROSと呼ばれる新しいアルゴリズムを提案し,インタラクションの順序を学習するためのフィードバックの種類を考慮に入れている。
提案手法は, 電力網の故障検出に対する初期アプローチと比較して, 統計的に有意な結果を示す。
論文 参考訳(メタデータ) (2022-05-13T21:09:41Z) - Greedier is Better: Selecting Multiple Neighbors per Iteration for
Sparse Subspace Clustering [18.888312436971187]
本稿では,一般化OMP(GOMP)を用いた新しいSSC方式を提案する。
GOMPはイテレーションが少ないため、アルゴリズムの複雑さが低い。
提案した停止規則は,部分空間次元と雑音パワーのオフライン推定が不要である。
論文 参考訳(メタデータ) (2022-04-06T04:20:35Z) - Progressive End-to-End Object Detection in Crowded Scenes [96.92416613336096]
以前のクエリベースの検出器は2つの欠点に悩まされていた: まず、複数の予測が1つのオブジェクトに対して推論される。
具体的には、まず受理されたクエリを選択して正の予測を生成し、その後、受理された予測に従って残雑音のあるクエリを精査する。
提案手法は,混み合ったシーンにおける問合せ型検出器の性能を大幅に向上させることができることを示す。
論文 参考訳(メタデータ) (2022-03-15T06:12:00Z) - Adaptive Sampling for Heterogeneous Rank Aggregation from Noisy Pairwise
Comparisons [85.5955376526419]
ランキングアグリゲーション問題では、各項目を比較する際に、様々な精度レベルが示される。
本稿では,ノイズのあるペアワイズ比較によってアイテムのランクを推定する,除去に基づくアクティブサンプリング戦略を提案する。
提案アルゴリズムは,商品の真のランキングを高い確率で返却できることを示す。
論文 参考訳(メタデータ) (2021-10-08T13:51:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。