論文の概要: The Fellowship of the Query: Learning Retrieval Actions
- arxiv url: http://arxiv.org/abs/2609.28653v1
- Date: Wed, 23 Sep 2026 18:01:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.468483
- Title: The Fellowship of the Query: Learning Retrieval Actions
- Title(参考訳): クエリのフェローシップ:検索行動の学習
- Abstract要約: 本研究は,SLM(Small Language Model)を次世代コントローラとして改良できるかどうかを考察する。
また、1つのSLMがコントローラとファイナル・アンサー・ジェネレータの両方として機能する低リソース設定についても評価する。
- 参考スコア(独自算出の注目度): 2.1558646088627444
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented question answering requires control decisions about when to decompose a question, search, reformulate, extract evidence, synthesize facts, verify progress, and stop. We study whether trajectory fine-tuning can improve small language models (SLMs) as next-action controllers. We additionally evaluate a low-resource setting in which a single SLM serves as both the controller and the final-answer generator. From accepted teacher search traces, we build a seven-way action-prediction task, where the model predicts the next structured teacher action from the current trajectory state, and evaluate LoRA-supervised fine-tuning across SLMs and xSLMs as controllers. On 1,646 held-out action examples, Granite 4.1 3B trained on 13,194 actions reaches macro-F1 0.6536, compared with 0.1736 for zero-shot prompting of the same model and 0.5399 for a TF-IDF logistic-regression baseline. In an end-to-end controller/generator swap evaluation over 149 held-out trajectories, using the fine-tuned model for both roles improves Exact Match from 0.7530 to 0.7946 and token F1 from 0.7783 to 0.8295 compared with using the base model as both controller and generator. The cross-role conditions show that the fine-tuned controller increases evidence-fact recording when the generator is fixed, while controller-only final-answer gains are not statistically clear. Overall, trajectory supervision improves action prediction and evidence-recording behaviour in this evaluated pipeline. Code is available at https://github.com/padas-lab-de/agent-action-controller
- Abstract(参考訳): Retrieval-augmented question answeringは、質問をいつ分解し、検索し、改定し、証拠を抽出し、事実を合成し、進捗を検証し、停止するかに関する制御的な決定を必要とする。
本研究は,SLM(Small Language Model)を次世代コントローラとして改良できるかどうかを考察する。
また、1つのSLMがコントローラとファイナル・アンサー・ジェネレータの両方として機能する低リソース設定についても評価する。
受理された教師の探索トレースから、7方向の行動予測タスクを構築し、モデルが現在の軌道状態から次の構造化された教師の行動を予測し、SLMとxSLMをまたいだLoRAによる微調整をコントローラとして評価する。
1,646のホールドアウトアクションの例では、グラナイト4.1 3Bが13,194のアクションで訓練されマクロF1 0.6536に達し、同じモデルのゼロショットプロンプトでは0.1736、TF-IDFロジスティック回帰ベースラインでは0.5399に達した。
エンド・ツー・エンドのコントローラ/ジェネレータのスワップ評価では、両方のロールに微調整されたモデルを使用することで、Exact Matchが0.7530から0.7946に改善され、トークンF1が0.7783から0.8295に改善される。
クロスロール条件は、微調整されたコントローラが発電機が固定されたときにエビデンス・ファクト記録を増加させることを示しているが、コントローラのみのファイナル・アンサーゲインは統計的に明確ではない。
全体として、軌道監視は、この評価パイプラインにおける行動予測とエビデンス記録行動を改善する。
コードはhttps://github.com/padas-lab-de/agent-action-controllerで入手できる。
関連論文リスト
- DREAM Technical Report [53.37525197047151]
DREAMは、既存のパイプラインの上に認識認識、オーケストレーション、監査可能なポリシ層を追加し、それを置き換えることなく、自律的な最適化制御アーキテクチャである。
DREAMには2つのコアコンポーネントがある。まず、3層Intent Engineはデバイス上の信号を構造化されたL0/L1/L2インテント表現に融合する。エッジクラウドトリガーチェーンはレポートのボリュームを約8.7%に削減する。
第2に、Meta EngineはMetaModelを使って、層状M1-to-M2-to-M3推論(インテントの要約、ストラテジーメモリに通知されるストラテジープランニング、パラメータ変換など)を定式化したM1-to-M2-to-M3推論に使用します。
論文 参考訳(メタデータ) (2026-08-10T10:35:32Z) - The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World [0.0]
LLMルータは、各要求を最も安価な適切なモデルに合わせることで効率を約束し、マルチステップエージェント内のステップごとに適用されるようになっている。
しかし、エージェントルータはシングルターンルータのように評価され、ログ付きトラジェクトリを再生し、他のモデルの出力を置換することで評価される。
我々は,SWE-benchエージェントを制御点にフォークし,環境を再構築し,各フォークを異なるモデルで継続し,サンプリングと再生を分離する同モデル制御フォークと比較する。
論文 参考訳(メタデータ) (2026-08-08T17:07:11Z) - CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift [4.0604823050005345]
CausalNavは、特定状態座標上の署名付きアクション条件遷移グラフを中心に構築されたコントローラである。
CausalNavはデプロイメント時に、介入シーケンスの小さなライブラリをシミュレートし、客観的エラーをポリシ-ログアドバイスに変換する。
我々はCartPole-v1とPendulum-v1の9つの制御基線について評価した。
論文 参考訳(メタデータ) (2026-08-07T23:16:57Z) - Visual Grounding in Zero-Shot Vision-Language Control [0.0]
視覚言語モデル(VLM)は、ゼロショットコントローラとしてますます使われているが、成功した軌道は、必ずしも決定が視覚入力に基礎を置いていることを示さない。
我々はこれを、ブラインドイメージ制御、繰り返し同じ入力、車線軸反射、非視覚ベースライン、パイプライン積分チェックといった入力アブレーション電池を用いて検討する。
実験では,9つの直接動作モデル,6つの局所的VLM,探索的VLM-MPC階層に対して,2つの実施形態と3つのシミュレータに対する32,874の呼び出しを解析した。
論文 参考訳(メタデータ) (2026-08-06T15:21:42Z) - Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction [17.527470001317685]
本研究では,コンパクトな小言語モデル (SLM) を制御推論のために再訓練し,検証器誘導補正ループに組み込むことができるかを検討する。
ランダム化熱制御シミュレーション(それぞれ500段の30の実験)では、平均的なアクションアライメント精度が91.5%に達する。
シンボリック・リマッピングの下では95%のインレンジレートを維持しており、トークンレベルの合意が減ったにもかかわらず、堅牢な物理的規制を示している。
論文 参考訳(メタデータ) (2026-06-24T13:49:01Z) - ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving [56.96697737229895]
リアクティブ能力は、自律運転シミュレーションシステムのためのデータ駆動行動世界モデルシミュレータの重要な特性である。
本稿では,自律運転における行動世界モデルシミュレーションの反応性を評価するためのReactSim-Benchを紹介する。
論文 参考訳(メタデータ) (2026-06-12T03:11:06Z) - When is Your LLM Steerable? [56.656180566692946]
アクティベーションステアリングは、推論時に言語モデルの振る舞いを制御するための軽量なアプローチを提供する。
ステアリングを成功させる体制と境界を見つけるには、通常、高価なグリッドサーチが必要である。
生成プロセスの開始時にモデルの内部状態からステアビリティを予測できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-10T02:55:34Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - A Regime Theory of Controller Class Selection for LLM Action Decisions [13.268450355990687]
コントローラを固定アクション、パーティションルータ、インスタンスレベルのコントローラ、プレゲートコントローラの4つのクラスにまとめる。
3つのデータ推定可能なボトルネックをクラス選択に変換する制度理論を実証する。
結果のバーンスタイン-タイト閾値は、一致する情報理論の下限を持ち、厳密なネスト付きクロスバリデーションは、確実に、最も近いクラスを選択する。
論文 参考訳(メタデータ) (2026-05-07T14:28:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。