論文の概要: Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
- arxiv url: http://arxiv.org/abs/2607.14277v1
- Date: Wed, 15 Jul 2026 18:36:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.887088
- Title: Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
- Title(参考訳): マルチヘッド遅延制御:LLMエージェント決定のための統一インターフェース
- Authors: Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu,
- Abstract要約: 凍結したLCMまたはVLMから隠れ状態軌跡を読み出し,展開時間制御信号を生成する軽量層であるMulti-Head Latent Controlを導入する。
キャパビリティヘッドは、現在のモデルがインスタンスを解決できるか、より強力なコラボレータに延期すべきかを予測し、レゾリューションヘッドは適切な解決判断の明確化、ツールの使用、回避、あるいは直接回答を予測する。
両方の頭部は、同じ凍結したLDMバックボーンの潜在トレースでのみ訓練され、モデルを変更することなく、ホック後の適応を可能にする。
- 参考スコア(独自算出の注目度): 15.37854161578634
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly deployed as agents, but reliable agentic behavior requires more than next-token prediction. At inference time, it is preferred that an agent can decide whether to proceed with its current reasoning, defer to a stronger model, request additional information, invoke external tools, or abstain under the given setup. Existing approaches address these decisions through prompt-level routing, external orchestration, or task-specific fine-tuning, which primarily rely on input-side signals, and are often costly and difficult to maintain as model backbones evolve. We ask whether such control decisions can be inferred directly from a model's latent generation process. We introduce Multi-Head Latent Control, a lightweight layer that reads hidden-state trajectories from a frozen LLM or VLM to produce deployment-time control signals. A Capability Head predicts whether the current model can solve the instance or should defer to a stronger collaborator, while a Resolution Head predicts appropriate resolution decision Clarification, Tool Use, Abstention, or Direct Answering. Both heads are trained only on latent traces from the same frozen LLM backbone, enabling post hoc adaptation without modifying the model. Across language and vision-language settings, Multi-Head Latent Control consistently improves the quality-cost tradeoff of multi-model systems, enabling early handoff from partial generations and more accurate intervention decisions. In routed execution (small + large model), it reduces large-model usage by up to 90.7 percent on AndroidWorld and 27-53 percent on average across benchmarks, while retaining most of large-model performance. Additionally, the learned control signals improve tool-use decision quality, yielding up to +158 percent relative score gain and 65.5 percent fewer missed-required tool calls.
- Abstract(参考訳): 大規模言語モデルはエージェントとしてますますデプロイされるが、信頼できるエージェントの振る舞いには、次から次までの予測以上のものが必要である。
推論時には、エージェントが現在の推論を進めるか、より強いモデルに延期するか、追加情報を要求するか、外部ツールを起動するか、あるいは所定の設定の下で停止するかを判断することが好ましい。
既存のアプローチは、プロンプトレベルのルーティング、外部オーケストレーション、あるいは主に入力側の信号に依存するタスク固有の微調整を通じてこれらの決定に対処する。
モデルが潜在する生成プロセスから直接、そのような制御決定を推測できるかどうかを問う。
凍結したLCMまたはVLMから隠れ状態軌跡を読み出し,展開時間制御信号を生成する軽量層であるMulti-Head Latent Controlを導入する。
キャパビリティヘッドは、現在のモデルがインスタンスを解決できるか、より強力なコラボレータに延期すべきかを予測し、レゾリューションヘッドは適切な解決判断の明確化、ツールの使用、回避、あるいは直接回答を予測する。
両方の頭部は、同じ凍結したLDMバックボーンの潜在トレースでのみ訓練され、モデルを変更することなく後部適応が可能である。
言語や視覚言語の設定全体にわたって、マルチヘッド遅延制御は、マルチモデルシステムの品質とコストのトレードオフを一貫して改善し、部分的な世代からの早期のハンドオフとより正確な介入決定を可能にする。
ルート付き実行(小さなモデルと大きなモデル)では、AndroidWorldで最大90.7%、ベンチマークで平均27-33%まで大きなモデルの性能を維持しながら、大きなモデルの使用量を最大90.7%削減する。
さらに、学習した制御信号はツール使用判定の質を向上し、相対スコアは最大で+158%、失効したツールコールは65.5%減少する。
関連論文リスト
- Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management [15.19525853427301]
本稿では,MIT Beer Game を用いたマルチエキロンサプライチェーンにおける自律生成型AIエージェントについて検討する。
モデル選択、ポリシーとガードレール、集中型データ共有、迅速なエンジニアリングという、パフォーマンスを形成する4つの推論時レバーを特定します。
論文 参考訳(メタデータ) (2026-05-16T15:11:35Z) - Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use [47.29360932085394]
大規模言語モデル(LLM)は、外部ツールを呼び出す時と直接答える時を判断しなければならない自律的なエージェントとして、ますます機能します。
本稿では,各モデルの経験的性能に基づいて,ツール必要度をモデル適応的に定義する。
その結果,26.5~54.0%,30.8~41.8%のミスマッチが認められた。
論文 参考訳(メタデータ) (2026-05-13T18:59:28Z) - Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs [31.34021188099265]
マルチエージェント大言語モデル(LLM)システムは、異種モデルのプールを調整するためのコントローラに依存していることが多い。
逐次決定問題としてマルチエージェントコーディネーションを提案する。
論文 参考訳(メタデータ) (2026-05-09T04:51:42Z) - Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference [10.009730627424629]
大規模言語モデル(LLM)は、さまざまな自然言語タスクに対する推論に革命をもたらした。
本稿では,信頼度推定に基づいて最適モデルを動的に選択する信頼性駆動型戦略を提案する。
論文 参考訳(メタデータ) (2026-02-25T16:38:03Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。