論文の概要: Large Language Model Orchestration under Heterogeneous Preferences via Explicit Persona Inference
- arxiv url: http://arxiv.org/abs/2610.07587v1
- Date: Tue, 06 Oct 2026 01:24:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.744276
- Title: Large Language Model Orchestration under Heterogeneous Preferences via Explicit Persona Inference
- Title(参考訳): 明示的ペルソナ推論による不均一な選好の下での大言語モデルオーケストレーション
- Abstract要約: 提案手法は, 優先推論によるヘテロジニアス推論エージェントoRchestration(ヘテロジニアス推論エージェントoRchestration)であり, プロンプトから信念を移動させる新しいフレームワークである。
HARP は因数分解が完全であるときの明示的な共同推論と同じ$tilde O(sqrt K)$ Bayesian regret が得られることを証明している。
- 参考スコア(独自算出の注目度): 41.05937704239182
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM orchestration investigates how an orchestrator coordinates a group of autonomous agents to achieve common goals or maximize collective welfare. The agents are typically heterogeneous, each holding a private preference that it pursues but does not reveal. Inferring such hidden preferences from behavior has been a subject of long-standing research in game theory and multi-agent systems. The core challenge lies in maintaining a belief over every agent's preference and updating it from the agents' observed actions. Existing LLM orchestrators carry that belief as prompt text with no explicit update rule. This lets early errors persist and propagate rather than be corrected. We therefore propose \textbf{HARP} (Heterogeneous-preference Agent oRchestration via Preference inference), a novel framework that moves the belief out of the prompt. Specifically, HARP maintains one numeric posterior per agent over a finite set of candidate preferences and updates it in closed form by Bayes' rule. The language model supplies only actions and per-candidate likelihoods, so estimation is decoupled from its reasoning. We prove that HARP attains the same $\tilde O(\sqrt K)$ Bayesian regret as explicit joint inference when the factorization is exact. Furthermore, HARP\textsuperscript{+} augments planning with a bonus for actions that distinguish the candidates, so inference continues even when the optimal action is uninformative. Empirical results on three substrates, ranging from payoffs the preferences fully determine, through payoffs that depend on more than them, to scales where explicit joint inference is infeasible, demonstrate that HARP\textsuperscript{+} is the strongest non-oracle method across the class our theory identifies.
- Abstract(参考訳): LLMオーケストレーションは、オーケストレータが自律的なエージェントのグループをどのように調整して共通の目標を達成するか、あるいは集団福祉を最大化するかを調べる。
エージェントは典型的には異質であり、それぞれが追求するプライベートな嗜好を持っているが、明らかにはしない。
このような行動から隠れた嗜好を推定することは、ゲーム理論やマルチエージェントシステムにおける長年の研究の対象となっている。
主な課題は、全てのエージェントの好みに対する信念を維持し、エージェントの観察された行動からそれを更新することである。
既存のLLMオーケストレータは、その信念を明示的な更新ルールのないプロンプトテキストとして保持する。
これにより、早期エラーは修正されるのではなく持続し、伝播する。
そこで,本稿では,提案手法から信念を抽出する新しいフレームワークである「textbf{HARP} (異種推論エージェントoRchestration via Preference inference)」を提案する。
具体的には、HARPは有限個の候補選好の集合上でエージェント毎の1つの数値的後続を保ち、ベイズの規則により閉じた形で更新する。
言語モデルは、アクションと候補ごとの確率のみを提供するので、推定はその推論から切り離される。
HARP は因数分解が完全であるときに明示的な共同推論と同じ$\tilde O(\sqrt K)$ Bayesian regret が得られることを証明している。
さらに、HARP\textsuperscript{+}は、候補を区別するアクションのボーナスで計画を強化するので、最適なアクションが非形式的であっても推論は継続する。
3つの基質上の実証的な結果(ペイオフから選好まで)は、より多くに依存するペイオフから、明示的な関節推論が実現不可能なスケールまで、我々の理論が特定するクラスで最強の非オラクル法であることを証明している。
関連論文リスト
- OPSRD: On-Policy Self-Role Distillation [7.947611649764756]
OPSRDは、参照ソリューションを使わずに、政治上の自己蒸留のための特権的な教育コンテキストとして、固定された専門家の役割を使用する。
ロールフリーの学生は軌道を生成し、同じベースモデルの凍結インスタンスはその正確なプレフィックスにロール条件の分布を提供する。
フォワードKLは、個々の語彙への貢献を制限するクリッピングによって、学生が過小評価する代替案をターゲットにしている。
論文 参考訳(メタデータ) (2026-09-30T14:56:10Z) - Bayesian Belief Layer for Controllable Opinion Dynamics in LLM Agents [3.8192008039287226]
ベイズ年代記エージェント (Bayesian Chronicle Agents, BCA) は、エージェントがどのように話すかから何を信じるのかを分離する最小限の信念層である。
1つの事前強度パラメータ$$は、Friedkin-Johnsen(FJ)の意見力学での役割をモデルに、スタバボーン性をエンコードする。
所定の$が言語ラウンドトリップ後に回復可能であることを示す。
論文 参考訳(メタデータ) (2026-09-18T16:57:14Z) - HARP: Hierarchical Adaptive Ranking with Preference-Adaptive Fusion for Query-Based CVE Prioritization [84.9738509922482]
本稿では,自然言語クエリから候補をランク付けするグラフ付きマルチビューフレームワークと,過去のラベル付きサンプルの支持銀行を提案する。
HarPは脆弱性知識グラフからエビデンスを取得し、ポリシー付きグローバル、エンタプライズ、ユーザビューで候補をスコアし、サンプルサポートからのビューフュージョン重みに適合する。
論文 参考訳(メタデータ) (2026-08-19T20:29:00Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty [70.43119366710778]
本稿では,Agens-BRACE: Agent Belief state Representation by Abstraction and Confidence Estimationを紹介する。
LLMエージェントを信頼状態モデルと政策モデルに分離し、強化学習を通じて協調的に最適化する手法である。
長期にわたる部分的に観察可能な言語環境において、平均して+14.5%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2026-05-12T02:37:04Z) - CAPO: Counterfactual Credit Assignment in Sequential Cooperative Teams [6.8920524670882815]
本稿では,Aristocrat Utility(SeqAU)について紹介する。
批判のないポリシー段階のアルゴリズムであるCAPOを導出する。
論文 参考訳(メタデータ) (2026-04-20T01:14:59Z) - Pure Exploration under Mediators' Feedback [63.56002444692792]
マルチアームバンディット(Multi-armed bandits)は、各インタラクションステップにおいて、学習者が腕を選択し、報酬を観察する、シーケンシャルな意思決定フレームワークである。
本稿では,学習者が仲介者の集合にアクセスできるシナリオについて考察する。
本稿では,学習者には仲介者の方針が知られていると仮定して,最適な腕を発見するための逐次的意思決定戦略を提案する。
論文 参考訳(メタデータ) (2023-08-29T18:18:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。