論文の概要: Controllability in preference-conditioned multi-objective reinforcement learning
- arxiv url: http://arxiv.org/abs/2605.10585v1
- Date: Mon, 11 May 2026 13:58:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.867352
- Title: Controllability in preference-conditioned multi-objective reinforcement learning
- Title(参考訳): 優先条件付き多目的強化学習における制御可能性
- Authors: Pau de las Heras Molins, Beyazit Yalcinkaya, Lasse Peters, David Fridovich-Keil, Georgios Bakirtzis,
- Abstract要約: 多目的強化学習(MORL)により、ユーザは目的の相対的重要性の観点から結果よりも好みを表現できる。
標準メトリクスは、好みの変化がエージェントの振る舞いを意図した方法で確実に変化させるかどうかを把握できない。
- 参考スコア(独自算出の注目度): 3.967027179068453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-objective reinforcement learning (MORL) allows a user to express preference over outcomes in terms of the relative importance of the objectives, but standard metrics cannot capture whether changes in preference reliably change the agent's behavior in the intended way, a property termed controllability. As a result, preference-conditioned agents can score well on standard MORL metrics while being insensitive to the preference input. If the ability to control agents cannot be reliably assessed, the symbolic interface that MORL provides between user intent and agent behavior is broken. Mainstream MORL metrics alone fail to measure the controllability of preference-conditioned agents, motivating a complementary metric specifically designed to that end. We hope the results spur discussion in the community on existing evaluation protocols to consolidate advances in preference adaptation in MORL to larger and more complex problems.
- Abstract(参考訳): 多目的強化学習(MORL)では、目的の相対的重要性の観点から結果よりも優先性を表現することができるが、標準メトリクスでは、目的とする方法でエージェントの振る舞いが確実に変化するかどうかを把握できない。
その結果、嗜好条件付きエージェントは、嗜好入力に敏感でありながら、標準のMORL測定値によくスコアを付けることができる。
エージェントを確実に評価できない場合、MORLがユーザ意図とエージェント動作の間に提供するシンボリックインターフェースが壊れる。
メインストリームMORLメトリクスだけでは、嗜好条件付きエージェントの制御可能性を測定することができず、その目的のために特別に設計された補足的メトリックを動機付けている。
この結果が,MORLにおける嗜好適応の進歩を,より大規模で複雑な問題に集約する既存の評価プロトコルに関するコミュニティの議論に拍車をかけることを願っている。
関連論文リスト
- PRISM: Refracting the Entangled User Behavior Space for E-Commerce Search [5.387173334885012]
電子商取引検索システムは、アイテムの関連性とユーザの嗜好を推定するために、ユーザー行動のモデル化に頼っている。
ユーザインタラクションは、露出メカニズム、フィードバックループ、セマンティックマッチングによって共同で形成される。
我々は、eコマース検索行動予測のためのPreference-Relevance Interaction Semantic ModelingフレームワークであるPRISMを提案する。
論文 参考訳(メタデータ) (2026-05-08T06:05:33Z) - Learning What Matters Now: Dynamic Preference Inference under Contextual Shifts [8.986181114282559]
本研究は,文脈とともにドリフトする未観測潜伏変数が優先重みを持つ場合の逐次決定問題について検討する。
本稿では,エージェントが嗜好重みに対する確率論的信念を維持する枠組みである動的選好推論(DPI)を提案する。
DPIはその推論された嗜好を新しいレシエーションに適応させ、固定ウェイトや封筒ベースラインよりも高いポストシフト性能を達成する。
論文 参考訳(メタデータ) (2026-03-24T05:22:04Z) - AMPS: Adaptive Modality Preference Steering via Functional Entropy [66.69992693275061]
本稿では,各モータリティの情報提供量を定量化し,ステアリングに対するサンプル固有の感受性を明らかにするインスタンス認識診断指標を提案する。
実験結果から, インスタンス認識のステアリングは, 従来のステアリングよりもモダリティの嗜好の調整に優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-02-13T02:29:06Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - FiLoRA: Focus-and-Ignore LoRA for Controllable Feature Reliance [9.773453946550003]
内部機能依存の明示的な制御を可能にする適応フレームワークFiLoRAを紹介する。
テキスト画像と音声画像のベンチマークにおいて、FiLoRAは内部計算において一貫した因果シフトを誘導することを示す。
さらなる分析により、FiLoRAは突発的特徴介入下で堅牢性を向上させることが示されている。
論文 参考訳(メタデータ) (2026-02-02T13:00:57Z) - RecNet: Self-Evolving Preference Propagation for Agentic Recommender Systems [109.9061591263748]
RecNetは、レコメンデータシステムのための自己進化的な好みの伝達フレームワークである。
関連ユーザやアイテム間で、リアルタイムの好み更新を積極的に伝達する。
逆相では、フィードバック駆動の伝搬最適化機構がマルチエージェント強化学習フレームワークをシミュレートする。
論文 参考訳(メタデータ) (2026-01-29T12:14:31Z) - Unsupervised Evaluation of Multi-Turn Objective-Driven Interactions [0.5249805590164902]
大規模言語モデル(LLM)は、AIエージェントと人間が客観的に駆動される相互作用に関与するエンタープライズアプリケーションで人気が高まっている。
客観的インタラクションのための教師なしメトリクスの最初のセットを紹介する。
本研究では,ユーザ目標のラベル付け,目標達成度の測定,LLMの不確かさの定量化のための指標を開発する。
論文 参考訳(メタデータ) (2025-11-04T22:44:27Z) - Interactive Recommendation Agent with Active User Commands [35.77744269746443]
本稿では、主流の推薦フィード内で自然言語コマンドを可能にする先駆的なパラダイムであるInteractive Recommendation Feed(IRF)を紹介する。
ユーザが暗黙的な行動の影響を受動的に抑制する従来のシステムとは異なり、IRFはリアルタイム言語コマンドを通じて推奨ポリシーを積極的に制御する。
RecBotは、ユーザ満足度とビジネス成果の両方において、大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-25T15:38:27Z) - PersonaAgent: When Large Language Model Agents Meet Personalization at Test Time [87.99027488664282]
PersonaAgentは、汎用的なパーソナライゼーションタスクに対処するために設計されたフレームワークである。
パーソナライズされたメモリモジュールとパーソナライズされたアクションモジュールを統合する。
テストタイムのユーザ嗜好アライメント戦略は、リアルタイムのユーザの嗜好アライメントを保証する。
論文 参考訳(メタデータ) (2025-06-06T17:29:49Z) - Variable Importance Matching for Causal Inference [73.25504313552516]
これらの目標を達成するためのModel-to-Matchと呼ばれる一般的なフレームワークについて説明する。
Model-to-Matchは、距離メートル法を構築するために変数重要度測定を使用する。
LASSO を用いて Model-to-Match フレームワークを運用する。
論文 参考訳(メタデータ) (2023-02-23T00:43:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。