論文の概要: Task Inference Beyond Least Squares in Behavioral Foundation Models
- arxiv url: http://arxiv.org/abs/2610.05350v1
- Date: Sun, 04 Oct 2026 16:17:55 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:16:28.003598
- Title: Task Inference Beyond Least Squares in Behavioral Foundation Models
- Title(参考訳): 行動基礎モデルにおける最小二乗を超えたタスク推論
- Abstract要約: 行動基礎モデル(BFM)は、テストタイムポリシー学習なしで幅広い下流タスクを解決することを目的としている。
本稿では,報酬再構成誤差の最小化と後続対策ミスマッチの低減を両立させる効率的なテスト時間推定手法であるBLSを提案する。
- 参考スコア(独自算出の注目度): 12.50754565229653
- License:
- Abstract: Behavioral Foundation Models (BFMs) aim to solve a wide range of downstream tasks without test-time policy learning by inferring a task vector from the reward function. While efficient, the retrieved policies are often suboptimal because of how this task vector is inferred, typically with ordinary least squares (OLS). OLS minimizes reward reconstruction error but leaves the ordering of rewards unconstrained, which can bias the successor measure of the retrieved zero-shot policy away from that of the optimal policy. In this work, we propose BLS, an efficient test-time inference method that balances minimizing reward reconstruction error with reducing successor-measure mismatch. Theoretically, we provide a suboptimality gap upper bound characterized by both successor-measure and reward-function residuals. Empirically, we evaluate BLS on top of state-of-the-art BFMs across benchmarks for locomotion, manipulation, and humanoid control. BLS outperforms existing task inference baselines with negligible computational overhead. Project page: https://embodiedai-ntu.github.io/BLS
- Abstract(参考訳): 行動基礎モデル(BFM)は、報酬関数からタスクベクトルを推定することにより、テスト時間ポリシー学習なしで幅広い下流タスクを解決することを目的としている。
効率性はあるものの、通常最小二乗 (OLS) を持つこのタスクベクトルの推論方法により、検索されたポリシーはしばしば準最適である。
OLSは報酬の復元誤差を最小限に抑えるが、報酬の順序を制約しないままにしておくと、取得したゼロショットポリシーの後継尺度を最適なポリシーから逸脱させる可能性がある。
本研究では,報酬再構成誤差の最小化と後続対策ミスマッチの低減を両立させる効率的なテスト時間推定手法であるBLSを提案する。
理論的には、後続測度と報酬関数の残差を特徴とする準最適ギャップ上限を提供する。
実験により,ロコモーション,操作,ヒューマノイド制御のベンチマークにおいて,最先端のBFM上でのBLSを評価した。
BLSは既存のタスク推論ベースラインを無視可能な計算オーバーヘッドで上回る。
プロジェクトページ: https://embodiedai-ntu.github.io/BLS
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Optimistic Task Inference for Behavior Foundation Models [36.02038435371954]
OpTI-BFMは、タスク推論のためのデータ収集においてBFMを導く楽観的な決定基準である。
我々は、確立されたゼロショットベンチマーク上でOPTI-BFMを評価し、後継機能ベースのBFMが未知の報酬関数を識別し、最適化することができることを観察した。
論文 参考訳(メタデータ) (2025-10-23T06:36:18Z) - Scalable Submodular Policy Optimization via Pruned Submodularity Graph [2.8672152503836]
強化学習(RL)では、エージェントが可能なアクションのセットを介して環境と対話し、未知の分布から報酬が生成される。
ここでの課題は、ある時間ステップ後の報酬が最大化されるような、最適な一連のアクションを見つけることである。
論文 参考訳(メタデータ) (2025-07-18T11:42:07Z) - Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning [55.33984461046492]
現在、政策に基づく手法が大規模言語モデル(LLM)推論のための強化学習パイプラインを支配している。
本稿では,このアイデアを LLM に自然に適応させるアルゴリズムである Trajectory Bellman Residual Minimization (TBRM) を紹介する。
我々は、軌道の軌道変更-測度分析の改善により、任意のオフ政治から、最適に近いKL正規化政策への収束を証明した。
論文 参考訳(メタデータ) (2025-05-21T09:41:53Z) - Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference [15.038210624870656]
リワード推論は、ヒューマンフィードバックパイプラインからの強化学習における重要な中間ステップである。
本稿では,帯域幅を超える一般RL問題と決定論的MDP帯域幅,Bradley-Terryモデルを超える一般選好モデルについて,報酬推論のない2つのRLHFアルゴリズムを開発した。
論文 参考訳(メタデータ) (2024-09-25T22:20:11Z) - Imitating from auxiliary imperfect demonstrations via Adversarial Density Weighted Regression [27.08369731750032]
本稿では,適応密度回帰(Adversarial Density Regression)と呼ばれる,一段階の教師付き模倣学習フレームワークを提案する。
実演を生かして、専門家の分布に合わせるために、未知の品質で学んだポリシーを正すことを目的としている。
AdroitドメインとKitchenドメインのタスクの真理的な報酬を利用する場合、IQLよりも89.5%改善されている。
論文 参考訳(メタデータ) (2024-05-28T06:59:16Z) - Task-Robust Pre-Training for Worst-Case Downstream Adaptation [62.05108162160981]
プレトレーニングは下流のタスクに移行することで大きな成功を収めた。
本稿では,下流タスクに対する一様性能を保証するモデルについて,事前学習について考察する。
論文 参考訳(メタデータ) (2023-06-21T07:43:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。