論文の概要: Policy Gradient Steering: Interventions from Behavioral Objectives
- arxiv url: http://arxiv.org/abs/2607.27574v1
- Date: Thu, 30 Jul 2026 01:29:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.360174
- Title: Policy Gradient Steering: Interventions from Behavioral Objectives
- Title(参考訳): 政策グラディエント・ステアリング:行動目標からの介入
- Abstract要約: 本稿では、強化学習問題としてステアリングを定式化するポリシグラディエントステアリング(PGS)を提案する。
PGSは、取り外し可能なタスクベクトルを構築するために、小さなロールアウトやデモのセットに対して一時的な行動目標の勾配を蓄積する。
競技フットボールでは、PGSは特定のチームの振る舞いを変えることができ、その効果が相手間で伝達されることが示される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Activation steering has emerged in large language models as a lightweight alternative for dynamically changing a model's behavior at inference time. However, we show that existing steering methods fail to steer even a simple policy in a two-route gridworld environment. To address this limitation, we propose Policy Gradient Steering (PGS), which formulates steering as a reinforcement learning problem. PGS accumulates gradients of a temporary behavioral objective over a small set of rollouts or demonstrations to construct a removable task vector. We first demonstrate the calibration and reversibility of PGS in a two-route gridworld environment. Using chess puzzles, we then evaluate independently fitted PGS vectors both in isolation and in combination, finding that compatible tactical objectives accumulate constructively. Finally, in competitive football, we show that PGS can alter specific team behaviors and that its effects transfer across opponents. Together, these results show that policy gradients provide a natural interface for constructing temporary and composable behavioral adaptations across diverse decision-making domains.
- Abstract(参考訳): アクティベーションステアリングは、推論時にモデルの振る舞いを動的に変更するための軽量な代替手段として、大きな言語モデルに現れている。
しかし,既存のステアリング手法では,2ルートのグリッドワールド環境において,単純な方針さえもコントロールできないことを示す。
この制限に対処するため、我々は強化学習問題としてステアリングを定式化するポリシグラディエントステアリング(PGS)を提案する。
PGSは、取り外し可能なタスクベクトルを構築するために、小さなロールアウトやデモのセットに対して一時的な行動目標の勾配を蓄積する。
まず,PGSのキャリブレーションと可逆性を2ルートグリッドワールド環境で実証する。
チェスパズルを用いて、独立に適合したPSGベクトルを分離と組み合わせで評価し、互換性のある戦術的目的が構成的に蓄積されることを見出した。
最後に, 競技フットボールにおいて, PGSは特定のチーム行動を変化させることができ, その効果が相手間で伝達されることを示す。
これらの結果は、政策勾配が、様々な意思決定領域にまたがる一時的な、構成可能な行動適応を構築するための自然なインターフェースを提供することを示している。
関連論文リスト
- Safety-aware Skill Adaptation for Reinforcement Learning in Dynamic Environments [2.9923891863939946]
Dist-GPRLは、構造化ロボットスキル適応のための遠隔認識および安全誘導型強化学習フレームワークである。
ガウス過程(GP)に基づくスキルパラメタライゼーションを基盤として,スパーストラジェクトリの局所窓の重なり合いを逐次適応する。
シミュレーションにおける2つの動的オブジェクト操作タスクの枠組みを評価し,実世界のロボットに学習方針を伝達する。
論文 参考訳(メタデータ) (2026-09-10T12:05:54Z) - Objective-Behavior Alignment: Diagnostics for MORL Policy Selection [9.112571355018035]
多目的強化学習は、目的間のトレードオフを明確に表す一連のポリシーを生成する。
本稿では,パレートフロントに沿った行動変化を自動的に強調する探索的診断ワークフローを提案する。
単純なグリッドの例にアプローチを検証し、それを継続的制御ベンチマークに拡張し、問題の複雑性が増大するにつれて効果が持続することを示した。
論文 参考訳(メタデータ) (2026-06-19T11:10:26Z) - GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation [54.305781492241785]
本稿では,トレーニング分布を超えて一般化したビジュモータ操作ポリシーを学習するための枠組みを提案する。
GHOSTは、(i)多視点RGB-D観測から、3Dエンドエフェクタ上の分布として次のサブゴールを予測する高レベルポリシーに制御を分解する。
一連のタスクの中で、この階層的な分解は、フラットな拡散ポリシーと比較して、パフォーマンスと堅牢性を一貫して改善します。
論文 参考訳(メタデータ) (2026-06-08T18:08:01Z) - Mind Your Steps: A General Learning Framework for Accurate Humanoid Foothold Tracking [78.30338456206984]
本稿では,汎用3D足場追跡ポリシーをトレーニングするための新しいフレームワークを提案する。
本手法は, 目標検層による足場支援を動的に行うことにより, 学習方針を特定の地形に依存しないものにする。
我々の新しいターゲット表現は、雑音や不正確なポーズ推定や足の接触推定といった現実の課題を効果的に緩和する。
論文 参考訳(メタデータ) (2026-06-06T16:44:56Z) - VSPO: Vector-Steered Policy Optimization for Behavioral Control [30.80095775190934]
本稿では,言語モデルに対するVector-Steered Policy Optimization (VSPO)を提案する。
VSPOは、ターゲットの振る舞いに関連するステアリングベクトルを使用して、生成されたロールアウトの挙動強度を制御する。
VSPOはタスクの正確性を維持したり改善したりしながら、目標行動に沿った制御を一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-05-15T04:31:06Z) - Generalizing from References using a Multi-Task Reference and Goal-Driven RL Framework [12.131501436717969]
本研究では,人間の動作からヒューマノイドの動作を学習するためのマルチタスク強化学習フレームワークを提案する。
単一の目標条件付きポリシーは、同じ観測空間と行動空間を共有する2つのタスクで共同で訓練される。
これらの目的を共通の定式化内で協調最適化することにより、このポリシーは、密集した基準監督から構造化された人間のような運動スキルを取得する。
論文 参考訳(メタデータ) (2026-02-23T21:25:06Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - Learning Policy Representations for Steerable Behavior Synthesis [80.4542176039074]
マルコフ決定プロセス(MDP)を前提として,テスト時の行動ステアリングを促進するために,さまざまなポリシーの表現を学習する。
これらの表現は、セットベースアーキテクチャを用いて、様々なポリシーに対して均一に近似できることを示す。
変動生成法を用いてスムーズな潜伏空間を導出し,さらにコントラスト学習により、潜伏距離が値関数の差と一致するように形成する。
論文 参考訳(メタデータ) (2026-01-29T21:52:06Z) - COMBO-Grasp: Learning Constraint-Based Manipulation for Bimanual Occluded Grasping [56.907940167333656]
集積ロボットグルーピングは、表面衝突などの環境制約により、所望のグルーピングポーズが運動的に不可能な場所である。
従来のロボット操作アプローチは、人間が一般的に使用する非包括的または双対的戦略の複雑さに苦しむ。
本稿では,2つの協調ポリシーを活用する学習ベースアプローチであるCOMBO-Grasp(Constraint-based Manipulation for Bimanual Occluded Grasping)を紹介する。
論文 参考訳(メタデータ) (2025-02-12T01:31:01Z) - A GAN-Like Approach for Physics-Based Imitation Learning and Interactive
Character Control [2.2082422928825136]
物理的にシミュレートされた文字の対話的制御のためのシンプルで直感的なアプローチを提案する。
本研究は,GAN(Generative Adversarial Network)と強化学習に基づく。
我々は,本手法の適用性を,模倣と対話的な制御タスクの範囲で強調する。
論文 参考訳(メタデータ) (2021-05-21T00:03:29Z) - Evolutionary Stochastic Policy Distillation [139.54121001226451]
本稿では,GCRS課題を解決するための進化的政策蒸留法(ESPD)を提案する。
ESPDは、政策蒸留(PD)技術により、ターゲットポリシーを一連の変種から学習することを可能にする
MuJoCo制御系に基づく実験により,提案手法の学習効率が向上した。
論文 参考訳(メタデータ) (2020-04-27T16:19:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。