論文の概要: Reinforcement Learning with Segment Reward Feedback under Linear Function Approximation
- arxiv url: http://arxiv.org/abs/2610.08271v1
- Date: Tue, 06 Oct 2026 12:45:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.985305
- Title: Reinforcement Learning with Segment Reward Feedback under Linear Function Approximation
- Title(参考訳): 線形関数近似によるセグメントリワードフィードバックによる強化学習
- Abstract要約: 線形関数近似の下でセグメント報酬フィードバックを用いた強化学習について検討した。
我々の研究は、セグメントフィードバックの粒度とセグメントの選択が学習にどのように影響するかに答える。
結果として生じた後悔境界は、通常の楕円的ポテンシャル分析の下では、状態-作用の特徴が後悔に与える影響は対数的要因によってのみ現れることを示している。
- 参考スコア(独自算出の注目度): 51.37117102462477
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Classical reinforcement learning (RL) assumes that a reward is observed for every visited state-action pair. However, in real-world applications such as autonomous driving, such fine-grained feedback can be costly or difficult to collect, whereas trajectory-level feedback may be too sparse for efficient learning. To provide a general feedback model bridging these two extremes and handle large state spaces, we study RL with segment reward feedback under linear function approximation. Our work answers how the granularity of segment feedback and the choice of segmentation influence learning. For equal-length segments with known transitions, we design algorithms $\bitssegd$ and $\edlinucbsegd$ for binary and sum feedback types, respectively. They adopt posterior sampling with planning to achieve computational efficiency and the E-optimal experimental design to attain near-optimality. Nearly matching lower bounds are established. For equal-length segments with unknown transitions, we develop a unified $\seglsvits$ framework with two instantiations for binary and sum feedback, which carefully integrates the posterior estimated reward parameters into least-squares value iteration. These results reveal a fundamental insight: under binary feedback, increasing the number of segments significantly reduces the regret through an exponential factor, while surprisingly, under sum feedback, the granularity of segments does not affect learning much. Finally, to investigate whether segmenting according to state-action features can further expedite learning, we design an algorithm $\uneqsegbitsd$ that allows arbitrary segmentations. The resulting regret bound shows that under the usual elliptical potential analysis, the influence of state-action features on the regret appears only through logarithmic factors, and equal segmentation achieves the best performance.
- Abstract(参考訳): 古典的強化学習(RL)は、訪問した状態-行動ペアごとに報酬が観測されると仮定する。
しかし、自律運転のような現実世界のアプリケーションでは、そのようなきめ細かいフィードバックはコストがかかるか、収集が難しい。
この2つの極小をブリッジして大きな状態空間を扱う一般フィードバックモデルを提案するため,線形関数近似の下でセグメント報酬フィードバックを用いてRLについて検討する。
我々の研究は、セグメントフィードバックの粒度とセグメントの選択が学習にどのように影響するかに答える。
既知の遷移を持つ等長セグメントに対しては、アルゴリズムをそれぞれ$\bitssegd$と$\edlinucbsegd$をバイナリとsumのフィードバックタイプ用に設計する。
彼らは計算効率を達成するために後方サンプリングとE-最適実験設計を採用し、ほぼ最適となるようにした。
ほぼ一致する下限が設定されている。
未知の遷移を持つ等長セグメントに対して、二進数と和フィードバックの2つのインスタンス化を備えた$\seglsvits$フレームワークを開発し、推定された推定報酬パラメータを最小二乗値の反復に注意深く統合する。
これらの結果は、二分的フィードバックの下では、セグメント数の増加は指数係数による後悔を著しく減少させるが、驚くほど、総和的フィードバックの下では、セグメントの粒度は学習に大きな影響を与えない。
最後に、状態対応機能によるセグメンテーションが学習をさらに高速化できるかどうかを検討するために、任意のセグメンテーションを可能にするアルゴリズムを設計する。
結果として生じた後悔境界は、通常の楕円的ポテンシャル分析の下で、後悔に対する状態-作用特徴の影響は対数的要因によってのみ現れ、等分法が最高のパフォーマンスを達成することを示している。
関連論文リスト
- Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits [58.63897489864948]
結果に基づくフィードバックによる強化学習は、根本的な課題に直面します。
適切なアクションにクレジットを割り当てるには?
本稿では,一般関数近似を用いたオンラインRLにおけるこの問題の包括的解析を行う。
論文 参考訳(メタデータ) (2025-05-26T17:44:08Z) - Reinforcement Learning with Segment Feedback [56.54271464134885]
状態ごとの反応フィードバックと軌道フィードバックのギャップを埋める一般的なパラダイムを提供するRLというモデルを考える。
バイナリフィードバックの下では、$m$のセグメント数の増加は指数率で後悔を減少させるが、驚くべきことに、和フィードバックの下では、$m$の増加は後悔を著しく減少させるものではない。
論文 参考訳(メタデータ) (2025-02-03T23:08:42Z) - Contextual Linear Optimization with Partial Feedback [35.38485630117593]
本研究では,異なるタイプのフィードバックを持つ文脈線形最適化(CLO)のためのオフライン学習アルゴリズムのクラスを提案する。
我々は,IERMに対して,不特定モデルクラスとフレキシブルな推定方法の選択を可能にする,新しい高速遅延境界を提供する。
論文 参考訳(メタデータ) (2024-05-26T13:27:27Z) - Positive-Negative Equal Contrastive Loss for Semantic Segmentation [8.664491798389662]
従来の作業では、グローバルコンテキストを効果的に抽出し集約するために、プラグアンドプレイモジュールと構造的損失を設計するのが一般的だった。
そこで我々は, 正負の負の正の負の負の正の負の正の負の正の負の負の負の正の負の負の正の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の負の
総合的な実験を行い、2つのベンチマークデータセット上で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-07-04T13:51:29Z) - Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency [111.83670279016599]
部分観察決定過程(POMDP)の無限観測および状態空間を用いた強化学習について検討した。
線形構造をもつPOMDPのクラスに対する部分可観測性と関数近似の最初の試みを行う。
論文 参考訳(メタデータ) (2022-04-20T21:15:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。