論文の概要: PAMD: Structured Adaptive Distances for Bisimulation Representations in Visual Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.18004v1
- Date: Mon, 20 Jul 2026 14:36:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.661011
- Title: PAMD: Structured Adaptive Distances for Bisimulation Representations in Visual Reinforcement Learning
- Title(参考訳): PAMD:視覚強化学習におけるバイシミュレーション表現のための構造的適応距離
- Authors: Daegyeong Roh, Juho Bae, Han-Lim Choi,
- Abstract要約: 我々は*PAMD: Pairwise Adaptive Mahalanobis Distance*を導入する。
提案手法を視覚的MuJoCo連続制御タスクにおいて実証的に検証し,提案する距離の確保により,最近のバイベースRLアルゴリズムの最終性能が大幅に向上することを示した。
- 参考スコア(独自算出の注目度): 1.7434507809930746
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many visual reinforcement learning (RL) algorithms learn representations by matching latent distances to a behavioral distance induced by reward and transition similarity. In practice, the choice of the latent distance can strongly affect performance: using a fixed, pre-specified global norms (e.g., $\ell_p$ norms or other hand-designed metrics) may be overly restrictive to capture the behavioral distance. In contrast, unconstrained pairwise distances may admit degenerate solutions that drive the metric loss down without improving the representation. To address this gap, we introduce **PAMD: Pairwise Adaptive Mahalanobis Distance**, which parameterizes a positive-definite, pair-conditioned metric for measuring latent state similarity. PAMD is a simple plug-in for existing bisimulation-based methods, offering a more expressive yet structured alternative to fixed, pre-specified latent distances. We empirically validate our method on visual MuJoCo continuous-control tasks, where final performance of several recent bisimulation-based RL algorithms is substantially improved when equipped with the distance we propose.
- Abstract(参考訳): 多くの視覚強化学習(RL)アルゴリズムは、報酬と遷移の類似性によって誘導される行動距離に潜在距離を合わせることによって表現を学習する。
実際には、潜伏距離の選択はパフォーマンスに強く影響しうる: 固定された事前指定されたグローバルノルム(例えば、$\ell_p$ノルムなど手作業で設計された基準)を使用することは、行動距離を捉えるために過度に制限される。
対照的に、制約のないペアワイズ距離は、表現を改善することなく、計量損失を減少させる退化解を許容することができる。
このギャップに対処するために、**PAMD: Pairwise Adaptive Mahalanobis Distance*を導入します。
PAMDは、既存のバイシミュレーションベースの方法のためのシンプルなプラグインであり、より表現力が高く構造的な、固定された、規定された潜伏距離に代わる代替手段を提供する。
提案手法を視覚的MuJoCo連続制御タスクにおいて実証的に検証し,提案手法を適用すれば,最近の2次元RLアルゴリズムの最終性能が大幅に向上することを示した。
関連論文リスト
- Manifold-Matching Autoencoders [5.232102034641475]
Manifold-Matching (MMAE) と呼ばれる自動エンコーダの単純な教師なし正規化方式について検討する。
平均二乗誤差を最小化することにより、潜時空間の対距離を入力データ空間の対距離に合わせる。
この正規化は、最寄り距離の保存と永続的ホモロジーに基づく測度に基づいて、類似の手法よりも優れていることが判明した。
論文 参考訳(メタデータ) (2026-03-17T14:25:42Z) - Deterministic Differentiable Structured Pruning for Large Language Models [37.33389749907146]
構造化プルーニングは、重要度の低いアーキテクチャ部品を取り除き、LLM推論コストを削減する。
マスクのみの最適化手法であるDDP(Deterministic Differentiable Pruning)を提案する。
従来のアプローチと比較して、DDPはより表現力が高く、テストミスマッチが減少し、より早く収束する。
論文 参考訳(メタデータ) (2026-03-09T07:59:17Z) - Offline Goal-conditioned Reinforcement Learning with Quasimetric Representations [72.24831946301613]
目標条件強化学習(GCRL)へのアプローチは、しばしば学習状態表現を用いて目標達成ポリシーを抽出する。
本稿では,この2つのフレームワークを,準計量表現空間(三角不等式)の構造と適切な追加制約を用いて統合し,最適ゴール獲得を可能にする後続表現を学習する手法を提案する。
提案手法は,* 準距離パラメータ化を用いて,* 準距離* と * 準距離* を学習し,* 準距離* と *stochastic* の環境においても,* 準距離* を学習することができる。
論文 参考訳(メタデータ) (2025-09-24T18:45:32Z) - APML: Adaptive Probabilistic Matching Loss for Robust 3D Point Cloud Reconstruction [16.82777427285544]
点クラウド予測タスクのためのディープラーニングモデルのトレーニングは、予測点と接地真実点の差を測定する損失関数に大きく依存する。
本稿では,一対一マッチングの完全微分可能近似である適応確率マッチング損失(APML)を提案する。
温度を解析的に計算して最小限の確率を保証し、手動チューニングを除去する。
論文 参考訳(メタデータ) (2025-09-09T19:31:06Z) - GeoMM: On Geodesic Perspective for Multi-modal Learning [55.41612200877861]
本稿では,マルチモーダル学習における測地線距離を新しい距離測定基準として導入する。
我々のアプローチは、現在のマルチモーダル学習に測地距離を適用するための包括的な戦略を取り入れている。
論文 参考訳(メタデータ) (2025-05-16T13:12:41Z) - Improving Video Retrieval by Adaptive Margin [18.326296132847332]
ビデオ検索の主流パラダイムは、正の対と負の対の類似性の間の距離を固定辺から切り離すことで、ビデオテキスト表現を学習する。
トレーニングに使用される負のペアはランダムにサンプリングされ、負のペア間のセマンティクスが関連あるいは等価であることを示している。
本稿では、上記の問題を解決するために、正対と負対の距離で変化した適応マージンを提案する。
論文 参考訳(メタデータ) (2023-03-09T08:07:38Z) - Variable Importance Matching for Causal Inference [73.25504313552516]
これらの目標を達成するためのModel-to-Matchと呼ばれる一般的なフレームワークについて説明する。
Model-to-Matchは、距離メートル法を構築するために変数重要度測定を使用する。
LASSO を用いて Model-to-Match フレームワークを運用する。
論文 参考訳(メタデータ) (2023-02-23T00:43:03Z) - Reinforcement Learning with a Terminator [80.34572413850186]
我々は, TerMDP のパラメータを学習し, 推定問題の構造を活用し, 状態ワイドな信頼境界を提供する。
我々はこれらを用いて証明可能な効率のよいアルゴリズムを構築し、終端を考慮し、その後悔を抑える。
論文 参考訳(メタデータ) (2022-05-30T18:40:28Z) - Boosting Continuous Sign Language Recognition via Cross Modality
Augmentation [135.30357113518127]
連続手話認識は不整合のビデオテキストペアを扱う。
クロスモーダル拡張を用いた新しいアーキテクチャを提案する。
提案するフレームワークは、既存のCTCベースの連続SLRアーキテクチャに容易に拡張できる。
論文 参考訳(メタデータ) (2020-10-11T15:07:50Z) - Towards Certified Robustness of Distance Metric Learning [53.96113074344632]
我々は,距離学習アルゴリズムの一般化とロバスト性を改善するために,入力空間に逆のマージンを付与することを提唱する。
アルゴリズム的ロバスト性の理論手法を用いることにより,拡張マージンは一般化能力に有益であることを示す。
論文 参考訳(メタデータ) (2020-06-10T16:51:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。