論文の概要: Vector Symbolic Policy Gradient
- arxiv url: http://arxiv.org/abs/2608.18404v1
- Date: Wed, 19 Aug 2026 00:19:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.238766
- Title: Vector Symbolic Policy Gradient
- Title(参考訳): ベクトルシンボリックポリシーのグラディエント
- Abstract要約: 本稿では,Vector-Symbolic Policy Gradient (VSPG) が単位ノルムハイパーベクターによって各アクションを表現し,符号化されたVSP状態と類似度で評価することを示す。
また,各トレーニングされた動作ハイパーベクタが固定サイズ圧縮されたカーネルメモリであり,訪問状態に対するアドバンテージ重み付きカーネル拡張を格納し,エンコーダによる類似性に応じてエビデンスを転送することを示す。
- 参考スコア(独自算出の注目度): 15.294016355915373
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We answer this question with Vector-Symbolic Policy Gradient (VSPG), a discrete-action actor that represents each action by a unit-norm hypervector and scores it by similarity to the encoded state. Under the standard softmax policy-gradient surrogate, we prove that its update is exactly advantage-weighted hypervector bundling followed by normalization, and therefore supports standard advantage estimators. We further show that each trained action hypervector is a fixed-size compressed kernel memory, storing an advantage-weighted kernel expansion over visited states and transferring evidence according to the encoder-induced similarity. This provides a concrete mechanism that can support sample-efficient learning without increasing inference-time memory. Finally, for bipolar action memories, we prove that greedy action selection is stable under random bit flips, with failure probability decaying exponentially in the hypervector dimension. VSPG thus connects VSA action memories, log-linear policy gradients, and kernel policy search while providing a quantitative robustness guarantee.
- Abstract(参考訳): 我々は,各アクションを単位ノルムハイパーベクターで表現し,符号化された状態と類似度で評価する離散アクションアクタであるベクター・シンボリックポリシーグラディエント(VSPG)を用いて,この問題に答える。
標準ソフトマックスポリシー勾配サロゲートの下では、その更新が完全に有利なハイパーベクターバンドルであり、正規化が続くことを証明し、したがって標準優位推定器をサポートする。
さらに、各トレーニングされた動作ハイパーベクタが固定サイズ圧縮カーネルメモリであり、訪問状態に対するアドバンテージ重み付きカーネル拡張を記憶し、エンコーダによる類似性に応じてエビデンスを転送することを示す。
これは、推論時間メモリを増大させることなく、サンプル効率のよい学習を支援する具体的なメカニズムを提供する。
最後に、双極性動作記憶の場合、グリージー動作選択はランダムビットフリップの下で安定であり、失敗確率は超ベクトル次元で指数関数的に減衰することを示す。
VSPGは、VSAアクションメモリ、ログリニアポリシーグラデーション、カーネルポリシー検索を接続し、定量的な堅牢性を保証する。
関連論文リスト
- EchoRec: Multi-Item Prediction-Empowered Generative Recommendation via Cycle-Consistent Preference Alignment [57.08595331216049]
生成レコメンデーションは、ターゲット項目のセマンティックIDを自己回帰的に生成し、共有トークン空間内の嗜好モデリングとインデックス検索を統合する。
近年の試行ではMTP(Multi-Token Prediction)を導入しているが、その効率性は主に継承され、密集した監視対象としての可能性は未解明のままである。
提案するEchoRecは,マルチホライゾンにまたがるサイクル一貫性の全体的嗜好アライメントをMPPに付与し,生成的レコメンデーションを実現する。
論文 参考訳(メタデータ) (2026-08-14T06:59:12Z) - Synthesizing Probabilistic Saturating Counters with Differentially Private Formal Guarantees [17.565026214071057]
分岐予測器は現代のプロセッサの命令レベルの並列性を改善する。
古典的な飽和カウンターは決定論的であり、サイドチャネル攻撃に対して脆弱である。
確率飽和カウンタ(PSC)は、カウンタ更新をランダムにすることで、このリークを軽減するために提案されている。
論文 参考訳(メタデータ) (2026-08-11T05:51:27Z) - Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching [42.26405543045843]
アクションベースのポリシー圧縮(APC)は、サンプル非効率であると広く認識されている。
我々は,行動表現を即時的行動マッチングから長期的状態空間カバレッジにシフトさせることにより,APCを向上させるOccupancy-based Policy Compression (OPC)を紹介した。
これらの修正により、生成モデルは真の機能的類似性を取り巻く潜在空間を整理し、幅広い振る舞いを一般化する潜在表現を促進する。
論文 参考訳(メタデータ) (2026-03-27T23:16:27Z) - VAE with Hyperspherical Coordinates: Improving Anomaly Detection from Hypervolume-Compressed Latent Space [56.362776482614976]
変分オートエンコーダ(VAE)は、これらのベクトルをデータに復号する前に、データを低次元の潜在ベクトルに符号化する。
本稿では,超球面座標を用いてVAEの潜伏変数を定式化し,超球面上の所定の方向に向かって潜伏ベクトルを圧縮する手法を提案する。
これにより、VAEの完全な教師なしおよびOOD異常検出能力が向上し、検討したデータセット上で最高のパフォーマンスを達成できることが示される。
論文 参考訳(メタデータ) (2026-01-25T03:10:24Z) - Advancing Generalized Transfer Attack with Initialization Derived Bilevel Optimization and Dynamic Sequence Truncation [49.480978190805125]
転送攻撃はブラックボックスアプリケーションに大きな関心を惹きつける。
既存の作業は、本質的に単一のレベルの目的 w.r.t. シュロゲートモデルを直接最適化する。
本稿では,上位レベル(UL)と下位レベル(LL)のサロゲート攻撃とのネスト関係を明示的に再構築する2レベル最適化手法を提案する。
論文 参考訳(メタデータ) (2024-06-04T07:45:27Z) - Solving Non-Rectangular Reward-Robust MDPs via Frequency Regularization [39.740287682191884]
ロバストマルコフ決定過程(RMDP)では、報酬と遷移ダイナミクスは与えられた不確実性集合にあると仮定される。
このいわゆる長方性条件は、単に計算上の問題によって動機付けられている。
政策段階の手法を導入し,その収束性を証明する。
論文 参考訳(メタデータ) (2023-09-03T07:34:26Z) - FORESEE: Prediction with Expansion-Compression Unscented Transform for
Online Policy Optimization [8.97438370260135]
本研究では,オンライン政策最適化問題のクラスを解くために,拡張圧縮アンセント変換(Expansion-Compression Unscented Transform)と呼ばれる状態予測手法を提案する。
提案アルゴリズムは状態依存分布を通じて有限個のシグマ点を伝播し,各段階におけるシグマ点数の増加を規定する。
その性能はモンテカルロに匹敵するが、計算コストははるかに低い。
論文 参考訳(メタデータ) (2022-09-26T12:47:08Z) - High-order Tensor Pooling with Attention for Action Recognition [39.22510412349891]
ニューラルネットワークによって形成される特徴ベクトルの高次統計値を取得する。
テンソル記述子を形成するために,エンドツーエンドの2次・高次プールを提案する。
論文 参考訳(メタデータ) (2021-10-11T12:32:56Z) - A Precise Performance Analysis of Support Vector Regression [105.94855998235232]
我々は,n$の線形測定に応用したハードおよびソフトサポートベクター回帰法について検討した。
得られた結果は、ハードおよびソフトサポートベクトル回帰アルゴリズムの設計に介入するパラメータを最適に調整するために使用される。
論文 参考訳(メタデータ) (2021-05-21T14:26:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。