論文の概要: Bandits via Additive Quantized Representations
- arxiv url: http://arxiv.org/abs/2610.02440v1
- Date: Thu, 01 Oct 2026 20:07:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.075212
- Title: Bandits via Additive Quantized Representations
- Title(参考訳): 加算量子化表現による帯域幅
- Abstract要約: 文脈帯域幅は非線形報酬モデリングとオンライン効率のバランスを必要とする。
本稿では,このギャップを埋める表現層としてResidual Quantization (RQ)を提案する。
RQの変種は13のデータセットのうち11つでRQ以外の変種に勝っている。
- 参考スコア(独自算出の注目度): 7.473403705625741
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contextual bandits require balancing nonlinear reward modeling with online efficiency. Tree ensembles and neural methods capture nonlinearities but require periodic retraining and large replay buffers. Linear models update efficiently per observation with O(1) memory, but are fundamentally restricted to linear reward structures. We propose Residual Quantization (RQ) as a representation layer to bridge this gap. An offline-trained RQ codebook maps continuous contexts into discrete centroid assignments across multiple levels, set dynamically through a shadow mechanism. This enables a spectrum of additive bandit algorithms that achieve nonlinear expressivity with strictly bounded memory. Across 13 datasets, RQ variants beat their non-RQ counterparts on 11 of 13 datasets, often by wide margins, while matching doubling-retrain XGBoost and neural baselines using up to 1000 times less memory.
- Abstract(参考訳): 文脈帯域幅は非線形報酬モデリングとオンライン効率のバランスを必要とする。
ツリーアンサンブルとニューラルメソッドは非線形性をキャプチャするが、周期的なリトレーニングと大きなリプレイバッファを必要とする。
線形モデルはO(1)メモリで観測毎に効率的に更新されるが、基本的に線形報酬構造に制限される。
本稿では,このギャップを埋める表現層としてResidual Quantization (RQ)を提案する。
オフラインでトレーニングされたRQコードブックは、連続したコンテキストを複数のレベルにわたる個別のセントロイド割り当てにマッピングし、シャドウメカニズムを通して動的に設定する。
これにより、厳密なメモリ境界を持つ非線形表現性を実現する付加的帯域幅アルゴリズムのスペクトルが実現される。
13のデータセットにまたがって、RQの変種は13のデータセットのうち11の非RQの変種を、最大1000倍のメモリで2倍のXGBoostとニューラルベースラインをマッチングしながら、大きなマージンで上回った。
関連論文リスト
- From Redundancy to Minimality: Fixed-Point-Guided Hierarchical Reduction of Learned Piecewise-Linear Dynamics [0.6605210585717246]
ほぼ線形リカレントニューラルネットワーク(AL-RNN)は、ReLU非線形性を用いるユニットのサブセットのみを含む、一方向リカレントニューラルネットワークである。
本稿では,選択したReLU単位を段階的に線形化する固定点誘導階層化手法を提案する。
我々は、$Q$異なる固定点を再現するには少なくとも$Q$FPを含むシンボルが必要であることを証明している。
論文 参考訳(メタデータ) (2026-10-01T09:39:25Z) - ConvMem: Convolutional Memory for Long-Context Reasoning [18.597196274231553]
ConvMemは、長文推論を階層的な畳み込みとして再構成する、トレーニング不要で高度に並列化可能なフレームワークである。
ConvMemはトレーニング不要のベースラインよりも優れており、分散タスクにおけるパラメトリックな事前処理に過度に適合するリスクを回避している。
論文 参考訳(メタデータ) (2026-09-09T16:53:02Z) - HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees [10.936836651826722]
HARTS (Hybrid-Attention RL over Tree Structures) について述べる。
HarTSは、実際のハイブリッドアテンションモデル上で任意のロールアウトツリープレフィックス共有スピードアップを示す最初のシステムである。
論文 参考訳(メタデータ) (2026-08-28T10:18:54Z) - Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion [61.57938553036056]
ARL2は、二次的なクロスフレームアテンションを固定サイズのリカレント状態に置き換えるハイブリッドアテンションモジュールである。
本研究では,フレーム内ソフトマックスブランチとフレーム間リカレント線形ブランチの2つに分割し,ストリームコンテキストの固定サイズ状態を維持する。
75%の層がハイブリッドリニアアテンションに置き換えられ、最大2.26ウォールクロックのスピードアップと54%のメモリ削減を実現した。
論文 参考訳(メタデータ) (2026-05-15T19:33:45Z) - Temporal Credit Is Free [0.0]
リカレントネットワークは、オンラインで適応するためにジャコビアン伝播を必要としない。
beta2は、勾配が出力バイパスなしで非線形状態更新を通らなければならない場合に必要である。
10のアーキテクチャ、真のプリミレートニューラルネットワーク、ストリーミングMLベンチマーク、RMSpropとの即時微分は完全なRTRLと一致し、1000倍のメモリでn = 1024にスケールする。
論文 参考訳(メタデータ) (2026-03-30T17:54:55Z) - Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation [61.67090981767583]
本研究では,Mixture-of-Recursions (MoR)を導入した。
MoRはパラメータ効率を達成するために再帰ステップをまたいだ共有レイヤのスタックを再利用し、軽量ルータは適応トークンレベルの思考を可能にする。
また、メモリフットプリントをさらに削減するために、KVペアを最初の再帰から再利用するKV共有変種を提案する。
論文 参考訳(メタデータ) (2025-07-14T17:49:00Z) - Unfolding Projection-free SDP Relaxation of Binary Graph Classifier via
GDPA Linearization [59.87663954467815]
アルゴリズムの展開は、モデルベースのアルゴリズムの各イテレーションをニューラルネットワーク層として実装することにより、解釈可能で類似のニューラルネットワークアーキテクチャを生成する。
本稿では、Gershgorin disc perfect alignment (GDPA)と呼ばれる最近の線形代数定理を利用して、二進グラフの半定値プログラミング緩和(SDR)のためのプロジェクションフリーアルゴリズムをアンロールする。
実験結果から,我々の未学習ネットワークは純粋モデルベースグラフ分類器よりも優れ,純粋データ駆動ネットワークに匹敵する性能を示したが,パラメータははるかに少なかった。
論文 参考訳(メタデータ) (2021-09-10T07:01:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。