論文の概要: Selective State-Space Adaptation and Retrieval for Language Model Reasoning
- arxiv url: http://arxiv.org/abs/2607.19326v1
- Date: Tue, 21 Jul 2026 17:47:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.519451
- Title: Selective State-Space Adaptation and Retrieval for Language Model Reasoning
- Title(参考訳): 言語モデル推論のための選択的状態空間適応と検索
- Abstract要約: 2つの相補的な粒度で選択的な状態空間再帰を導入するアダプタ群が提案されている。
textbfMaLoRA (Mamba-modulated Low-rank adaptation) は、アダプタのスケーリング係数をトークン間での繰り返し状態を持つ動的入力依存関数にする。
- 参考スコア(独自算出の注目度): 5.8120627413404184
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Low-rank adaptation introduces a static learned update applied identically to every input. The update provides task-level adaptation but does not explicitly represent token-level or instance-level state variation. A family of adapters is proposed that introduces selective state-space recurrence at two complementary granularities. At the token level, \textbf{MaLoRA} (Mamba-modulated low-rank adaptation) makes the adapter's scaling factor a dynamic input-dependent function with recurrent state across tokens, in contrast to the stateless modulators of prior work. At the context level, \textbf{MaRA} (Mamba Retrieval Adapter) tracks cross-segment state and selects the segments most relevant to the query, before the modulated language model generates its answer. Across three frozen backbones (Qwen-2.5-7B, Llama-3.1-8B, Gemma-2-9B) and two reasoning benchmarks (MuSiQue, 2WikiMultihopQA), the family improves reasoning accuracy on every cell of the $3{\times}2$ grid, by $+6.8$ F1 ($+10.5\%$ relative) on average and up to $+9.3$ F1 ($+18.2\%$ relative) on the hardest cell over the LoRA baseline, and the token-level gains carry to RULER QA-2 under length stress.
- Abstract(参考訳): 低ランク適応では、すべての入力に同じ方法で適用された静的な学習更新が導入される。
このアップデートはタスクレベルの適応を提供するが、トークンレベルやインスタンスレベルの状態変化を明示的に表現していない。
2つの相補的な粒度で選択的な状態空間再帰を導入するアダプタ群が提案されている。
トークンレベルでは、 \textbf{MaLoRA} (Mamba-modulated Low-rank adaptation) は、前処理のステートレス変調子とは対照的に、アダプタのスケーリング係数をトークン間の再帰状態を持つ動的入力依存関数にする。
文脈レベルでは、修飾言語モデルが応答を生成する前に、 \textbf{MaRA} (Mamba Retrieval Adapter) はクロスセグメント状態を追跡し、クエリに最も関連するセグメントを選択する。
3つの冷凍バックボーン (Qwen-2.5-7B, Llama-3.1-8B, Gemma-2-9B) と2つの推論ベンチマーク (MuSiQue, 2WikiMultihop QA) の間に、平均で$6.8$ F1 (+10.5\%$ relative) と$9.3$ F1 (+18.2\%$ relative) の3つのフリーズバックボーン (Qwen-2.5-7B, Llama-3.1-8B, Gemma-2-9B) と2つの推論ベンチマーク (MuSiQue, 2WikiMultihop QA) により、平均で$6.8$ F1 (+10.5\%$ relative) と$9.3$ F1 (+18.2\%$ relative) が向上し、トークンレベルの利得はRULER QA-2に長引かれる。
関連論文リスト
- CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training [19.798998515276523]
強化学習は、オープンエンド命令をプロンプト固有の柔軟なルーリックに分解する。
静的なルーリックは 必然的にハックされる ポリシーが進化するにつれて
我々は、高品質なアンカー応答において、すべてのルーブリック進化ステップを基盤とする$textbfCARE$を提案する。
論文 参考訳(メタデータ) (2026-09-01T08:22:12Z) - Fast Weight Attention for Continual Learning [75.34672054079408]
リカレント高速記憶と選択状態空間モデルは、拡張コンテキストを固定サイズのリカレント状態に圧縮する。
正則化された二乗誤差回帰と負の内積目標の1次更新を導出する。
我々は、数値的に安定な正のデカイ再正規化とともに、繰り返し、マスクパラレル、チャンクパラレル形式を提供する。
論文 参考訳(メタデータ) (2026-08-27T22:55:11Z) - StereoFactory: A Unified Merging Framework for Robust Stereo Matching [61.973843344605655]
ステレオマッチングは、大規模なデータセットでトレーニングされた基礎モデルを通じて進歩しているが、このパラダイムはスケーラビリティのボトルネックに悩まされている。
モデルマージは、ソースチェックポイントが利用可能になった後、特別なモデルからの知識を統合することで、スケーラブルなポストホックな代替手段を提供する。
本稿では,適応モデルマージのための粗大な進化的フレームワークであるStereoFactoryを提案する。
論文 参考訳(メタデータ) (2026-06-16T03:36:59Z) - Scaling Laws for Behavioral Foundation Models over User Event Sequences [2.924581427482972]
本稿では、共通の2部分の振る舞いモデルアーキテクチャ、特徴ベースのイベント埋め込み、デコーダのみの変換器について検討する。
約600回にわたって、実際のインタラクションデータで動作し、トレーニング用FLOPは1015ドルから1019ドルの範囲で、デプロイ関連軸が4つあります。
計算最適トレーニングは低計算時のテキストと比較してデータ量が多いが、計算量が増加するにつれて、そのD/N$比はチンチラに向かう。
論文 参考訳(メタデータ) (2026-06-03T15:59:25Z) - LoMETab: Beyond Rank-1 Ensembles for Tabular Deep Learning [0.2999888908665658]
我々は、乗法的暗黙のアンサンブルのランク-$r$の一般化であるLoMETabを提案する。
LoMETabはランク-1のBatchEnsemble/TabM変調をランク-r$のID-Residual Adamardファミリーに引き上げる。
実験により,この付加能力はトレーニング後の測定可能な予測多様性として現れることが示された。
論文 参考訳(メタデータ) (2026-05-14T04:47:16Z) - Learning Adaptive LLM Decoding [6.643962667713069]
我々は、利用可能な計算資源に基づいて、推論時にサンプリング戦略を動的に選択する適応型復号法を学習する。
我々は、強化学習と検証可能な端末報酬で訓練された軽量デコードアダプタを導入する。
実験により、学習したアダプタは精度と予算のトレードオフを改善することが示された。
論文 参考訳(メタデータ) (2026-03-10T01:15:26Z) - A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning [40.6234318894435]
大規模言語モデルは、推論中心のLLMとエージェントのLLMの2つのファミリーに分けられた。
この分割は、基本的に異なるトレーニング目標から生じ、単純なクエリに対して不一致の強度と非効率をもたらす。
本稿では,アダプティブ・エージェント・ファンデーション・モデル (A$2$FM) を提案する。
論文 参考訳(メタデータ) (2025-10-13T17:08:25Z) - WeightLoRA: Keep Only Necessary Adapters [76.32368157312477]
低ランク適応(texttLoRA$)は、指定されたレイヤにトレーニング可能なアダプタを追加する。
我々は、最も重要な$textttLoRA$ヘッダの適応的な選択によってこの問題を克服する新しい方法である$textttWeightLoRA$を提案する。
我々は、一連の競合ベンチマークとDeBERTa、BART、Llamaモデルの実験を行い、我々の手法を異なる適応的アプローチと比較した。
論文 参考訳(メタデータ) (2025-06-03T10:33:16Z) - Adaptive Thinking via Mode Policy Optimization for Social Language Agents [75.3092060637826]
動的社会的相互作用における言語エージェントの適応的思考能力を改善するための枠組みを提案する。
本フレームワークは,(1)多言語思考モード設計,(2)コンテキスト認識モード切り替え,(3)深度適応処理によるトークン効率推論の3つの重要な側面において,既存の研究を推し進めている。
論文 参考訳(メタデータ) (2025-05-04T15:39:58Z) - Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass [109.34230156454574]
大規模言語モデル(LM)は一般的に、新しい文脈におけるパフォーマンスを改善するために適応される。
微調整によってトレーニングコストが大幅に増加し、推論オーバーヘッドが増加する。
我々は、新しいコンテキストを低ランクLMアダプタに直接マッピングする効率的で効率的な適応手法である$GenerativeAdapter$を紹介した。
論文 参考訳(メタデータ) (2024-11-08T00:42:47Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - A Variational Hierarchical Model for Neural Cross-Lingual Summarization [85.44969140204026]
言語間の要約(英: cross-lingual summarization)とは、ある言語の文書を別の言語の要約に変換することである。
CLSに関する既存の研究は主にパイプライン手法の利用やエンドツーエンドモデルの共同トレーニングに重点を置いている。
条件付き変分自動エンコーダに基づくCLSタスクの階層モデルを提案する。
論文 参考訳(メタデータ) (2022-03-08T02:46:11Z) - Robust Training of Neural Networks using Scale Invariant Architectures [70.67803417918854]
SGDとは対照的に、Adamのような適応勾配法は、現代のディープネットワークの堅牢なトレーニングを可能にする。
この一般的なアプローチは、パラメータと損失の再スケーリングに頑健であることを示す。
我々は、単にバニラSGDで訓練された場合、Adamのような適応的な手法で訓練されたBERTに匹敵する性能を達成する、SIBERTと呼ばれるスケール不変バージョンのBERTを設計する。
論文 参考訳(メタデータ) (2022-02-02T11:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。