論文の概要: Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging
- arxiv url: http://arxiv.org/abs/2608.10447v1
- Date: Tue, 11 Aug 2026 04:01:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.894734
- Title: Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging
- Title(参考訳): モデルマージによるLCMベースのレコメンダシステムの効率的な推論に向けて
- Abstract要約: 大規模な言語モデルベースのレコメンダシステムは、予測を行う前にステップバイステップの推論を生成するスロー思考モデルの採用が増えている。
既存のトレーニングベースの圧縮推論アプローチは、しばしば相当な適応コストを発生させる。
我々は,レコメンデータシステムにおける圧縮の推論のための最初のモデルマージフレームワークを提案する。
- 参考スコア(独自算出の注目度): 40.437136371324875
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model-based recommender systems are increasingly adopting slow-thinking models that generate step-by-step reasoning before making predictions, often achieving higher accuracy than fast-thinking models that predict directly. However, their reasoning traces are often unnecessarily verbose, increasing inference costs without commensurate accuracy gains. Existing training-based approaches to reasoning compression often incur substantial adaptation costs, while inference-time methods are brittle and difficult to scale. These limitations motivate model merging as a promising training-free direction for transferring specialised behaviours between models in a shared parameter space. In particular, merging a slow-thinking model with a fast-thinking counterpart provides a natural mechanism for balancing recommendation accuracy and reasoning conciseness. To this end, we propose, to our knowledge, the first model merging framework for reasoning compression in recommender systems. Unlike conventional merging methods that apply uniform merge coefficients across model components, our method performs fine-grained merging at the level of individual attention heads, capturing heterogeneous patterns in recommendation reasoning. Each attention head is assigned a distinct merge coefficient according to its contribution to critical reasoning evidence and its sensitivity to parameter change, enabling selective injection of the concise behaviour of the fast-thinking model into the slow-thinking model and reducing reasoning verbosity without compromising recommendation quality. Experiments on three benchmark datasets show that our method reduces reasoning length by up to 24.3% while outperforming competitive model merging baselines in maintaining recommendation accuracy. The code is available at https://github.com/linhledieu/REAM.
- Abstract(参考訳): 大規模な言語モデルベースのレコメンダシステムは、予測を行う前にステップバイステップの推論を生成するスロー思考モデルを採用する傾向にあり、しばしば直接予測する高速思考モデルよりも高い精度を達成する。
しかし、それらの推論の痕跡は、しばしば不要に冗長であり、精度の向上なしに推論コストを増大させる。
既存のトレーニングベースの圧縮推論アプローチは、しばしば相当な適応コストを発生させるが、推論時間法は脆弱でスケールが難しい。
これらの制限は、モデル間の特別な振る舞いを共有パラメータ空間内で転送するための、有望なトレーニング不要な方向として、モデルのマージを動機付けている。
特に、スロー思考モデルと高速思考モデルを組み合わせることは、推奨精度と推論精度のバランスをとる自然なメカニズムを提供する。
この目的のために,我々は,提案システムにおける圧縮の推理のための最初のモデルマージフレームワークを提案する。
モデル成分に均一なマージ係数を適用した従来のマージ法とは異なり,本手法は個別のアテンションヘッドのレベルで細粒度マージを行い,不均一なパターンを抽出してレコメンデーション推論を行う。
各アテンションヘッドは、臨界推論エビデンスへの寄与とパラメータ変化に対する感受性に基づいて、異なるマージ係数を割り当て、高速思考モデルの簡潔な振る舞いを遅い思考モデルに選択的に注入し、推奨品質を損なうことなく推論冗長性を低下させることができる。
3つのベンチマークデータセットによる実験結果から,提案手法は提案精度を維持する上で,基準値のマージ性能を向上しつつ,推論長を最大24.3%削減することが示された。
コードはhttps://github.com/linhledieu/REAMで公開されている。
関連論文リスト
- Joint Model and Data Sparsification via the Marginal Likelihood [53.29070892356214]
本稿では,個々の特徴とサンプルの相違点を同時学習し,同時にモデルとデータスペーシングを実現することを提案する。
このモデルとデータの対称的なプルーニングは、共役を保存する自然な拡張を提供する。
多様な回帰タスクにわたる経験的結果は、共同ARDアプローチがスパースモデルとロバスト予測モデルの両方を一貫して生成することを確認した。
論文 参考訳(メタデータ) (2026-05-28T13:26:53Z) - enhancing reasoning accuracy in large language models during inference time [1.0282918759603745]
大規模言語モデル(LLM)は、多段階推論タスクでは信頼できないが、強力な言語能力を示すことが多い。
本研究では,LLMの推論精度を向上させるための推論時間手法について検討する。
論文 参考訳(メタデータ) (2026-03-22T16:00:07Z) - CAMEL: Confidence-Gated Reflection for Reward Modeling [26.908515245229747]
CAMELは、まず軽量なシングルトークン選択決定を行う信頼度の高いリフレクションフレームワークである。
提案手法は,プレフィックス強化による強化学習を通じて学習し,そのモデルに様々な初期判定を施し,真の修正を促す。
実証的に、CAMELは82.9%の平均精度で広く使用されている3つの報酬モデルベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-24T08:20:08Z) - PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations [52.67948063133533]
生成レコメンデーションは有望なパラダイムとして現れ、階層的なセマンティックIDよりもシーケンス・ツー・シーケンス生成タスクとしてレコメンデーションを改革している。
既存の手法は、セマンティックドリフト(Semantic Drift)と呼ばれる重要な問題に悩まされ、初期、高レベルのトークンのエラーは、生成軌道を無関係な意味部分空間に不可逆的に分散させる。
本稿では,高密度なステップバイステップ検証を生成モデルに統合する新しいフレームワークPromiseを提案する。
論文 参考訳(メタデータ) (2026-01-08T07:38:46Z) - Reasoning Pattern Alignment Merging for Adaptive Reasoning [48.347817456299104]
Reasoning Pattern Alignment Merging (RPAM)
RPAMは、クエリ適応推論を容易にする機能アライメントに基づく階層的なモデルマージフレームワークである。
広く使用されている7つの推論ベンチマークの実験により、RPAMは強い性能を維持しながら推論コストを大幅に削減することが示された。
論文 参考訳(メタデータ) (2026-01-07T01:36:39Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - STARec: An Efficient Agent Framework for Recommender Systems via Autonomous Deliberate Reasoning [54.28691219536054]
我々は、自律的な熟考的推論機能を備えたレコメンデータシステムを支援する、ゆっくり考えられた拡張エージェントフレームワークSTARecを紹介する。
我々は,先進的推論モデルと嗜好整合型報酬形成から構造化知識の蒸留を組み合わせた2段階のパラダイムであるアンカー強化訓練を開発する。
MovieLens 1MとAmazon CDsベンチマークの実験では、STARecは最先端のベースラインと比較して、大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-08-26T08:47:58Z) - Comparison of neural closure models for discretised PDEs [1.9230846600335954]
2つの既存の定理は、その短期的正確性に基づいて、神経閉鎖モデルの長期的正確性についての洞察を与える新しい方法で解釈される。
論文 参考訳(メタデータ) (2022-10-26T12:50:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。