論文の概要: Internalizing Multi-Agent Reasoning for Accurate and Efficient LLM-based Recommendation
- arxiv url: http://arxiv.org/abs/2602.09829v1
- Date: Tue, 10 Feb 2026 14:36:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-11 20:17:43.595975
- Title: Internalizing Multi-Agent Reasoning for Accurate and Efficient LLM-based Recommendation
- Title(参考訳): 高精度かつ効率的なLCMリコメンデーションのためのマルチエージェント推論
- Abstract要約: LLM(Large Language Models)は、幅広い世界の知識と意味論的推論を活用して、ユーザの意図を解釈することでレコメンデーションシステムを再構築している。
単エージェント軌道アライメントレコメンダ(STAR)を開発するための軌道駆動型内部化フレームワークを提案する。
- 参考スコア(独自算出の注目度): 22.9032468841993
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are reshaping recommender systems by leveraging extensive world knowledge and semantic reasoning to interpret user intent. However, effectively integrating these capabilities with collaborative signals while avoiding prohibitive inference latency remains a critical bottleneck. To address this, we propose a trajectory-driven internalization framework to develop a Single-agent Trajectory-Aligned Recommender (STAR). Specifically, to internalize complex reasoning capabilities into a single efficient model, we first design a multi-agent teacher system capable of multi-turn tool usage and reflection. This teacher utilizes a Collaborative Signal Translation mechanism to explicitly convert latent behavioral patterns into descriptive natural language evidence to enhance reasoning accuracy. Subsequently, a trajectory-driven distillation pipeline transfers this agentic logic, including planning, tool usage, and self-reflection, into the compact STAR model. Extensive experiments demonstrate that STAR surpasses its teacher by 8.7% to 39.5% while eliminating iterative latency, paving the way for real-time, reasoning-enhanced recommendation.
- Abstract(参考訳): LLM(Large Language Models)は、幅広い世界の知識と意味論的推論を活用して、ユーザの意図を解釈することでレコメンデーションシステムを再構築している。
しかし、これらの機能を協調的な信号と効果的に統合し、禁忌な推論レイテンシを回避することは、依然として重大なボトルネックである。
そこで本稿では,Single-agent Trajectory-Aligned Recommender (STAR) を開発するためのトラジェクトリ駆動型内部化フレームワークを提案する。
具体的には、複雑な推論能力を単一の効率的なモデルに内在化するために、まずマルチターンツールの使用とリフレクションが可能なマルチエージェント教師システムを設計する。
この教師は、協調信号翻訳機構を用いて、潜在行動パターンを記述的な自然言語証拠に明示的に変換し、推論精度を高める。
その後、軌道駆動蒸留パイプラインは、計画、ツールの使用、自己回帰を含むこのエージェントロジックをコンパクトなSTARモデルに転送する。
広範囲にわたる実験により、STARは教師を8.7%から39.5%上回り、反復的な遅延を排除し、リアルタイムな推論を推奨する道を開いた。
関連論文リスト
- SelfDR: Self-Distillation from Reasoning for LLM-Based Recommendation [20.66655178579704]
SelfDR は LLM ベースのレコメンデーションのための自己蒸留フレームワークである。
LLM独自の推論を蒸留し、直接レコメンデーションを生成する。
すべてのコンポーネントは同じベースLLM上に構築され、外部モデルに依存しない。
論文 参考訳(メタデータ) (2026-09-03T03:05:17Z) - Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence [70.8951332710039]
マルチモーダル大言語モデル (MLLM) は複雑な空間的シーン理解と推論タスクにおいて有意な可能性を証明している。
しかし、彼らのオープンな推論プロセスは、意思決定の誤りやエラーの蓄積を招きやすいため、回答の品質が不安定になる。
本稿では,推論過程において動的に介入し,偏差を補正するアドバンテージ誘導型ゲーティングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T07:46:04Z) - TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning [3.2829140652979647]
セマンティックID(SID)を用いたジェネレーティブレコメンデーション(ジェネレーティブレコメンデーション)が,有望なパラダイムとして浮上している。
既存の手法では、すべてのユーザ履歴に一様に、高速なダイレクトジェネレーションまたは遅いチェーン・オブ・シークレット推論の固定推論戦略を適用している。
本稿では,ユーザシーケンス毎に推論作業を適応的に割り当てることを学ぶフレームワークであるThink Fast,Think Slow, Then Actを提案する。
論文 参考訳(メタデータ) (2026-05-12T05:35:00Z) - SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents [35.45207852488779]
本稿では,ツールメモリをベースとした自己進化型エージェントフレームワークSEARLを紹介する。
インタラクションエクスペリエンスを直接利用するアプローチとは異なり,本手法では,計画と実行を統合する構造化されたエクスペリエンスメモリを構築している。
我々は,知識推論と数学タスクの枠組みを評価し,より実践的で効率的な学習を実現する上での有効性を実証した。
論文 参考訳(メタデータ) (2026-04-09T04:38:47Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation [63.74915464611075]
RecThinkerはツール拡張推論を推奨するエージェントフレームワークである。
我々はRecThinker専用のツール群を開発し、モデルがユーザアイテム側および協調的な情報を取得することを可能にする。
論文 参考訳(メタデータ) (2026-03-10T16:07:17Z) - Agentic Spatio-Temporal Grounding via Collaborative Reasoning [80.83158605034465]
時間的ビデオグラウンド(Temporal Video Grounding)は、テキストクエリが与えられたビデオ内の対象物または人の時間的チューブを検索することを目的としている。
本稿では,STVGの課題に対して,オープンワールドおよびトレーニングフリーシナリオに向けたエージェント時空間グラウンド(ASTG)フレームワークを提案する。
具体的には、現代多言語モデル(MLLM)を活用した2つの特殊エージェントSRA(Spatial Reasoning Agent)とTRA(Temporal Reasoning Agent)である。
人気のあるベンチマークの実験は、既存の弱教師付きおよびゼロショットアプローチをマージンで上回る提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2026-02-10T10:16:27Z) - Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models [23.128973540926552]
内因性再増殖は、モデルの理解を明確な生成的推論ステップに変換する。
評価精度,再現効率,生成品質において,SEERは一貫して最先端のベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-01-28T06:54:36Z) - RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering [62.63376387138257]
本稿では,アクティベーション空間における大規模言語モデル(LLM)推論を適応的に制御するプラグイン・アンド・プレイ介入フレームワークを提案する。
RISERは再利用可能な推論ベクトルのライブラリを構築し、軽量ルータを使用して各入力に対して動的に構成する。
ルーターは、タスクレベルの報酬の下で強化学習を通じて最適化され、緊急かつ構成的な方法で潜在する認知的プリミティブを活性化する。
論文 参考訳(メタデータ) (2026-01-14T08:04:33Z) - PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models [51.43746425777865]
大規模言語モデル(LLM)は、しばしばグローバル戦略を定式化する能力に欠けており、長い水平タスクにおけるエラーの伝播につながる。
PILOTは,大規模モデルの戦略的監視を本質的な潜伏誘導に内部化するためのフレームワークである。
論文 参考訳(メタデータ) (2026-01-07T12:38:56Z) - Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent [10.571643330948858]
SuperIntelliAgentは、学習可能な小さな拡散モデル(学習者)と凍結した大言語モデル(検証者)を結合するエージェント学習フレームワークである。
従来の教師付き微調整とは異なり、SuperIntelliAgentはアノテーションなしで自律的に学習する。
トレーニング可能な学習者と推論可能な検証器をペアリングすることは、知性を成長させる最小限の信頼性単位となると仮定する。
論文 参考訳(メタデータ) (2025-11-28T18:32:49Z) - Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting [92.57796055887995]
本稿では,言語モデルエージェントの強化学習から後視体験のリプレイに適応するプロンプトフレームワークECHOを紹介する。
ECHOは失敗した試みで達成できた代替目標のために最適化された軌道を生成する。
我々は、テキストベースのナビゲーションと計画ベンチマークであるXMiniGridのステートフルバージョンと、協調的な情報収集企業シミュレーションであるPeopleJoinQAについて、ECHOを評価した。
論文 参考訳(メタデータ) (2025-10-11T18:11:09Z) - From What to Why: Thought-Space Recommendation with Small Language Models [2.134948383299948]
大規模言語モデル(LLM)は推論の強化を通じて高度なレコメンデーション機能を備えているが、実際のデプロイメントには大きな課題がある。
SLM(Small Language Models)は効率的な代替手段を提供するが、推奨する推論機能は未検討のままである。
PULSE(Preference Understanding by Latent Semantic Embeddings)は,SLM生成論理をディレクター学習信号として扱うフレームワークである。
論文 参考訳(メタデータ) (2025-10-08T11:22:26Z) - STARec: An Efficient Agent Framework for Recommender Systems via Autonomous Deliberate Reasoning [54.28691219536054]
我々は、自律的な熟考的推論機能を備えたレコメンデータシステムを支援する、ゆっくり考えられた拡張エージェントフレームワークSTARecを紹介する。
我々は,先進的推論モデルと嗜好整合型報酬形成から構造化知識の蒸留を組み合わせた2段階のパラダイムであるアンカー強化訓練を開発する。
MovieLens 1MとAmazon CDsベンチマークの実験では、STARecは最先端のベースラインと比較して、大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-08-26T08:47:58Z) - Training Agents with Weakly Supervised Feedback from Large Language Models [19.216542820742607]
本稿では,批判的LSMからの弱教師付き信号を用いたLSMエージェントの新しいトレーニング手法を提案する。
エージェントは反復的に訓練され、まず環境相互作用を通じて軌道を生成する。
API-bankデータセットのテストでは、エージェントの能力とGPT-4に匹敵するパフォーマンスが一貫して改善されている。
論文 参考訳(メタデータ) (2024-11-29T08:47:04Z) - DRDT: Dynamic Reflection with Divergent Thinking for LLM-based
Sequential Recommendation [53.62727171363384]
進化的思考を伴う動的反射(Dynamic Reflection with Divergent Thinking)という新しい推論原理を導入する。
我々の方法論はダイナミックリフレクション(動的リフレクション)であり、探索、批評、反射を通じて人間の学習をエミュレートするプロセスである。
6つの事前学習 LLM を用いた3つのデータセットに対するアプローチの評価を行った。
論文 参考訳(メタデータ) (2023-12-18T16:41:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。