論文の概要: Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2608.03148v1
- Date: Tue, 04 Aug 2026 05:26:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.043523
- Title: Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation
- Title(参考訳): 移動型検索型生成のための軽量チャンク選択
- Authors: Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu,
- Abstract要約: 証拠アライメント問題として軽量RAGチャンク選択について検討する。
我々のセレクタは、3つの補完的特徴源を組み合わせる: LLM側のクエリ意図を表す質問隠蔽状態、ジェネレータの内部ルーティング構造をキャプチャするMoEルーティングに基づくエキスパート信号、および候補側のエビデンスを保存したチャンク埋め込み。
実験の結果、提案したセレクタは、モバイル適用可能なベースラインに対するランク1のエビデンス選択を平均2.5%改善することがわかった。
- 参考スコア(独自算出の注目度): 8.227745781139634
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: RAG improves the factual grounding of LLM by incorporating external knowledge, but deploying RAG on mobile and edge devices remains challenging because retrieved context increases computation and memory. A direct way to reduce this cost is to retain only one retrieved chunk before generation, but the top-ranked retrieved chunk is not always the most evidence-supporting one, since retrieval similarity does not necessarily imply evidential sufficiency. Existing context-reduction methods can improve context quality, but often require additional LLMs or compressors that are costly under a strict mobile budget. In this paper, we study lightweight RAG chunk selection as an evidence-alignment problem. Our selector combines three complementary feature sources: question hidden states that represent LLM-side query intent, MoE routing-derived expert signals that capture the generator's internal routing structure, and retrieved chunk embeddings that preserve candidate-side evidence geometry. A compact multilayer perceptron maps these features to an evidence prototype in the chunk embedding space, and the candidate most aligned with this prototype is selected by cosine similarity. For stricter deployment budgets, we further introduce an optional task-aware feature selection strategy to reduce the selector input dimension. To support supervised evaluation, we construct semantic chunk-correctness labels based on evidence sufficiency rather than answer-string containment. Experiments show that the proposed selector consistently improves rank-1 evidence selection over mobile-applicable baselines by an average of 2.5%. These results suggest that using LLM-side query representations and MoE routing information and aligning them with retrieval-side candidate embedding is an effective and parameter-efficient strategy for mobile-applicable RAG chunk selection.
- Abstract(参考訳): RAGは外部知識を取り入れてLCMの現実的な基盤を改善するが、検索したコンテキストが計算とメモリを増加させるため、モバイルおよびエッジデバイスにRAGをデプロイすることは依然として困難である。
このコストを削減する直接的な方法は、生成前に取得したチャンクを1つだけ保持することであるが、検索類似性は必ずしも明確でないため、トップランクのチャンクは最もエビデンスをサポートするチャンクであるとは限らない。
既存のコンテキスト推論手法は、コンテキスト品質を改善することができるが、しばしば、厳格なモバイル予算の下でコストがかかる追加のLCMや圧縮機を必要とする。
本稿では,RAGチャンク選択をエビデンスアライメント問題として検討する。
我々のセレクタは、3つの補完的特徴源を組み合わせる: LLM側のクエリ意図を表す質問隠蔽状態、ジェネレータの内部ルーティング構造をキャプチャするMoEルーティングに基づくエキスパート信号、および候補側のエビデンスを保存したチャンク埋め込み。
コンパクトな多層パーセプトロンは、これらの特徴をチャンク埋め込み空間におけるエビデンスプロトタイプにマッピングし、このプロトタイプに最も適合する候補はコサイン類似性によって選択される。
より厳格なデプロイメント予算のために、セレクタの入力寸法を減らすために、オプションのタスク対応機能選択戦略を導入する。
教師付き評価を支援するために,回答文字列の囲い込みよりも証拠の十分性に基づく意味的チャンク正当性ラベルを構築した。
実験の結果、提案したセレクタは、モバイル適用可能なベースラインに対するランク1のエビデンス選択を平均2.5%改善することがわかった。
これらの結果は,LLM側クエリ表現とMoEルーティング情報を用いて,検索側候補埋め込みと整合させることが,モバイル対応RAGチャンク選択に有効かつパラメータ効率の高い戦略であることを示唆している。
関連論文リスト
- Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors [69.75895255395702]
MLLMの検証選択抽出層におけるクロスモーダルな注意は、自己回帰生成を必要とせずに、クエリ関連フレーム証拠を既に提供している。
2Bパラメータしか持たない軽量MLLMセレクタは、クエリ条件アグリゲーションにより、選択した層注目値を関連スコアに変換することにより、フレームレベルのエビデンスを抽出することができる。
32フレームの予算下では,ビデオMMEで最大6.4ポイントの均一サンプリングを改良し,フレーム予算の一致したトレーニングベースセレクタよりも優れていた。
論文 参考訳(メタデータ) (2026-07-17T07:04:31Z) - When Does Overlap Help? OSU-Mem and a Cell-Conditional Analysis of Trajectory Memory for LLM Agents [8.361893760388329]
LLM(Long-Horizon Large Language Model)エージェントは、実用的なプロンプト予算を迅速に超過する相互作用トラジェクトリを蓄積する。
トラジェクトリメモリを重なり合うセマンティックユニット(OSU)に編成することは、フラットまたは非ジョイントな選択肢を検索するのに役立つのだろうか?
我々はこれをOSUMemでインスタンス化し、OSUプールの重なり合う部分から予算付き粗大な拡張によって取り出す。
論文 参考訳(メタデータ) (2026-06-19T04:23:04Z) - Rethinking RAG in Long Videos: What to Retrieve and How to Use It? [56.38819694781005]
V-RAGBenchは$langle$query, evidence chunk, answer$rangle$三重項のベンチマークで、検索と生成を忠実に分離した評価を可能にする。
また、CARVEは、コンフィグレーションにまたがって並列レトリバーを動作させ、チャンク毎に入賞構成を識別するためにチャンク適応リランクを用いる手法である。
論文 参考訳(メタデータ) (2026-06-11T10:05:49Z) - Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection [57.3886742625188]
Pre-Routeは、応答前に構造化推論を実行するプロアクティブなルーティングフレームワークである。
本研究は, (i) LLMは, ガイドラインを確実に適用可能な遅延ルーティング能力を有すること, (ii) 線形プローブにより, 表現空間における最適ルーティングの分離性を高めること, (iii) 蒸留により, この推論構造を, 軽量展開のためのより小さなモデルに伝達すること,の3つの重要な知見を示す。
論文 参考訳(メタデータ) (2026-05-11T09:10:55Z) - Budget-Aware Routing for Long Clinical Text [8.474809035213118]
大きな言語モデルの大きな課題は、クエリ毎のトークンコストとデプロイメント全体のコストです。
文書単位のサブセットが厳格なトークン予算の下で選択される、予算付きコンテキスト選択について検討する。
関連性,カバレッジ,多様性のバランスをとるモノトンサブモジュラー目的のtextbfRCD を提案する。
論文 参考訳(メタデータ) (2026-05-01T01:34:53Z) - Distilling a Small Utility-Based Passage Selector to Enhance Retrieval-Augmented Generation [110.610512800947]
Retrieval-augmented Generation (RAG)は、取得した情報を組み込むことで、大規模言語モデル(LLM)を強化する。
RAGでは、重要度は実用性に移行し、正確な回答を生成するためのパスの有用性を考慮している。
提案手法は、ランク付けよりもユーティリティベースの選択に重点を置いており、固定しきい値を必要とせずに、特定のクエリに合わせた動的通過選択を可能にする。
本実験は, 実用性に基づく選択により, RAGの柔軟性とコスト効率が向上し, 計算コストが大幅に低減され, 応答品質が向上することを示した。
論文 参考訳(メタデータ) (2025-07-25T09:32:29Z) - Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains [13.58151841630302]
本稿では,RAGにおける再ランク付けを合理的な選択手法で置き換える新しい方法であるMETEORAを提案する。
METEORAは、最先端の再評価手法よりも約50%少ないチャンクを使用しながら、生成精度を33.34%向上させる。
敵対的な設定では、METEORAはF1スコアを0.10から0.44に大幅に改善する。
論文 参考訳(メタデータ) (2025-05-21T20:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。