論文の概要: Transforming LLMs into Efficient Cross-Encoders via Knowledge Distillation for RAG Reranking
- arxiv url: http://arxiv.org/abs/2607.11933v1
- Date: Sat, 11 Jul 2026 04:31:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.885209
- Title: Transforming LLMs into Efficient Cross-Encoders via Knowledge Distillation for RAG Reranking
- Title(参考訳): RAGリグレードのための知識蒸留によるLLMの効率的なクロスエンコーダへの変換
- Authors: Shreeya Dasa Lakshminath, Shubhan S,
- Abstract要約: クロスエンコーダは、Retrieval-Augmented Generation (RAG)パイプラインにおいて高い精度を達成するが、リアルタイムデプロイメントを制限する2次推論コストを課す。
LLaMA 3 (8B) を2段階パイプラインを用いたドロップイン・リランカとして微調整することでこの問題に対処する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-encoders achieve high reranking accuracy in Retrieval-Augmented Generation (RAG) pipelines but impose quadratic inference costs that limit real-time deployment. We address this by fine-tuning LLaMA 3 (8B) as a drop-in reranker using a two-stage pipeline: supervised fine-tuning on a custom query-document relevance dataset via the Unsloth framework with LoRA adapters, followed by 4-bit quantization for efficient inference. The resulting model replaces the cross-encoder in a dual-retriever RAG pipeline combining BM25 and dense vector search. Evaluated on a domain-specific question-answering benchmark using the RAGAS framework, our fine-tuned LLaMA 3 reranker achieves gains of 14% in answer relevancy, 16% in context precision, 19% in answer similarity, and 21% in answer correctness over the cross-encoder baseline, while reducing inference overhead through 4-bit quantization. These results demonstrate that instruction-tuned LLMs can be adapted into accurate, efficient rerankers without the quadratic complexity of traditional cross-encoders.
- Abstract(参考訳): クロスエンコーダは、Retrieval-Augmented Generation (RAG)パイプラインにおいて高い精度を達成するが、リアルタイムデプロイメントを制限する2次推論コストを課す。
LLaMA 3 (8B) を2段階パイプラインを用いたドロップイン・リランカとして微調整することでこの問題に対処する。
結果として得られたモデルは、BM25と高密度ベクトル探索を組み合わせた二重レトリバーRAGパイプラインにおけるクロスエンコーダを置き換える。
LLaMA 3リランカは,RAGASフレームワークを用いて,応答関連性14%,文脈精度16%,応答類似性19%,回答正当性21%を実現し,推論オーバーヘッドを4ビット量子化により低減した。
これらの結果から,従来のクロスエンコーダの2次複雑さを伴わずに,命令調整型LLMを高精度かつ効率的なリランカに適応できることが示唆された。
関連論文リスト
- Adaptive ToR: Complexity-Aware Tree-Based Retrieval for Pareto-Optimal Multi-Intent NLU [0.15293427903448018]
多言語自然言語理解には、高い精度と計算効率を同時に達成する検索システムが必要である。
本稿では,クエリ特性に基づいた検索トポロジを動的に構成する複雑性を考慮した検索アーキテクチャであるAdaptive Tree-of-Retrieval (Adaptive ToR)を提案する。
論文 参考訳(メタデータ) (2026-04-27T09:24:10Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Training Large Reasoning Models Efficiently via Progressive Thought Encoding [63.254758972725654]
大規模推論モデル(LRM)は複雑な問題に優れるが、効率にとって重要な障壁に直面している。
本稿では,パラメータ効率のよい微調整手法であるProgressive Thoughtを紹介する。
論文 参考訳(メタデータ) (2026-02-18T20:03:38Z) - EasyRAG: Efficient Retrieval-Augmented Generation Framework for Automated Network Operations [24.142649256624082]
本稿では,自動ネットワーク操作のためのシンプルで軽量で効率的な検索拡張生成フレームワークであるEasyRAGを提案する。
私たちのフレームワークには3つの利点があります。
第2の方法は,BM25検索とBGE-Rerankerのリグレードから成り,どのモデルも微調整する必要がなく,最小限のVRAMを占有し,デプロイが容易で,高度にスケーラブルである。
最後のものは効率的な推論であり、我々は粗いランク付け、再ランク付け、生成プロセス全体の効率的な推論促進スキームを設計した。
論文 参考訳(メタデータ) (2024-10-14T09:17:43Z) - SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight
Compression [76.73007709690306]
Sparse-Quantized Representation (SpQR) は,新しい圧縮フォーマットと量子化技術である。
SpQRは、高精度なLLaMAとFalcon LLMのパープレキシティにおいて、1%未満の相対的精度の損失を達成している。
これにより、1台の24GBのコンシューマGPU上で33BパラメータのLSMを実行でき、15%のスピードアップでパフォーマンスの劣化は発生しない。
論文 参考訳(メタデータ) (2023-06-05T17:53:28Z) - Q-DETR: An Efficient Low-Bit Quantized Detection Transformer [50.00784028552792]
Q-DETRのボトルネックは、我々の経験的分析によるクエリ情報の歪みから生じる。
情報ボトルネック(IB)の原理をQ-DETRの学習に一般化することで導出できる2レベル最適化問題としてDRDを定式化する。
本研究では,教師情報を蒸留所要の機能に効果的に転送し,条件情報エントロピーを最小化する,フォアグラウンド対応クエリマッチング手法を提案する。
論文 参考訳(メタデータ) (2023-04-01T08:05:14Z) - Efficient Nearest Neighbor Search for Cross-Encoder Models using Matrix
Factorization [60.91600465922932]
本稿では,クロスエンコーダのみに頼って,二重エンコーダによる検索を回避する手法を提案する。
我々のアプローチは、現在の広く使われている方法よりも優れたテスト時間リコール-vs計算コストトレードオフを提供する。
論文 参考訳(メタデータ) (2022-10-23T00:32:04Z) - Qutrit randomized benchmarking [0.0]
第三次量子プロセッサは、従来の量子ビット技術よりも大きな計算上の優位性を提供する。
このような量子ハードウェアの性能を評価・比較するためには、堅牢なベンチマーク手法が不可欠である。
本稿では,業界標準のRandomized Benchmarkingプロトコルの拡張を実演する。
論文 参考訳(メタデータ) (2020-08-20T18:00:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。