論文の概要: A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers
- arxiv url: http://arxiv.org/abs/2608.26194v1
- Date: Mon, 24 Aug 2026 11:32:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.116202
- Title: A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers
- Title(参考訳): 不均一音声とテキスト検索のオーケストレーションのためのリランカ
- Abstract要約: 本稿では,異なるモダリティデータベースを集約した音声とテキスト検索をベースとしたリランカSTeReO(Speech and Text Re ranking Orchestrator)を提案する。
その結果,提案アルゴリズムは最も有効な証拠の選択に優れており,下流の質問応答性能が大幅に向上していることがわかった。
- 参考スコア(独自算出の注目度): 9.371054158820124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) systems have attracted significant interest for their ability to mitigate hallucinations in Large Language Models (LLMs). Although knowledge databases for RAG are increasingly diversifying to include various modalities such as speech and text, research on handling such multi-modal database scenarios remains limited. In this paper, we propose STeReO (Speech and Text Reranking Orchestrator), a reranker based on speech and text retrievers that aggregates disparate modality databases. To address the lack of specialized training data, we first curate a dataset comprising queries, mixed-modality evidence, and their corresponding relevance ranks. We then train the reranker and evaluate its effectiveness in both single-modality and mixed-modality scenarios. Our results demonstrate that the proposed algorithm excels at selecting the most relevant evidence, thereby significantly improving downstream question-answering performance.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) システムは、Large Language Models (LLMs) における幻覚を緩和する能力に対して大きな関心を集めている。
RAGの知識データベースは、音声やテキストなどの様々なモダリティを含むように多様化しつつあるが、そのようなマルチモーダルデータベースのシナリオを扱うための研究は依然として限られている。
本稿では,異なるモダリティデータベースを集約した音声とテキスト検索をベースとしたリランカであるSTeReO(Speech and Text Re ranking Orchestrator)を提案する。
専門的なトレーニングデータの欠如に対処するため、まず、クエリー、混合モダリティ証拠、およびそれらの関連性ランキングからなるデータセットをキュレートする。
次に、リランカをトレーニングし、単一モダリティと混合モダリティの両方のシナリオでその効果を評価する。
その結果,提案アルゴリズムは最も有効な証拠の選択に優れており,下流の質問応答性能が大幅に向上していることがわかった。
関連論文リスト
- Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs [45.88028371034407]
大規模言語モデルは、前もって微調整を行わずに、科学的文書からドメイン固有のキーオンに答えるときに幻覚を起こす傾向がある。
本稿では,これらの課題を解決するための高度なマルチモーダル検索型生成システムを提案する。
Qwen2-VL-2B-InstructはBERTScoreのクラウドベースモデルに匹敵する結果を得た。
論文 参考訳(メタデータ) (2026-07-06T08:32:09Z) - Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage [89.58253972744531]
Retrieval-augmented Generation (RAG) システムは、文書検索と生成モデルを組み合わせて、レポート生成のような複雑な情報を求める課題に対処する。
我々は,上流の検索指標が,最終生成応答の情報カバレッジの信頼性の高い早期指標として機能するかどうかを検討する。
本研究は,トピックとシステムレベルの両方で生成した応答におけるカバレッジベース検索指標とナゲットカバレッジとの間に強い相関関係を示した。
論文 参考訳(メタデータ) (2026-03-09T18:20:20Z) - Hybrid Retrieval-Augmented Generation for Robust Multilingual Document Question Answering [0.3376269351435395]
大規模なデジタル化のイニシアチブは、多くの歴史新聞を解き放った。
雑音の多い歴史文書に対する質問応答に特化して設計された多言語検索型拡張生成パイプラインを開発し,評価する。
論文 参考訳(メタデータ) (2025-12-14T13:57:05Z) - Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation [72.34977512403643]
Retrieval-Augmented Generation (RAG) は、外部コーパスから関連文書を取得することで、大規模言語モデル(LLM)を強化するための強力なパラダイムとして登場した。
既存のRAGシステムは、主に平凡なテキスト文書に焦点を当てており、クエリとドキュメントの両方が(テキストや画像のような)混合モダリティを含む実世界のシナリオでは、しばしば不足している。
我々は,Universal Retrieval-Augmented Generationシナリオに適した混合モーダル-混合モーダルレトリバーであるNyxを提案する。
論文 参考訳(メタデータ) (2025-10-20T09:56:43Z) - MSRS: Evaluating Multi-Source Retrieval-Augmented Generation [51.717139132190574]
多くの現実世界のアプリケーションは、複数のソースにまたがる情報を統合して要約する能力を必要としている。
本稿では、RAGシステムに対して異なるソース間で情報を統合するための評価ベンチマークを構築するためのスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-28T14:59:55Z) - Generalized Reinforcement Learning for Retriever-Specific Query Rewriter with Unstructured Real-World Documents [4.200973008100858]
textbfRL-QRは、レトリバー固有のクエリ書き換えのための強化学習フレームワークである。
RL-QRは、特定のレトリバー用に調整されたクエリリライトを訓練し、さまざまなドメインにわたる検索性能を向上する。
以上の結果から, RL-QRがRAGシステムのクエリ最適化に革命をもたらす可能性が示唆された。
論文 参考訳(メタデータ) (2025-07-31T04:55:21Z) - Re-ranking the Context for Multimodal Retrieval Augmented Generation [28.63893944806149]
Retrieval-augmented Generation (RAG)は、文脈内で応答を生成するために外部知識を組み込むことで、大きな言語モデル(LLM)を強化する。
RAGシステムは固有の課題に直面している: (i) 検索プロセスはユーザクエリ(画像、文書など)への無関係なエントリを選択することができ、 (ii) 視覚言語モデルや GPT-4o のようなマルチモーダル言語モデルは、RAG出力を生成するためにこれらのエントリを処理する際に幻覚を与える。
より高度な関連性尺度を用いることで、知識ベースからより関連性の高い項目を選択して排除することにより、検索プロセスを強化することができることを示す。
論文 参考訳(メタデータ) (2025-01-08T18:58:22Z) - CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models [49.16989035566899]
Retrieval-Augmented Generation (RAG)は、大規模言語モデル(LLM)の能力を高める技術である。
本稿では,大規模かつ包括的なベンチマークを構築し,様々なRAGアプリケーションシナリオにおけるRAGシステムのすべてのコンポーネントを評価する。
論文 参考訳(メタデータ) (2024-01-30T14:25:32Z) - Mixed-modality Representation Learning and Pre-training for Joint
Table-and-Text Retrieval in OpenQA [85.17249272519626]
最適化された OpenQA Table-Text Retriever (OTTeR) を提案する。
検索中心の混合モード合成事前学習を行う。
OTTeRはOTT-QAデータセット上でのテーブル・アンド・テキスト検索の性能を大幅に改善する。
論文 参考訳(メタデータ) (2022-10-11T07:04:39Z) - Improving Multi-Turn Response Selection Models with Complementary
Last-Utterance Selection by Instance Weighting [84.9716460244444]
我々は、データリソース自体の根底にある相関を利用して、異なる種類の監視信号を導出することを検討する。
2つの公開データセットで広範な実験を行い、両方のデータセットで大幅に改善した。
論文 参考訳(メタデータ) (2020-02-18T06:29:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。