論文の概要: LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval
- arxiv url: http://arxiv.org/abs/2608.27809v1
- Date: Fri, 28 Aug 2026 00:52:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.173331
- Title: LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval
- Title(参考訳): パーソナルメモリRAGのためのLINE会話履歴検索:検索表現の評価とハイブリッド検索
- Authors: Akito Hattori,
- Abstract要約: 本研究では、あるユーザのLINE会話履歴に関する検索専用ケーススタディを提案する。
我々は358,896のメッセージを22,329の時間的コヒーレントなチャンクに分割し、3つの検索表現を構築した。
一つのアノテータで検証した100個の評価質問に対して,BM25,密度ベクトル検索,線形ハイブリッド検索を比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As an initial step toward personal memory retrieval-augmented generation (RAG) for large language models (LLMs), this study presents a retrieval-only case study over one user's LINE conversation history. We segmented 358,896 messages into 22,329 temporally coherent chunks and constructed three search representations: raw_text, a generated summary, and embedding_text, which combines a summary with a raw-text excerpt and other fixed text. We compared BM25, dense vector retrieval, and linear hybrid retrieval on 100 evaluation questions verified by a single annotator. Among individual retrievers, embedding_text_bm25 achieved the highest point estimate, with Recall@5 of 0.584. We then explored six retriever pairings and 21 weights, for 126 configurations on the same evaluation set. The selected combination of embedding_text_bm25 and embedding_text_vector at beta = 0.45 achieved Recall@5 = 0.697, MRR@5 = 0.595, and nDCG@5 = 0.575. Its Recall@5 exceeded that of embedding_text_bm25 by 0.113, with a question-level paired percentile-bootstrap 95% confidence interval of [0.048, 0.184]. This interval is conditional on fixing the configuration selected on the same 100 questions and does not account for uncertainty from configuration selection or weight search. The difference from a summary-based hybrid at beta = 0.50 was 0.050, with a 95% confidence interval of [-0.013, 0.115], so no clear difference could be established. The 17 aggregate questions also yielded lower point estimates than the other question types, suggesting that flat chunk-level retrieval struggles when evidence is distributed across multiple times and conversations. This evaluation is an exploratory single-user, single-annotator study conducted on the same question set used for configuration search; it does not evaluate final answer generation or generalization to unseen questions.
- Abstract(参考訳): 大規模言語モデル(LLM)のための個人記憶検索強化生成(RAG)への最初のステップとして、あるユーザのLINE会話履歴に対する検索専用ケーススタディを示す。
我々は、358,896のメッセージを22,329個の時間的コヒーレントなチャンクに分割し、3つの検索表現を構築した。
一つのアノテータで検証した100個の評価質問に対して,BM25,密度ベクトル検索,線形ハイブリッド検索を比較した。
個々のレトリバーのうち、embedding_text_bm25は、Recall@5の0.584で最高点推定を達成した。
次に6つのレトリバーペアと21の重みを探索し、同じ評価セット上の126の構成について検討した。
選択された組込み_text_bm25とbeta = 0.45の組込み_text_vectorの組み合わせは、Recall@5 = 0.697、MRR@5 = 0.595、nDCG@5 = 0.575を達成した。
Recall@5 は Embeding_text_bm25 の 0.113 を超え, [0.048, 0.184] の 95% 信頼区間を質問レベルに設定した。
この間隔は、同じ100の質問で選択された構成の修正に条件付きであり、構成の選択や重み付けによる不確実性は考慮しない。
β = 0.50 での要約ベースのハイブリッドとの違いは 0.050 であり、95% の信頼区間 [-0.013, 0.115] であった。
集計された17の質問は、他の質問タイプよりも低い点推定値を示しており、証拠が複数回、会話に分散された場合に、平坦なチャンクレベルの検索が困難であることを示している。
この評価は、構成探索に使用するのと同じ質問セットで実施された探索的な単一ユーザ・単一アノテーションの研究であり、最終的な回答の生成や、未確認の質問に対する一般化は評価しない。
関連論文リスト
- Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning [6.180594609315986]
MemoryDocDataSetは、50マイクロワールドと1000QAペアの総合ベンチマークである。
それぞれのインスタンスは、3~5のペルソナ、数ヶ月のアクティビティにまたがる一時的なイベントグラフ、3~5の実際の長いドキュメント、それらのドキュメントに基づくマルチセッションの会話で構成されている。
定義されている特徴は、ハイブリッドソースタグである: システムが最初に会話履歴をナビゲートし、どのドキュメントが関連しているかを特定し、そのドキュメントから回答を抽出する。
論文 参考訳(メタデータ) (2026-06-03T04:44:50Z) - From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents [0.0]
スパース, 密度, ハイブリッド融合, クロスエンコーダリグレード, クエリ拡張, インデックス拡張, 適応検索にまたがる10の検索戦略をベンチマークした。
我々はRecall@k,MRR,nDCGによる検索品質とNumber Matchによるエンドツーエンド生成品質を評価する。
論文 参考訳(メタデータ) (2026-04-02T07:53:40Z) - Test-Time Strategies for More Efficient and Accurate Agentic RAG [58.44913384057518]
Retrieval-Augmented Generation (RAG) システムは複雑なマルチホップ問題に直面している。
このような手法は、以前に処理された情報の反復的な検索を含む非効率性を導入することができる。
本稿では,これらの問題を軽減するために,サーチ-R1パイプラインに対するテスト時間修正について検討する。
論文 参考訳(メタデータ) (2026-03-12T19:18:59Z) - Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage [89.58253972744531]
Retrieval-augmented Generation (RAG) システムは、文書検索と生成モデルを組み合わせて、レポート生成のような複雑な情報を求める課題に対処する。
我々は,上流の検索指標が,最終生成応答の情報カバレッジの信頼性の高い早期指標として機能するかどうかを検討する。
本研究は,トピックとシステムレベルの両方で生成した応答におけるカバレッジベース検索指標とナゲットカバレッジとの間に強い相関関係を示した。
論文 参考訳(メタデータ) (2026-03-09T18:20:20Z) - Domain-Adaptive and Scalable Dense Retrieval for Content-Based Recommendation [0.0]
本稿では,Amazon Reviews 2023 (Fashion) サブセットを微調整した2-towerバイエンコーダをベースとした,スケーラブルな高密度検索システムを提案する。
我々は、レビューテキスト(クエリプロキシとして)とアイテムメタデータ(ポジティブドキュメントとして)からトレーニングペアを構築し、500トークンの最大シーケンス長で50,000のサンプルインタラクションを微調整する。
826,402のカタログ項目に対するレビュー・ツー・タイトルのベンチマークでは、Recall@10が0.26(BM25)から0.66に改善されました。
論文 参考訳(メタデータ) (2026-01-31T20:58:23Z) - Evaluating Hybrid Retrieval Augmented Generation using Dynamic Test Sets: LiveRAG Challenge [8.680958290253914]
本稿では,動的テストセット上での検索強化生成システム(RAG)の評価を行うLiveRAG Challenge 2025を提案する。
我々の最後のハイブリッドアプローチはスパース (BM25) と高密度 (E5) の検索手法を組み合わせたものである。
RankLLaMA を用いたニューラルリランクでは MAP は0.523 から 0.797 に向上するが,計算コストは禁忌である。
論文 参考訳(メタデータ) (2025-06-27T21:20:43Z) - ELOQ: Resources for Enhancing LLM Detection of Out-of-Scope Questions [52.33835101586687]
本研究では,検索した文書が意味的に類似しているように見えるスコープ外質問について検討するが,答えるために必要な情報がない。
本稿では,閉経後の文書から多様なスコープ外質問を自動的に生成するための,幻覚に基づくELOQを提案する。
論文 参考訳(メタデータ) (2024-10-18T16:11:29Z) - Long-Span Question-Answering: Automatic Question Generation and QA-System Ranking via Side-by-Side Evaluation [65.16137964758612]
大規模言語モデルにおける長文文の活用について検討し,本書全体の読解データを作成する。
我々の目的は、長いテキストの詳細な理解を必要とする問題を分析し、理解し、推論するLLMの能力をテストすることである。
論文 参考訳(メタデータ) (2024-05-31T20:15:10Z) - Phrase Retrieval for Open-Domain Conversational Question Answering with
Conversational Dependency Modeling via Contrastive Learning [54.55643652781891]
Open-Domain Conversational Question Answering (ODConvQA)は、マルチターン会話を通じて質問に答えることを目的としている。
そこで本研究では,単語列に対する句検索方式を用いて,回答を直接予測する手法を提案する。
論文 参考訳(メタデータ) (2023-06-07T09:46:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。