論文の概要: On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability
- arxiv url: http://arxiv.org/abs/2604.16576v1
- Date: Fri, 17 Apr 2026 13:02:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.083683
- Title: On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability
- Title(参考訳): LLM系高密度レトリーバーのロバスト性について:一般化可能性と安定性の体系的解析
- Abstract要約: 我々は、最先端のオープンソースLLMベースの高密度レトリバーの堅牢性に関する最初の体系的研究について述べる。
一般化のために,30のデータセットにまたがる4つのベンチマークの検索効率を評価する。
安定のために、意図しないクエリのバリエーションと悪意のある攻撃に対するモデルレジリエンスを評価する。
- 参考スコア(独自算出の注目度): 25.692340232648366
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decoder-only large language models (LLMs) are increasingly replacing BERT-style architectures as the backbone for dense retrieval, achieving substantial performance gains and broad adoption. However, the robustness of these LLM-based retrievers remains underexplored. In this paper, we present the first systematic study of the robustness of state-of-the-art open-source LLM-based dense retrievers from two complementary perspectives: generalizability and stability. For generalizability, we evaluate retrieval effectiveness across four benchmarks spanning 30 datasets, using linear mixed-effects models to estimate marginal mean performance and disentangle intrinsic model capability from dataset heterogeneity. Our analysis reveals that while instruction-tuned models generally excel, those optimized for complex reasoning often suffer a ``specialization tax,'' exhibiting limited generalizability in broader contexts. For stability, we assess model resilience against both unintentional query variations~(e.g., paraphrasing, typos) and malicious adversarial attacks~(e.g., corpus poisoning). We find that LLM-based retrievers show improved robustness against typos and corpus poisoning compared to encoder-only baselines, yet remain vulnerable to semantic perturbations like synonymizing. Further analysis shows that embedding geometry (e.g., angular uniformity) provides predictive signals for lexical stability and suggests that scaling model size generally improves robustness. These findings inform future robustness-aware retriever design and principled benchmarking. Our code is publicly available at https://github.com/liyongkang123/Robust_LLM_Retriever_Eval.
- Abstract(参考訳): デコーダのみの大規模言語モデル(LLM)は、密度の高い検索のバックボーンとしてBERTスタイルのアーキテクチャに置き換わり、大幅なパフォーマンス向上と広く採用されている。
しかし、これらのLSMベースのレトリバーの堅牢性はいまだに未調査である。
本稿では,2つの相補的視点から,最先端のオープンソース LLM ベース高密度レトリバーの堅牢性に関する最初の体系的研究について述べる。
本研究では,30のデータセットにまたがる4つのベンチマークの検索効率を線形混合効果モデルを用いて評価し,データセットのヘテロジニティから辺縁平均性能と乱交固有モデル能力を推定する。
我々の分析では、命令調整モデルが概して優れているが、複雑な推論に最適化されたモデルは「特殊化税」に苦しむことが多く、より広い文脈において限定的な一般化性を示す。
安定のために、意図しないクエリのバリエーション~(eg,paraphrasing, typos)と悪意のある敵攻撃〜(eg,corpus poisoning)の両方に対してモデルレジリエンスを評価する。
LLMをベースとしたレトリバーは,エンコーダのみのベースラインに比べてタイポスやコーパスの毒性が向上するが,同義語化のような意味的摂動には弱い。
さらなる分析により、埋め込み幾何学(例えば、角の均一性)が語彙安定性の予測信号を提供し、スケーリングモデルのサイズが一般にロバスト性を改善することが示唆されている。
これらの知見は,将来ロバスト性を考慮したレトリバーの設計とベンチマークの原理を示唆するものである。
私たちのコードはhttps://github.com/liyongkang123/Robust_LLM_Retriever_Evalで公開されています。
関連論文リスト
- Joint Model and Data Sparsification via the Marginal Likelihood [53.29070892356214]
本稿では,個々の特徴とサンプルの相違点を同時学習し,同時にモデルとデータスペーシングを実現することを提案する。
このモデルとデータの対称的なプルーニングは、共役を保存する自然な拡張を提供する。
多様な回帰タスクにわたる経験的結果は、共同ARDアプローチがスパースモデルとロバスト予測モデルの両方を一貫して生成することを確認した。
論文 参考訳(メタデータ) (2026-05-28T13:26:53Z) - An Interpretable and Scalable Framework for Evaluating Large Language Models [13.322241501687715]
大規模言語モデル(LLM)の評価はますます重要になっているが、標準的なベンチマーク手法は平均精度に依存している。
アイテム応答理論(IRT)は、潜在モデル能力とアイテム特性をモデリングするための原則化されたフレームワークを提供する。
本稿では,LLM評価のための大規模化最小化原理に基づく解釈可能かつスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T23:52:12Z) - Programmatic Context Augmentation for LLM-based Symbolic Regression [65.01826333382738]
大規模言語モデル(LLM)に基づく進化的探索手法が記号回帰に導入されている。
本稿では,プログラム的文脈拡張を取り入れたLLMに基づく進化的検索フレームワークを提案する。
本手法では,データ解析と情報信号抽出を積極的に行うことができる。
論文 参考訳(メタデータ) (2026-05-04T19:34:03Z) - ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding [23.27523995613204]
本稿では、解釈可能性空間を利用してモデル表現を構築するフレームワークであるABLE(Attribution-based Large-model Embedding)を提案する。
パラメーターに依存しない単語レベルのアライメントによって勾配に基づく特徴属性を集約することにより、ABLEはモデル固有の入力感度パターンをキャプチャする。
我々のトレーニングフリーアプローチは、関係予測、モデルルーティング、ベンチマークスコア予測において、競争力または優れた性能を達成する。
論文 参考訳(メタデータ) (2026-04-20T04:55:11Z) - STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction [78.0692157478247]
本稿では,知識駆動型エージェント推論を用いて,データ駆動型静的予測を橋渡しするフレームワークSTARを提案する。
STARはスコアベースとランクベースの両方の基準線を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-12T16:30:07Z) - RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation [8.70920344844399]
大規模言語モデル(LLM)は、リコメンデータシステムで自然言語の説明を生成するために、ますます使われている。
現実世界のWebプラットフォームでは、インタラクション履歴は、偶然のクリック、時間的不整合、値の欠如、進化する好みのために本質的にノイズが多い。
本稿では,LLM生成レコメンデーションのロバスト性を評価するための,最初の体系的評価フレームワークであるRobustExplainを紹介する。
論文 参考訳(メタデータ) (2026-01-27T02:45:48Z) - Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models [4.841487377596519]
本稿では,Large Language Modelsのコード理解性能が従来の人間中心のソフトウェアメトリクスと一致しているかを検討する。
コード理解をバイナリインプット・アウトプット整合性タスクとして再編成する診断フレームワークを導入する。
論文 参考訳(メタデータ) (2026-01-19T10:58:24Z) - RoHOI: Robustness Benchmark for Human-Object Interaction Detection [84.78366452133514]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、コンテキスト認識支援を可能にするロボット・ヒューマン・アシストに不可欠である。
HOI検出のための最初のベンチマークを導入し、様々な課題下でモデルのレジリエンスを評価する。
我々のベンチマークであるRoHOIは、HICO-DETとV-COCOデータセットに基づく20の汚職タイプと、新しいロバストネスにフォーカスしたメトリクスを含んでいる。
論文 参考訳(メタデータ) (2025-07-12T01:58:04Z) - NDCG-Consistent Softmax Approximation with Accelerated Convergence [67.10365329542365]
本稿では,ランキングの指標と直接一致した新たな損失定式化を提案する。
提案したRG損失を高効率な Alternating Least Squares (ALS) 最適化手法と統合する。
実世界のデータセットに対する実証的な評価は、我々のアプローチが同等または上位のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-06-11T06:59:17Z) - Unified Enhancement of the Generalization and Robustness of Language Models via Bi-Stage Optimization [2.502393972789905]
本稿では,LMの一般化とロバスト性の両方を均一に向上する二段階最適化フレームワークを提案する。
提案手法は,従来の手法と比較して,LMの一般化とロバスト性を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2025-03-19T13:50:36Z) - SCORE: Systematic COnsistency and Robustness Evaluation for Large Language Models [4.875712300661656]
本稿では,大規模言語モデルの非敵対的評価のための総合的なフレームワークであるSCORE ($mathbfS$ystematic $mathbfCO$nsistency and $mathbfR$obustness $mathbfE$valuationを提案する。
SCOREフレームワークは、様々な設定で同じベンチマークで繰り返しテストすることでモデルを評価し、精度と一貫性を現実的に見積もる。
論文 参考訳(メタデータ) (2025-02-28T19:27:29Z) - UncertaintyRAG: Span-Level Uncertainty Enhanced Long-Context Modeling for Retrieval-Augmented Generation [93.38604803625294]
IncertaintyRAG, a novel approach for long-context Retrieval-Augmented Generation (RAG)について紹介する。
我々は、SNR(Signal-to-Noise Ratio)ベースのスパン不確実性を用いて、テキストチャンク間の類似性を推定する。
不確かさRAGはLLaMA-2-7Bでベースラインを2.03%上回り、最先端の結果を得る。
論文 参考訳(メタデータ) (2024-10-03T17:39:38Z) - On the Robustness of Aspect-based Sentiment Analysis: Rethinking Model,
Data, and Training [109.9218185711916]
アスペクトベースの感情分析(ABSA)は、ソーシャルメディアのテキストやレビューの背後にある製品やサービスの特定の側面に対して、特定の感情の極性を自動的に推測することを目的としている。
我々は、モデル、データ、トレーニングを含むあらゆる可能な角度からボトルネックを体系的に再考することで、ABSAの堅牢性を高めることを提案する。
論文 参考訳(メタデータ) (2023-04-19T11:07:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。