論文の概要: Beyond Single-Negative Preference: Multi-Negative DPO for LLM-Centric Historical Entity Linking
- arxiv url: http://arxiv.org/abs/2609.07379v2
- Date: Thu, 10 Sep 2026 08:34:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.262511
- Title: Beyond Single-Negative Preference: Multi-Negative DPO for LLM-Centric Historical Entity Linking
- Title(参考訳): LLM-Centric Historical Entity Linkingのための多重負DPO
- Abstract要約: 歴史的エンティティリンクにMDPO(Multi- negative direct preference optimisation)を導入する。
MDPOは参照ベースのペアワイズ目的であり、正しいエンティティと各参照に関連する有効な全ての候補を比較する。
MDPOは教師付き微調整と単一負のDPOよりも改善することを示した。
- 参考スコア(独自算出の注目度): 19.15834445863472
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have recently shown promise for historical entity linking, but preference optimization for this task is often formulated with only one negative candidate per training instance. This discards information from the remaining candidates retrieved for the same mention. We introduce multi-negative direct preference optimisation (MDPO), a reference-based pairwise objective that compares the correct entity with all valid rejected candidates associated with each mention. MDPO preserves the Bradley-Terry formulation of DPO while exploiting the complete candidate set through masked, length-normalised sequence scores. We evaluate MDPO on hipe-2020 and newseye, covering French, German, English, Swedish, and Finnish historical newspaper text. Experiments show that MDPO improves over supervised fine-tuning and single-negative DPO, with particularly strong gains for NIL mentions, semantic ambiguity, OCR noise, and historically difficult names. Further analyses disentangle candidate-generation and selection errors, showing that candidate retrieval remains a key bottleneck for end-to-end entity linking. These results demonstrate that incorporating all within-instance negative candidates is a simple and effective improvement for LLM-based historical entity linking.
- Abstract(参考訳): 大規模言語モデル(LLM)は、最近、歴史的エンティティリンクの約束を示すが、このタスクの好みの最適化はトレーニングインスタンス毎に1つの負の候補で定式化されることが多い。
これは、同じ言及のために検索された残りの候補から情報を破棄する。
基準に基づくペアワイズ目標であるMDPO(Multi- negative direct preference optimization)を導入する。
MDPOはDPOのブラッドリー・テリー定式化を保ち、マスク付き、長さ正規化シーケンススコアによって設定された完全な候補を利用する。
我々は、ヒッピー2020とニュージーでMDPOを評価し、フランス語、ドイツ語、英語、スウェーデン語、フィンランドの歴史的新聞のテキストをカバーした。
実験の結果、MDPOは教師付き微調整と単一負のDPOよりも改善され、特にNILの言及、意味的曖昧さ、OCRノイズ、歴史的に難しい名前に顕著な改善が見られた。
さらに、候補生成と選択の誤りを分析し、候補検索がエンドツーエンドのエンティティリンクの鍵となるボトルネックであることを示す。
これらの結果は,全ての内在性負の候補を組み込むことが,LLMに基づく歴史的実体リンクの単純かつ効果的な改善であることを示している。
関連論文リスト
- Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems [72.27018654934386]
直接選好最適化(DPO)は、ペアの選好に基づく大規模言語モデル(LLM)の簡易かつ効果的なアライメント戦略である。
しかし、レコメンデーションシステムでは、ユーザからのフィードバックがペアワイズであることは滅多にない。
提案するMult-DPOは,LLMベースのレコメンデータシステムのユーザ嗜好アライメントのための,設定された選好イベントに対するトラクタブルな多項サロゲート確率である。
論文 参考訳(メタデータ) (2026-06-08T18:53:45Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Beyond Single: A Data Selection Principle for LLM Alignment via Fine-Grained Preference Signals [46.58760908162995]
本研究では,大規模言語モデルのための新しい理論的基盤データ選択法を提案する。
直接選好最適化目標の損失境界を解析することにより,この戦略の最適性を証明する。
我々の戦略は、標準的な全体主義的嗜好とより強い託宣の両方に対して、10%以上の相対的な改善を達成する。
論文 参考訳(メタデータ) (2025-08-11T05:43:02Z) - Self-Calibrated Listwise Reranking with Large Language Models [137.6557607279876]
大規模言語モデル (LLM) はシーケンシャル・ツー・シーケンス・アプローチによってタスクのランク付けに使用されている。
この階調のパラダイムは、より大きな候補集合を反復的に扱うためにスライディングウインドウ戦略を必要とする。
そこで本稿では,LLMを用いた自己校正リストのランク付け手法を提案する。
論文 参考訳(メタデータ) (2024-11-07T10:31:31Z) - Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization [75.1240295759264]
本稿では,BMC という名前のペアデータにおけるブリッジ・アンド・モデリングの効果的なフレームワークを提案する。
目的の修正によって、ペアの選好信号の一貫性と情報性が向上する。
DPOだけではこれらの相関をモデル化し、ニュアンス付き変動を捉えるには不十分である。
論文 参考訳(メタデータ) (2024-08-14T11:29:47Z) - Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence [31.03305638930844]
DPO(Direct Preference Optimization)は、大規模言語モデルと人間の好みとの直接的かつ堅牢なアライメントのための顕著なアルゴリズムとして登場した。
有望な有効性にもかかわらず、DPOは顕著な欠点に直面している。
また,この問題はDPOのアルゴリズム長依存性にも起因していると考えられる。
論文 参考訳(メタデータ) (2024-06-16T14:24:30Z) - Multi-Reference Preference Optimization for Large Language Models [56.84730239046117]
複数の参照モデルを用いた直接選好最適化のための新しいクローズドフォームの定式化を提案する。
得られたアルゴリズムであるMulti-Reference Preference Optimization (MRPO)は、様々な参照モデルからより広範な事前知識を活用する。
MRPOを微調整したLLMは,データ不足や多量性に関わらず,様々な嗜好データにおいてより一般化されていることを示す。
論文 参考訳(メタデータ) (2024-05-26T00:29:04Z) - Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization [105.3612692153615]
命令応答対に対して協調的に好みを抽出する新しい軸を提案する。
命令と応答ペアを併用することで、大きな言語モデルのアライメントを大幅に向上させることができる。
論文 参考訳(メタデータ) (2024-03-31T02:05:40Z) - Optimizing Language Models for Human Preferences is a Causal Inference Problem [41.59906798328058]
直接結果データセットからの人間の嗜好に対する言語モデル最適化について検討する。
まず,言語モデルの最適化を因果問題と見なして,モデルがテキストと結果の関係を正しく学習することを保証する。
我々はCPOを2倍の頑健なCPOで拡張し、従属目的の分散を低減し、バイアスに対する確実な強い保証を維持します。
論文 参考訳(メタデータ) (2024-02-22T21:36:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。