論文の概要: Overlap, Unique and Conflict: Can LLMs Extract What They Can Recognize?
- arxiv url: http://arxiv.org/abs/2609.38799v1
- Date: Wed, 30 Sep 2026 02:30:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.042864
- Title: Overlap, Unique and Conflict: Can LLMs Extract What They Can Recognize?
- Title(参考訳): オーバーラップ、ユニーク、矛盾 - LLMは認識できるものを抽出できるのか?
- Abstract要約: オーバーラップ・ユニバーサル・コンフリクト(OUC: Overlap-Unique-Conflict)抽出(OUC: Overlap-Unique-Conflict)は、2つの物語から重複、矛盾、ユニークな節を抽出するクロスナラティブなタスクである。
重複や矛盾よりも、ユニークな情報を抽出するのがずっと簡単です。
- 参考スコア(独自算出の注目度): 4.612188556445687
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding multi-perspective alternative narratives requires identifying how their information agrees, conflicts, or differs across sources. Existing work on cross-text relations largely focuses on categorizing relations between predefined text pairs, such as entailment or contradiction, rather than directly extracting such information from full narratives. To address this gap, we introduce Overlap-Unique-Conflict (OUC) extraction, a cross-narrative task that extracts all overlapping, conflicting, and unique clauses from two narratives. To support this study, we construct a benchmark of approximately 22K narrative pairs and 140K OUC instances spanning factual, argumentative, and political discourse. Evaluating 14 open-source LLMs (0.6B-35B), we find that unique information is far easier to extract than overlap and conflict: the strongest model, Gemma-4-31B, reaches only 61.13% F1-score on overlap and 48.58% on conflict, against more than 75% on unique. Further diagnostic analysis reveals that this difficulty does not stem from relation recognition alone, but rather from a failure to pair and extract the corresponding clauses from full narratives, especially in smaller models. Nevertheless, learning these extractions with task-specific supervision narrows the gap considerably: a fine-tuned Qwen-3-8B gains 15-28% absolute over its baseline and surpasses models roughly four times its size (e.g., Qwen-3.6-35B) on several tasks. Even so, overlap and conflict remain well below satisfactory, leaving cross-narrative clause extraction an open challenge.
- Abstract(参考訳): マルチパースペクティブなオルタナティブな物語を理解するには、情報がどのように一致するか、矛盾するか、ソース間で異なるかを識別する必要がある。
クロステキスト関係に関する既存の研究は、完全な物語からそのような情報を直接抽出するのではなく、包含や矛盾といった定義済みのテキストペア間の関係を分類することに集中している。
このギャップに対処するために、オーバーラップ・ユニバーサル・コンフリクト(OUC)抽出という、オーバーラップ・ユニバーサル・コンフリクト(OUC)抽出というクロスナラティブなタスクを導入し、2つの物語から全てのオーバーラップ、コンフリクト、ユニークな節を抽出する。
本研究を支援するために,約22Kの物語対と140KのOUCインスタンスのベンチマークを構築した。
14個のオープンソース LLM (0.6B-35B) を評価すると、特異な情報は重複や矛盾よりも抽出しやすく、最強のモデルであるGemma-4-31Bは重なりのF1スコアが61.13%、競合の48.58% にしか達していない。
さらなる診断分析により、この難易度は、関係認識のみに起因するのではなく、特により小さなモデルにおいて、完全な物語から対応する節をペアリングして抽出する失敗によるものであることが判明した。
微調整されたQwen-3-8Bは、ベースライン上で15-28%の絶対値を獲得し、いくつかのタスクでQwen-3.6-35Bの約4倍のサイズ(例えば、Qwen-3.6-35B)を超える。
それでも重複と対立は十分に満足できないままであり、クロスナラティブな節を抽出することはオープンな課題である。
関連論文リスト
- C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models [11.992819604307998]
C$3$POは、ビデオ、オーディオ、画像、テキストにまたがる3,404のサンプルのベンチマークである。
情報構成(分散証拠)と反実的対立(反実的対立)の2つの能力を評価する。
C$3$POは、人間が88.64%の精度を達成する一方で、最良のモデルは73.17%にしか達していないことを明らかにしている。
論文 参考訳(メタデータ) (2026-08-05T20:04:05Z) - Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories [3.694051864521789]
我々は、大言語モデルが2つのテキスト単位をフルに読み込むエージェントタスクとして、きめ細かいテクスチャ間抽出をリキャストする。
3つのドメインの専門家がプールされたマルチモデル候補を2,533対のテキスト間ペアのベンチマークに設定し、Analects と Book of Han を徹底的に比較する手法を検証する。
論文 参考訳(メタデータ) (2026-07-30T02:34:23Z) - CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection [56.64398465636452]
ジェネレーティブAIは、マルチモーダルなフェイクニュースをますます現実的で広範にし、公共の信頼と社会的安定に深刻な脅威を与えている。
textbfConflict-textbfOriented textbfREasoning (textbfCORE) フレームワークを提案する。
COREは堅牢で一般化可能なコンフリクト検出を実現し、いくつかのサンプルやゼロショット設定で、目に見えない操作タイプに効果的かつ迅速に適応する。
論文 参考訳(メタデータ) (2026-06-02T02:53:48Z) - Boosting Temporal Sentence Grounding via Causal Inference [55.61521060331558]
テンポラル・センテンス・グラウンディング(Temporal Sentence Grounding)は、あるテキストクエリに意味的に対応するビデオ中の関連モーメントを特定することを目的としている。
これらの素因的相関は,(1) 特定の動詞や句の頻繁な共起など,テキストデータに固有の偏り,(2) ビデオコンテンツにおける顕著なパターンや反復パターンに過度に適合する傾向,の2つの要因から生じる。
本稿では, 因果推論を利用した新たなTSGフレームワーク, 因果介入, 反ファクト推論を提案する。
論文 参考訳(メタデータ) (2025-07-07T13:01:06Z) - Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations? [37.703287009808896]
微調整は、非重要特徴とターゲットラベルの間に急激な相関を引き起こす可能性がある。
実世界の視覚探索探索(VQA)ベンチマークにおいて,GPT-4oエラーを抽出してベンチマークを作成する。
SpuriVerse上で15のオープンソースLVLMを評価し、最先端のクローズドソースモデルでもかなり苦労していることを発見した。
論文 参考訳(メタデータ) (2025-06-23T06:11:43Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - Extractive is not Faithful: An Investigation of Broad Unfaithfulness
Problems in Extractive Summarization [91.86501509439815]
本研究は,抽出要約に現れる5種類の広い不信問題を持つ類型論を定義する。
我々は16の多様な抽出システムによって生成された1600の英語の要約の中から、これらの問題をラベル付けするよう人間に求めている。
これらの問題を自動検出するために,要約のための既存の5つの信頼度評価指標は,人間の判断と相関が低いことがわかった。
論文 参考訳(メタデータ) (2022-09-08T03:25:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。