論文の概要: Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking
- arxiv url: http://arxiv.org/abs/2609.10745v1
- Date: Wed, 09 Sep 2026 18:41:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.113144
- Title: Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking
- Title(参考訳): リンクする前に考える:多言語エンティティリンクにおけるRarity、Reasoning、Retrieval
- Abstract要約: グラウンドをリンクするマルチモーダルエンティティは、テキストや画像から知識ベースのエントリに言及する。
これらのシステムは希少なエンティティで分解されるが、以前の作業は主にページビューのような人気ベースのメトリクスによって、希少性を測定する。
我々は、エンティティがいかにドキュメント化され、接続されているかをキャプチャする知識グラフ構造メトリクスを使用して、この見解を広げる。
その結果得られた希薄なスライス全体において、最先端の精度は15.4-39.9%低下し、異なる希薄な定義が異なる障害モードを示すことを示した。
- 参考スコア(独自算出の注目度): 53.172843070114475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal entity linking grounds entity mentions in text and images to knowledge-base entries. These systems degrade on rare entities, but prior work measures rarity primarily through popularity-based metrics such as pageviews. We broaden this view using knowledge-graph structural metrics that capture how well an entity is documented and connected. These metrics identify many rare entities that popularity metrics miss. Across the resulting rare-entity slices, state-of-the-art accuracy drops by 15.4-39.9%, showing that different rarity definitions expose different failure modes. To address these failures, we introduce a simple, training-free framework in which a reasoning-capable vision-language model iteratively searches and reasons over Wikipedia, gathering evidence dynamically. Controlled experiments show that reasoning and retrieval are complementary. Reasoning alone does not significantly improve accuracy on rare entities. Retrieval without reasoning improves rare-entity accuracy but can hurt overall accuracy. Their combination performs best. On MERLIN, a multilingual multimodal entity linking benchmark over five languages (Hindi, Indonesian, Japanese, Tamil, Vietnamese), our best system improves over the state of the art by 6.9% overall and by up to 23.3% on rare-entity slices. We release MERLIN-Rare, rare-entity test slices for targeted evaluation, with our framework.
- Abstract(参考訳): グラウンドをリンクするマルチモーダルエンティティは、テキストや画像から知識ベースのエントリに言及する。
これらのシステムは希少なエンティティで分解されるが、以前の作業は主にページビューのような人気ベースのメトリクスによって、希少性を測定する。
我々は、エンティティがいかにドキュメント化され、接続されているかをキャプチャする知識グラフ構造メトリクスを使用して、この見解を広げる。
これらの指標は、人気指標が欠落する稀な要素の多くを識別する。
結果として生じる希薄なスライス全体において、最先端の精度は15.4-39.9%低下し、異なる希薄な定義が異なる障害モードを示すことを示した。
これらの障害に対処するために,推論可能な視覚言語モデルをウィキペディア上で反復的に検索し,証拠を動的に収集する,シンプルなトレーニング不要のフレームワークを導入する。
制御された実験は、推論と検索が相補的であることを示している。
推論だけでは希少な実体の精度は著しく向上しない。
推論なしで検索することで、希少性精度は向上するが、全体的な精度を損なう可能性がある。
彼らの組み合わせは最高に機能する。
MERLINは5つの言語(ヒンディー語、インドネシア語、日本語、タミル語、ベトナム語)にまたがるマルチリンガル・マルチモーダル・エンティティ・リンク・ベンチマークである。
MERLIN-Rareは、ターゲット評価のための希少なテストスライスである。
関連論文リスト
- Lower-Resource, Higher Scores: Language Bias in LLM Evaluators [27.959960538188753]
意味論的に同一の命令応答対を23言語で実験する。
その結果、多言語評価器は異なる評価言語に大きく異なるスコアを割り当てていることがわかった。
論文 参考訳(メタデータ) (2026-07-16T01:53:09Z) - Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs [54.72295694649798]
大規模な推論モデル (LRM) は、英語で強力な数学的推論性能を達成するが、多くの低級言語や中級言語では信頼性が低い。
モデルの推論言語を制御することは、精度を大幅に低下させることを示し、言語が推論実行自体に影響を及ぼすことを示唆する。
12言語にわたるQwen3シリーズの実験では、英語以外の推論ではアンカーカバレッジが減少し、依存関係の忠実度が低下することが多い。
論文 参考訳(メタデータ) (2026-05-26T21:41:52Z) - TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities [35.1254326443212]
データ・テキスト・ジェネレーションにおけるロングテール・エンティティの最初の体系的研究について述べる。
Wikidataから構築された、英語、イタリア語、スペイン語の新しい多言語ベンチマークであるTailNLGを紹介します。
モデルや言語によって長い範囲のエンティティの影響が異なり、既存の評価指標がこれらの違いを常に捉えていないことを示す。
論文 参考訳(メタデータ) (2026-03-29T17:01:54Z) - CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data [56.043078390377076]
我々はコミュニティ主導のウェブドメイン向けLIDベンチマークであるCommonLIDを紹介する。
我々は,他の5つの共通評価セットと合わせて,CommonLIDの価値を示し,8つのLIDモデルを検証した。
既存の評価では、Webドメイン内の多くの言語に対して、LIDの精度を過大評価している。
論文 参考訳(メタデータ) (2026-01-25T22:49:30Z) - Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation [57.11989521509119]
本稿では,特殊なサブエージェントを起動するリフレクティブコアエージェントを中心に,エージェント翻訳評価フレームワークを提案する。
実験の結果、RATEの有効性が示され、現在の測定値と比較して少なくとも3.2メタスコアの改善が達成された。
論文 参考訳(メタデータ) (2026-01-12T09:03:42Z) - Detecting Corpus-Level Knowledge Inconsistencies in Wikipedia with Large Language Models [11.16952630564181]
不整合, 特定の事実的不整合に着目し, コーパスレベルの不整合検出の課題を導入する。
本稿では,LLM推論と検索を組み合わせたエージェントシステムであるCLAIREについて述べる。
経験豊富なウィキペディア編集者によるユーザスタディでは、87.5%がCLAIREを使用する際の信頼性が高く、参加者は同じ時間内に64.7%の矛盾が見つかった。
論文 参考訳(メタデータ) (2025-09-27T10:32:41Z) - Cobra Effect in Reference-Free Image Captioning Metrics [58.438648377314436]
視覚言語事前学習モデル(VLM)を活用した参照フリー手法の普及が出現している。
本稿では,基準自由度に欠陥があるかどうかを考察する。
GPT-4Vは生成した文を評価するための評価ツールであり,提案手法がSOTA(State-of-the-art)の性能を達成することを示す。
論文 参考訳(メタデータ) (2024-02-18T12:36:23Z) - Detecting and Mitigating Hallucinations in Multilingual Summarisation [40.5267502712576]
幻覚は抽象的な要約のためのニューラルネットワークの信頼性に重大な課題をもたらす。
我々は、非英語要約の忠実度を評価する新しい計量mFACTを開発した。
そこで我々は,言語間移動による幻覚を減らすための,シンプルだが効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-05-23T02:59:25Z) - Entity Disambiguation with Entity Definitions [50.01142092276296]
ローカルモデルはEntity Disambiguation (ED)で最近驚くべきパフォーマンスを達成した
それまでの研究は、各候補者のテキスト表現として、ウィキペディアのタイトルのみを使うことに限られていた。
本稿では、この制限に対処し、より表現力のあるテキスト表現がそれを緩和できる範囲について検討する。
提案する6つのベンチマークのうち2つに新たな技術の現状を報告し,未知のパターンに対する一般化能力を強く改善する。
論文 参考訳(メタデータ) (2022-10-11T17:46:28Z) - Reliable Fidelity and Diversity Metrics for Generative Models [30.941563781926202]
Fr'echet Inception Distance (FID)スコアは、Fr'echet Inception Distance(FID)スコアである。
最新の精度とリコール基準でさえまだ信頼性が低いことを示す。
上記の問題を解決するための密度とカバレッジの指標を提案する。
論文 参考訳(メタデータ) (2020-02-23T00:50:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。