論文の概要: Inspicio: Open-Vocabulary, LLM-Based Sense Retrieval for Historical Languages
- arxiv url: http://arxiv.org/abs/2609.00998v1
- Date: Tue, 01 Sep 2026 09:46:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.54315
- Title: Inspicio: Open-Vocabulary, LLM-Based Sense Retrieval for Historical Languages
- Title(参考訳): Inspicio: 歴史的言語のためのオープン語彙, LLMに基づくセンス検索
- Authors: Michele Ciletti,
- Abstract要約: Inspicioはオープン・ボキャブラリ検索パイプラインであり、オープン・イングリッシュ・ワードネットのシンセセットとコンテキスト内のトークンをリンクする。
それぞれの事象に対して、命令調整されたLLMは2つの英訳、少数の辞書スタイルの定義、およびいくつかの英語の補題を生成する。
我々は,ラテン文字と古代ギリシア語の知覚動詞を手動で注釈付けした新しいバイリンガル集合に対して,LLMの6x6グリッドと文埋め込みモデルを用いたパイプラインの評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Word Sense Disambiguation has advanced rapidly for English and a handful of well-resourced modern languages, but it continues to assume the existence of a sense inventory and a word-to-sense mapping in the source language (Navigli, 2026). These assumptions break down for most historical and low-resource languages, whose dedicated WordNets are either incomplete or still under construction. We present Inspicio, an open-vocabulary retrieval pipeline that links tokens in context to synsets of the Open English WordNet (McCrae et al., 2020) without requiring any source-language inventory or mapping. For each occurrence, an instruction-tuned LLM produces two English translations of the surrounding sentence, a small set of candidate dictionary-style definitions, and a few candidate English lemmas. These outputs drive a hybrid retrieval step that combines dense definition-synset similarity, sparse lemma matching, and Maximal Marginal Relevance re-ranking. We evaluate the pipeline across a 6x6 grid of LLMs and sentence-embedding models on a new bilingual set of manually annotated Latin and Ancient Greek perception verbs, on a subset of PREMOVE dataset (Farina, 2025), and on a diachronic sample of Italian. The best configuration reaches 96% Recall@50 on the perception-verb test set, with each component contributing measurable gains, and remains competitive in the out-of-domain and cross-lingual settings.
- Abstract(参考訳): Word Sense Disambiguation は、英語と、ごく少数の十分な情報源を持つ現代言語に対して急速に進歩してきたが、ソース言語におけるセンスインベントリとワード・トゥ・センスマッピングの存在を仮定し続けている(Navigli, 2026)。
これらの仮定は、WordNetが未完成かまだ構築中である、ほとんどの歴史的および低リソースの言語で分解される。
Inspicioは、オープンイングリッシュワードネット(McCrae et al , 2020)のシンセセットにコンテクスト内のトークンをリンクするオープン語彙検索パイプラインである。
各事象に対して、命令調整されたLLMは、周囲の文の2つの英語翻訳、少数の辞書スタイルの定義、およびいくつかの英語の補題を生成する。
これらの出力は、密度の高い定義とシンセットの類似性、スパース・レムママッチング、最大Marginal Relevanceを再ランク付けするハイブリッド検索ステップを駆動する。
本研究は,LLMの6x6グリッドのパイプラインと,ラテン語と古代ギリシア語を手動でアノテートした新たなバイリンガル集合を用いた文埋め込みモデル,PreMOVEデータセットのサブセット(Farina,2025)およびイタリア語のダイアクロニック標本を用いて,パイプラインを評価した。
最高の設定は、知覚バーブテストセットで96%のRecall@50に達し、各コンポーネントは測定可能なゲインをもたらし、ドメイン外および言語間設定で競争力を維持する。
関連論文リスト
- Syntax as a Rosetta Stone: Universal Dependencies for In-Context Coptic Translation [6.070010259231488]
本稿では,コプト語から英語への低リソース機械翻訳を支援する新しい文脈内学習手法を提案する。
本研究の結果から,構文情報だけでは辞書のグルースほど有用ではないが,検索した辞書項目と構文情報を組み合わせることで,モデルサイズ間で大きな利得が得られることがわかった。
論文 参考訳(メタデータ) (2026-04-20T19:07:32Z) - Generating Concept Lexicalizations via Dictionary-Based Cross-Lingual Sense Projection [11.136711217530157]
目的語補題と既存の語彙概念をセマンティック・プロジェクションで関連付けることで感覚を生成する。
提案手法は,英語の構文をアライメントされたターゲット言語トークンに投影し,対応する補題をそれらの合成集合に割り当てる。
本手法を,辞書ベースおよび大規模言語モデルベースラインと同様に,先行手法と比較し,複数の言語で評価する。
論文 参考訳(メタデータ) (2026-04-15T20:27:26Z) - MINERS: Multilingual Language Models as Semantic Retrievers [23.686762008696547]
本稿では,意味検索タスクにおける多言語言語モデルの有効性を評価するためのベンチマークであるMINERSを紹介する。
我々は,200以上の多言語にわたるサンプルの検索において,LMの堅牢性を評価する包括的なフレームワークを構築した。
以上の結果から,意味論的に類似した埋め込みを検索することで,最先端のアプローチと競合する性能が得られることが示された。
論文 参考訳(メタデータ) (2024-06-11T16:26:18Z) - A Novel Cartography-Based Curriculum Learning Method Applied on RoNLI: The First Romanian Natural Language Inference Corpus [71.77214818319054]
自然言語推論は自然言語理解のプロキシである。
ルーマニア語のNLIコーパスは公開されていない。
58Kの訓練文対からなるルーマニア初のNLIコーパス(RoNLI)を紹介する。
論文 参考訳(メタデータ) (2024-05-20T08:41:15Z) - Retrieval-Augmented Multilingual Keyphrase Generation with
Retriever-Generator Iterative Training [66.64843711515341]
キーフレーズ生成は、長いテキストが与えられたキーフレーズを自動的に予測するタスクである。
我々は多言語キーフレーズ生成という新しい設定に注意を払っている。
非英語言語におけるデータ不足問題を軽減するために,多言語キーフレーズ生成のための検索拡張手法を提案する。
論文 参考訳(メタデータ) (2022-05-21T00:45:21Z) - Learning Contextualised Cross-lingual Word Embeddings and Alignments for
Extremely Low-Resource Languages Using Parallel Corpora [63.5286019659504]
そこで本稿では,小さな並列コーパスに基づく文脈型言語間単語埋め込み学習手法を提案する。
本手法は,入力文の翻訳と再構成を同時に行うLSTMエンコーダデコーダモデルを用いて単語埋め込みを実現する。
論文 参考訳(メタデータ) (2020-10-27T22:24:01Z) - Discovering Bilingual Lexicons in Polyglot Word Embeddings [32.53342453685406]
本研究では,多言語単語の埋め込みを生成する多言語コーパスで訓練された1つのスキップグラムモデルを利用する。
本稿では, 比較的単純な近傍サンプリング手法により, バイリンガル辞書を検索できることを示す。
3つのヨーロッパ語対にまたがって、多言語単語の埋め込みは、確かに単語のリッチな意味表現を学習する。
論文 参考訳(メタデータ) (2020-08-31T03:57:50Z) - A Multi-Perspective Architecture for Semantic Code Search [58.73778219645548]
テキストマッチングのための新しい多言語間ニューラルネットワークを提案する。
CoNaLaデータセットを用いた実験により,提案したモデルでは,従来の手法よりも優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2020-05-06T04:46:11Z) - Multi-SimLex: A Large-Scale Evaluation of Multilingual and Cross-Lingual
Lexical Semantic Similarity [67.36239720463657]
Multi-SimLexは、12の異なる言語のデータセットをカバーする大規模な語彙リソースと評価ベンチマークである。
各言語データセットは、意味的類似性の語彙的関係に注釈付けされ、1,888のセマンティック・アライメント・コンセプト・ペアを含む。
言語間の概念の整合性のため、66の言語間セマンティック類似性データセットを提供する。
論文 参考訳(メタデータ) (2020-03-10T17:17:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。