論文の概要: Self-Supervised Lexical Representation Learning for Fast, Large-Scale Phylogenetic Inference
- arxiv url: http://arxiv.org/abs/2609.05262v1
- Date: Fri, 04 Sep 2026 15:23:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:24.10189
- Title: Self-Supervised Lexical Representation Learning for Fast, Large-Scale Phylogenetic Inference
- Title(参考訳): 高速大規模系統推定のための自己教師付き語彙表現学習
- Abstract要約: 本稿では,完全自己教師型コントラスト学習フレームワークを提案する。
生のIPA転写されたワードリストから直接語彙表現を学習する。
3,399品種の系統樹を推定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computational phylogenetics has become an essential tool in historical linguistics, yet its application at a global scale remains constrained by two factors: the labor-intensive manual annotation of cognacy judgments required for character-based methods and the substantial computational cost of inference on large datasets. This paper introduces a fully self-supervised contrastive learning framework that learns lexical representations directly from raw IPA-transcribed wordlists, without requiring cognacy annotations, alignments, or additional expert input. The model employs a dual contrastive objective: a word-level loss that organizes phonetically similar forms into a coherent space, and an auxiliary language-level loss that encourages the lexical space to reflect broader phonological properties of languages. From the resulting word representations, pairwise language distances are derived and used to infer a global phylogenetic tree of 3,399 language varieties. The inferred tree achieves a generalized quartet distance (GQD) to the Glottolog reference tree competitive with multiple baselines, while requiring only minutes of computation on a standard notebook GPU. Furthermore, the same representations capture diachronic concept stability: variance in pairwise distances across languages yields stability rankings that correlate significantly with established rankings. Ablation studies confirm that both the language-level objective and the use of phonetic feature vectors improved the inferred trees topology with regards to GQD. The framework thus provides a computationally efficient and fully automatic alternative for large-scale phylogenetic inference and offers a unified representation supporting downstream analyses at both the language and concept level.
- Abstract(参考訳): 計算系統学は歴史的言語学において必須の道具となっているが、そのグローバルスケールでの応用は、文字ベースの手法に必要とされる余計な判断の労働集約的手動アノテーションと、大規模なデータセットでの推論の相当な計算コストの2つの要因によって制限されている。
本稿では,IPAで書き起こされた単語リストから直接語彙表現を学習する,完全自己教師型コントラスト学習フレームワークを提案する。
このモデルでは、音素的に類似した形式をコヒーレントな空間に整理する単語レベルの損失と、語彙空間がより広い言語音韻特性を反映するように促す補助的な言語レベルの損失という、二重対照的な目的が採用されている。
得られた単語表現から、ペアワイズ言語距離が導出され、3,399種類の大域的系統樹を推定するために使用される。
推定木は、標準的なノートブックGPUで数分の計算しか必要とせず、複数のベースラインと競合するGlottolog参照木への一般化四重項距離(GQD)を達成する。
さらに、同じ表現がダイアクロニックな概念の安定性を捉える: 言語間の対距離のばらつきは、確立されたランクと大きく相関する安定性のランキングをもたらす。
アブレーション研究は、言語レベルの目的と音声特徴ベクトルの使用の両方が、GQDに関する推定木トポロジーを改善したことを確認した。
このフレームワークは、大規模系統推定のための計算効率が高く、完全に自動化された代替手段を提供し、言語と概念レベルで下流の分析をサポートする統一表現を提供する。
関連論文リスト
- Conceptual Networks for Cross-Linguistic Idiomatic Expressions: A Feature-Based Graph Approach [0.0]
本稿では,8言語にまたがる慣用的・具体的意味を表現するための解釈可能なネットワークベースのフレームワークを提案する。
各表現は認知言語理論から派生した二項概念的特徴で注釈付けされ、ペアワイドのジャカード類似性は重み付きグラフを定義する。
コミュニティ検出では、言語ではなく概念スキーマによってイディオムがクラスタ化され、認知言語学的な予測と一致した構造が生成される。
論文 参考訳(メタデータ) (2026-07-10T16:25:51Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Beyond cognacy [0.21756081703275998]
2つの完全に自動化された手法を比較し、語彙データから直接系統情報を抽出する。
以上の結果から,MSAに基づく推論は,より言語分類に整合し,タイプロジカルな変異を予測し,より明確な系統的シグナルを与えることがわかった。
論文 参考訳(メタデータ) (2025-07-02T06:47:34Z) - Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering [51.7493726399073]
本稿では,長文質問応答を改善するための対話型階層型フレームワークを提案する。
このフレームワークには3つの重要な革新がある: 長文の専門的な談話解析、LLMに基づく談話関係ノードの拡張、構造誘導階層検索である。
論文 参考訳(メタデータ) (2025-05-26T14:45:12Z) - Evaluating Distributed Representations for Multi-Level Lexical Semantics: A Research Proposal [3.3585951129432323]
この論文は、計算モデルと語彙意味論を橋渡しし、互いに補完することを目的としている。
現代のニューラルネットワーク(NN)は、個々の単語を密度が高く連続的な高次元ベクトルに圧縮することで分散表現を構築する。
論文 参考訳(メタデータ) (2024-06-02T14:08:51Z) - A Massively Multilingual Analysis of Cross-linguality in Shared
Embedding Space [61.18554842370824]
言語間モデルでは、多くの異なる言語に対する表現は同じ空間に存在している。
我々は,bitext検索性能の形式で,言語間アライメントのタスクベース尺度を計算した。
我々はこれらのアライメント指標の潜在的な予測因子として言語的、準言語的、および訓練関連の特徴について検討する。
論文 参考訳(メタデータ) (2021-09-13T21:05:37Z) - Discrete representations in neural models of spoken language [56.29049879393466]
音声言語の弱教師付きモデルの文脈における4つの一般的なメトリクスの利点を比較した。
異なる評価指標が矛盾する結果をもたらすことが分かりました。
論文 参考訳(メタデータ) (2021-05-12T11:02:02Z) - Infusing Finetuning with Semantic Dependencies [62.37697048781823]
シンタックスとは異なり、セマンティクスは今日の事前訓練モデルによって表面化されないことを示す。
次に、畳み込みグラフエンコーダを使用して、タスク固有の微調整にセマンティック解析を明示的に組み込む。
論文 参考訳(メタデータ) (2020-12-10T01:27:24Z) - Probing Multilingual BERT for Genetic and Typological Signals [28.360662552057324]
我々は多言語BERT(mBERT)の層を探索し,100言語にわたる系統的および地理的言語信号について検討した。
我々は,言語木を推定・評価するために,言語距離を用い,四重項木距離の点から基準系木に近いことが判明した。
論文 参考訳(メタデータ) (2020-11-04T00:03:04Z) - Learning Universal Representations from Word to Sentence [89.82415322763475]
この研究は普遍的な表現学習、すなわち一様ベクトル空間における言語単位の異なるレベルへの埋め込みを導入し、探求する。
本稿では, 単語, 句, 文の観点から, 類似したデータセットを構築するためのアプローチを提案する。
適切なトレーニング設定を組み込んだよく訓練されたトランスフォーマーモデルが、効果的に普遍的な表現が得られることを実証的に検証する。
論文 参考訳(メタデータ) (2020-09-10T03:53:18Z) - Exploiting Syntactic Structure for Better Language Modeling: A Syntactic
Distance Approach [78.77265671634454]
我々はマルチタスクの目的、すなわち、モデルが単語を同時に予測し、また「シンタクティック距離」と呼ばれる形態で真実解析木を解析する。
Penn Treebank と Chinese Treebank のデータセットによる実験結果から,地上の真理解析木を追加の訓練信号として提供すると,そのモデルはより低いパープレキシティを実現し,より良い品質で木を誘導できることが示された。
論文 参考訳(メタデータ) (2020-05-12T15:35:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。