論文の概要: Dynamics of meaning: Towards the Evaluation of Diachronic Semantic Change in Sinhala
- arxiv url: http://arxiv.org/abs/2609.08609v2
- Date: Wed, 09 Sep 2026 05:52:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.640147
- Title: Dynamics of meaning: Towards the Evaluation of Diachronic Semantic Change in Sinhala
- Title(参考訳): 意味のダイナミクス:シンハラにおけるダイアクロニック・セマンティック・チェンジの評価に向けて
- Authors: Nevidu Jayatilleke, Nisansa de Silva,
- Abstract要約: 本研究では,13世紀から20世紀にかけてのシンハラ語の年代変化を多段階計算フレームワークを用いて検討した。
我々はまず、SMA(Simisity Matrix Based Alignment)とOP(Orthogonal Procrustes)技術を用いて、世紀固有のWord2VecとFastTextの埋め込みを調整する。
本研究では, 微調整したLlama-3.1-8Bの組込みによる双方向セマンティック・インパクト・プルーニング手法を提案する。
- 参考スコア(独自算出の注目度): 1.256381443503838
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tracking semantic change in low-resource languages across extensive historical timelines presents significant challenges due to data scarcity and the limitations of static embedding alignments. This study investigates the diachronic evolution of the Sinhala language from the 13th to the 20th century using a multi-stage computational framework. We first align century-specific Word2Vec and FastText embeddings using Similarity Matrix Based Alignment (SMA) and Orthogonal Procrustes (OP) techniques, finding that OP alignment provides more stable neighbourhood tracking for identifying temporal similarity dips. To move beyond aggregate measures, we introduce a Bidirectional Semantic Impact Pruning approach using contextualised embeddings from a fine-tuned Llama-3.1-8B. By applying Leave-One-Out (LOO) diagnostics, we attempt to isolate influential sentences to distinguish between systemic semantic shifts and transient polysemic expansion. Our results show that semantic drift in the fine-tuned Llama-3.1-8B is not evenly distributed across all usages. Instead, a significant part of the change is driven by a smaller set of high-impact contextual instances, rather than gradual and uniform change across all occurrences. This work provides a preliminary framework for diachronic analysis in low-resource contexts, highlighting the trade-offs between model sensitivity and data availability.
- Abstract(参考訳): 大規模な履歴タイムラインにわたる低リソース言語のセマンティックな変化を追跡することは、データの不足と静的な埋め込みアライメントの制限による重大な課題を示す。
本研究では,13世紀から20世紀にかけてのシンハラ語の年代変化を多段階計算フレームワークを用いて検討した。
我々はまず、SMA(Simisity Matrix Based Alignment)とOP(Orthogonal Procrustes)技術を用いて、世紀固有のWord2VecとFastTextの埋め込みをアライメントし、OPアライメントにより、時間的類似性ディップを識別するためのより安定した近傍追跡が可能になることを発見した。
本研究では, 微調整したLlama-3.1-8Bの組込みによる双方向セマンティック・インパクト・プルーニング手法を提案する。
LOO(Leave-One-Out)診断を応用し,系統的な意味変化と一過性のポリセミック展開を区別するために,影響力のある文を分離しようとする。
その結果, 微調整したLlama-3.1-8Bのセマンティックドリフトは, 全用途に均等に分散していないことがわかった。
代わりに、変更の重要な部分は、すべての発生に対して徐々に、均一に変化するのではなく、より小さな高インパクトなコンテキストインスタンスによって駆動される。
この研究は、低リソースのコンテキストにおけるダイアクロニック分析のための予備的なフレームワークを提供し、モデル感度とデータ可用性のトレードオフを強調します。
関連論文リスト
- Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology [8.2867621159451]
GAUCは,事前学習されたマルチモーダル埋め込み空間で直接動作する,トレーニング不要なコアセット選択法である。
CRC-100K と MHIST が複数のオープンソース VLM アーキテクチャにまたがっている場合、GAUC は精度、キャリブレーション、高速な勾配ロバスト性を改善している。
論文 参考訳(メタデータ) (2026-05-18T13:54:04Z) - Measuring Temporal Linguistic Emergence in Diffusion Language Models [0.0]
拡散言語モデルは明示的な聴覚的軌跡を露呈する。
WikiText-103テキスト上でLLaDA-8B-Baseの3つの独立した32ステップ実行について検討する。
論文 参考訳(メタデータ) (2026-04-25T10:17:47Z) - Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition [6.392844932864485]
SympLocは、粗い段階における多レベルアライメントを備えた、新しい粗大な局所化フレームワークである。
既存の最先端のアプローチと比較して、Top-1リコール@10mでは19%改善されている。
論文 参考訳(メタデータ) (2026-04-02T04:13:42Z) - Word-Anchored Temporal Forgery Localization [6.691985085293349]
候補偽造提案を導出するために,単語アンコール時間的偽造位置推定(WAFL)を提案する。
まず、時間的偽造の本質を分析し、最小の有意義な偽造単位、単語トークンを識別し、データ前処理を音声の自然な言語境界と整合させる。
偽造検出に固有の極端なクラス不均衡を克服するために,アーティファクト中心非対称損失(ACA)を設計する。
論文 参考訳(メタデータ) (2026-03-06T12:33:28Z) - Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition [41.77490816513839]
ゼロショットスケルトン動作認識のための新しい手法を,$texttt$textbfFlora$$として提案する。
具体的には、方向対応の地域意味論と相互整合性目標を取り入れたテキスト意味論を実践する。
3つのベンチマークデータセットによる実験により,本手法の有効性が検証された。
論文 参考訳(メタデータ) (2025-11-12T14:54:53Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - Spatial Semantic Recurrent Mining for Referring Image Segmentation [63.34997546393106]
高品質なクロスモーダリティ融合を実現するために,Stextsuperscript2RMを提案する。
これは、言語特徴の分散、空間的意味的再帰的分離、パーセマンティック・セマンティック・バランシングという三部作の作業戦略に従う。
提案手法は他の最先端アルゴリズムに対して好適に機能する。
論文 参考訳(メタデータ) (2024-05-15T00:17:48Z) - Contextualized Semantic Distance between Highly Overlapped Texts [85.1541170468617]
テキスト編集や意味的類似性評価といった自然言語処理タスクにおいて、ペア化されたテキストに重複が頻繁に発生する。
本稿では,マスク・アンド・予測戦略を用いてこの問題に対処することを目的とする。
本稿では,最も長い単語列の単語を隣接する単語とみなし,その位置の分布を予測するためにマスク付き言語モデリング(MLM)を用いる。
セマンティックテキスト類似性の実験では、NDDは様々な意味的差異、特に高い重なり合うペアテキストに対してより敏感であることが示されている。
論文 参考訳(メタデータ) (2021-10-04T03:59:15Z) - Dense Contrastive Visual-Linguistic Pretraining [53.61233531733243]
画像とテキストを共同で表現するマルチモーダル表現学習手法が提案されている。
これらの手法は,大規模マルチモーダル事前学習から高レベルな意味情報を取得することにより,優れた性能を実現する。
そこで本稿では,非バイアスのDense Contrastive Visual-Linguistic Pretrainingを提案する。
論文 参考訳(メタデータ) (2021-09-24T07:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。