論文の概要: ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels
- arxiv url: http://arxiv.org/abs/2608.03507v1
- Date: Tue, 04 Aug 2026 11:49:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.162079
- Title: ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels
- Title(参考訳): ChronoLens: 時間、言語、言語レベルの言語変化を測定する
- Authors: Gagan Bhatia, Julian Schlenker, Simone Paolo Ponzetto, Steffen Eger,
- Abstract要約: 一つの分析空間内の言語レベル,言語,歴史的期間において,変化の大きさと方向がどう異なるかを示す。
冷凍多言語モデル,特徴整合型クロスコーダ,ポストホック言語介入を組み合わせたフレームワークであるChronoLensを紹介する。
- 参考スコア(独自算出の注目度): 30.58256014365214
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Historical language change affects morphology, syntax, semantics, and pragmatics, yet computational studies typically examine these levels with incompatible representations and therefore cannot determine whether they evolve together across languages. We address this problem by asking how the magnitude and direction of change vary across linguistic levels, languages, and historical periods within a single analytical space. We introduce ChronoLens, a framework that combines frozen multilingual language models, feature-aligned crosscoders, and post-hoc linguistic interventions, and apply it to 44.98 million documents and approximately 17.2 billion tokens from five parliamentary traditions spanning 1803--2026. The resulting sparse representations agree substantially more strongly with linguistic statistics than dense embeddings or a pooled sparse autoencoder ($ρ=0.72$ versus $0.29$ and $0.28$), and reveal that morphology, syntax, semantics, and pragmatics generally change by comparable amounts within a language, while languages differ markedly in when, how far, and in which direction they change. These findings show that historical language change is a structured, multidimensional process: similar magnitudes can conceal different trajectories, and meaningful cross-linguistic comparison requires measuring both distance and direction.
- Abstract(参考訳): 歴史的言語の変化は形態学、構文、意味論、プラグマティクスに影響を及ぼすが、計算学的研究は通常、これらのレベルを非互換な表現で調べる。
一つの分析空間内の言語レベル,言語,歴史的期間によって,変化の大きさや方向がどう異なるのかを問うことで,この問題に対処する。
凍結した多言語言語モデル、特徴整合型クロスコーダ、ポストホック言語介入を組み合わせたフレームワークであるChronoLensを導入し、1803年から2026年までの5つの議会の伝統から、4498万の文書と約1720億のトークンに適用する。
結果として得られるスパース表現は、密接な埋め込みやプール化されたスパースオートエンコーダ (ρ=0.72$ vs $0.29$ and $0.28$) よりも言語統計学にかなり強く一致する。
これらの結果は、歴史的言語変化は構造化された多次元的過程であり、類似の大きさは異なる軌跡を隠蔽でき、意味のある言語間比較は距離と方向の両方を測定する必要があることを示している。
関連論文リスト
- Model Misalignment and Language Change: Traces of AI-Associated Language in Unscripted Spoken English [0.0]
近年では、特に科学や教育において、文章言語は言葉の使用に顕著な変化を経験している。
モデルアウトプットと対象のオーディエンスノルムの相違は、ミスアライメントの一形態と見なすことができる。
我々は、会話科学と技術ポッドキャストから引き出された、未記述の音声言語から2210万語のデータセットを構築した。
論文 参考訳(メタデータ) (2025-08-01T00:47:33Z) - Neighbors and relatives: How do speech embeddings reflect linguistic connections across the world? [0.7168794329741259]
本研究では,XLS-R自己教師型言語識別モデルvox107-xls-r-300m-wav2vecの埋め込みを用いて106世界言語間の関係を解析した。
線形識別分析(LDA)を用いて、言語埋め込みをクラスタ化し、系譜、語彙、地理的距離と比較する。
その結果, 埋め込み型距離は従来の指標と密接に一致し, グローバルおよび局所的な類型パターンを効果的に捉えることができた。
論文 参考訳(メタデータ) (2025-06-10T08:33:34Z) - Variationist: Exploring Multifaceted Variation and Bias in Written Language Data [3.666781404469562]
言語データの探索と理解は、人間の言語を扱うあらゆる分野において、基本的な段階である。
しかし現時点では、言語の変化とバイアスをシームレスに検査し視覚化する、統一的でカスタマイズ可能なツールが欠如している。
本稿では、このギャップを埋める高度にモジュラーで記述的でタスクに依存しないツールである「変分主義」を紹介する。
論文 参考訳(メタデータ) (2024-06-25T15:41:07Z) - We're Calling an Intervention: Exploring Fundamental Hurdles in Adapting Language Models to Nonstandard Text [8.956635443376527]
非標準テキストへの言語モデル適応の根底にある課題を理解するための一連の実験を提示する。
我々は、ユーザ生成テキストの中核的な特徴と、既存の言語モデルのバイアスとの相互作用を近似する介入を設計する。
非標準テキスト変種への言語モデル適応における介入の適用により、そのような適応がいつ成功したかについて重要な洞察を得る。
論文 参考訳(メタデータ) (2024-04-10T18:56:53Z) - Syntactic Language Change in English and German: Metrics, Parsers, and Convergences [56.47832275431858]
本論文は,過去160年間の議会討論のコーパスを用いて,英語とドイツ語の統語的言語変化のダイアクロニックな傾向を考察する。
私たちは、広く使われているStanford Coreと、新しい4つの選択肢を含む5つの依存関係をベースとしています。
文長分布の尾部では,構文的尺度の変化が頻繁であることが明らかとなった。
論文 参考訳(メタデータ) (2024-02-18T11:46:16Z) - Language Model Tokenizers Introduce Unfairness Between Languages [98.92630681729518]
トークン化段階では,モデルが呼び出される直前に,異なる言語に対する扱いの相違が生じることを示す。
文字レベルとバイトレベルのモデルも、いくつかの言語ペアの符号化長の4倍以上の差を示している。
我々は、多言語で公平なサブワードトークン化器を用いて、将来の言語モデルを訓練するべきだと仮定する。
論文 参考訳(メタデータ) (2023-05-17T14:17:57Z) - Do Not Fire the Linguist: Grammatical Profiles Help Language Models
Detect Semantic Change [6.7485485663645495]
まず,10個のデータセット上での多言語ニューラル言語モデル(XLM-R)の性能を比較し,その性能を7つの言語で比較した。
この結果から,XLM-Rによる文法プロファイルのアンサンブルにより,ほとんどのデータセットや言語における意味変化検出性能が向上することが示唆された。
論文 参考訳(メタデータ) (2022-04-12T11:20:42Z) - A Massively Multilingual Analysis of Cross-linguality in Shared
Embedding Space [61.18554842370824]
言語間モデルでは、多くの異なる言語に対する表現は同じ空間に存在している。
我々は,bitext検索性能の形式で,言語間アライメントのタスクベース尺度を計算した。
我々はこれらのアライメント指標の潜在的な予測因子として言語的、準言語的、および訓練関連の特徴について検討する。
論文 参考訳(メタデータ) (2021-09-13T21:05:37Z) - Bridging Linguistic Typology and Multilingual Machine Translation with
Multi-View Language Representations [83.27475281544868]
特異ベクトル標準相関解析を用いて、各情報源からどのような情報が誘導されるかを調べる。
我々の表現は類型学を組み込み、言語関係と相関関係を強化する。
次に、多言語機械翻訳のための多視点言語ベクトル空間を利用して、競合する全体的な翻訳精度を実現する。
論文 参考訳(メタデータ) (2020-04-30T16:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。