論文の概要: Analyzing Traditional and Neural Approaches to Multilingual Readability Assessment
- arxiv url: http://arxiv.org/abs/2609.10792v1
- Date: Wed, 09 Sep 2026 19:56:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.131996
- Title: Analyzing Traditional and Neural Approaches to Multilingual Readability Assessment
- Title(参考訳): 多言語可読性評価における伝統的・ニューラルアプローチの分析
- Abstract要約: トランスフォーマーがアラビア語、英語、フランス語、ヒンディー語、ロシア語の伝統的なモデルと同じ機能を内部化するかどうかをテストする。
トランスフォーマーは、表面長、構文、語彙の多様性の信号を復元し、従来のモデルの順序CEFR構造を反映する。
- 参考スコア(独自算出の注目度): 3.7640287708881277
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer-based models excel at Automatic Readability Assessment (ARA), yet feature-based models remain in active use because their predictions tie back to linguistic properties. This matters because readability labels are subjective and rater-dependent, so high accuracy on noisy ground truth may reflect surface patterns rather than the linguistic structure that defines difficulty. We test whether transformers internalize the same features as traditional models across Arabic, English, French, Hindi, and Russian using the ReadMe++ dataset. Shapley Additive Explanations (SHAP) identify the features driving traditional classifiers, which we then use as TCAV concept sets to probe multilingual XLM-R and language-specific encoders. Transformers recover surface-length, syntactic, and lexical-diversity signals, and reflect the ordinal CEFR structure of the traditional models. Alignment varies by model family, language, and layer, with language-specific encoders tracking traditional models more clearly than XLM-R. High linear separability does not always imply directional influence, limiting linear probing for count-based readability features.
- Abstract(参考訳): トランスフォーマーベースのモデルは、自動可読性評価 (ARA) で優れているが、それらの予測は言語特性と結びついているため、機能ベースのモデルは依然として有効である。
これは、可読性ラベルが主観的でレーダに依存しているため、ノイズの多い基底の真実に対する高い精度は、難易度を定義する言語構造よりも表面のパターンを反映する可能性がある。
トランスフォーマーが従来のモデルと同じ機能を、アラビア語、英語、フランス語、ヒンディー語、ロシア語でReadMe++データセットを使って内部化するかどうかをテストする。
Shapley Additive Explanations (SHAP)は、従来の分類器を駆動する特徴を識別し、TCAVの概念セットとして、多言語XLM-Rおよび言語固有のエンコーダを探索する。
トランスフォーマーは、表面長、構文、語彙の多様性の信号を復元し、従来のモデルの順序CEFR構造を反映する。
アライメントはモデルファミリ、言語、レイヤによって異なり、言語固有のエンコーダはXLM-Rよりも明確に伝統的なモデルを追跡する。
高い線形分離性は必ずしも方向性の影響を示唆するものではなく、カウントベースの可読性の特徴に対して線形探索を制限する。
関連論文リスト
- Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs [10.87622116540203]
Hessian-Enhanced Token Attribution (HETA)はデコーダのみの言語モデルに適した新しい属性フレームワークである。
HETAは3つの相補的なコンポーネントを組み合わせる: 層間のトークン間影響をキャプチャするセマンティック・トランジション・ベクター、二階効果をモデル化するヘッセン系感度スコア、トークンが隠蔽された際の情報損失を測定するKL発散。
複数のモデルやデータセットにまたがる実証的な評価は、HETAが既存の手法よりも、属性の忠実さと人間のアノテーションとの整合性を一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-04-14T19:43:43Z) - Beyond Subtokens: A Rich Character Embedding for Low-resource and Morphologically Complex Languages [5.338837380875301]
word2vec、BERT、GPTといったトークン化とサブトークン化に基づくモデルは、自然言語処理における最先端のモデルである。
本稿では,文字列から直接単語ベクトルを計算し,意味情報と構文情報を統合することを提案する。
BERTのようなコンテキストベースの大規模言語モデルと、低リソースおよび形態学的にリッチな言語のための word2vec のような小さなモデルの両方のパフォーマンスを改善する可能性がある。
論文 参考訳(メタデータ) (2026-02-24T21:16:08Z) - Causal Language Control in Multilingual Transformers via Sparse Feature Steering [7.754609745940422]
マルチ言語モデルの生成言語を操るために,スパースオートエンコーダの機能を活用できるかどうかを検討する。
我々は、FastText言語分類によって測定された、最大90%の成功で制御された言語シフトを達成する。
解析の結果,言語ステアリングは中間から後期のトランスフォーマー層において最も効果的であることが判明した。
論文 参考訳(メタデータ) (2025-07-17T06:49:16Z) - Latent Thought Models with Variational Bayes Inference-Time Computation [52.63299874322121]
ラテント思考モデル(LTM)は、ラテント空間における明示的な事前モデルに従う明示的なラテント思考ベクトルを包含する。
LTMは自己回帰モデルや離散拡散モデルよりも優れたサンプルおよびパラメータ効率を示す。
論文 参考訳(メタデータ) (2025-02-03T17:50:34Z) - LatentQA: Teaching LLMs to Decode Activations Into Natural Language [72.87064562349742]
自然言語におけるモデルアクティベーションに関するオープンな疑問に答えるタスクであるLatentQAを紹介する。
本稿では,アクティベーションと関連する質問応答ペアのデータセット上で,デコーダLLMを微調整するLatent Interpretation Tuning (LIT)を提案する。
我々のデコーダはまた、ステレオタイプ付き文のモデルのデバイアス化や世代ごとの感情制御など、モデルを制御するために使用する差別化可能な損失も規定している。
論文 参考訳(メタデータ) (2024-12-11T18:59:33Z) - Exploring Large Language Models for Detecting Mental Disorders [6.5144428714312035]
本稿では、抑うつや不安を検知するタスクにおける機械学習手法、エンコーダベースモデル、および大規模言語モデル(LLM)の有効性を比較した。
我々は、言語的特徴に基づくAutoMLモデル、BERTのようなエンコーダベースのトランスフォーマーのバリエーション、そして病理分類モデルとして最先端のLCMを試験した。
論文 参考訳(メタデータ) (2024-10-09T17:51:55Z) - What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages [78.1866280652834]
大規模言語モデル (LM) は文字列上の分布である。
RNNとTransformer LMによる規則的LM(RLM)の学習性について検討する。
RNNとトランスフォーマーの双方において,RLMランクの複雑さは強く,学習可能性の有意な予測因子であることが判明した。
論文 参考訳(メタデータ) (2024-06-06T17:34:24Z) - LAMASSU: Streaming Language-Agnostic Multilingual Speech Recognition and
Translation Using Neural Transducers [71.76680102779765]
自動音声認識(ASR)と音声翻訳(ST)はどちらもモデル構造としてニューラルトランスデューサを使用することができる。
ニューラルトランスデューサを用いた多言語音声認識および翻訳モデルであるLAMASSUを提案する。
論文 参考訳(メタデータ) (2022-11-05T04:03:55Z) - Shapley Head Pruning: Identifying and Removing Interference in
Multilingual Transformers [54.4919139401528]
言語固有のパラメータを識別・解析することで干渉を減らすことができることを示す。
固定モデルから同定された注目ヘッドを除去することで、文分類と構造予測の両方において、ターゲット言語の性能が向上することを示す。
論文 参考訳(メタデータ) (2022-10-11T18:11:37Z) - Offline RL for Natural Language Generation with Implicit Language Q
Learning [87.76695816348027]
ユーザ指定タスクの完了に関して、大きな言語モデルは矛盾する可能性がある。
本稿では,RLのフレキシブル・ユーティリティ・フレームワークと教師あり学習能力を組み合わせた新しいRL手法を提案する。
ILQLの実証的な検証に加えて、オフラインRLが自然言語生成設定で有用となるような、詳細な経験的分析状況も提示する。
論文 参考訳(メタデータ) (2022-06-05T18:38:42Z) - Disentangling Generative Factors in Natural Language with Discrete
Variational Autoencoders [0.0]
連続変数は、テキスト中のほとんどの生成因子が離散的であるという事実から、テキストデータの特徴をモデル化するのに理想的ではないかもしれない。
本稿では,言語特徴を離散変数としてモデル化し,不整合表現を学習するための変数間の独立性を促進する変分自動符号化手法を提案する。
論文 参考訳(メタデータ) (2021-09-15T09:10:05Z) - Exploring Software Naturalness through Neural Language Models [56.1315223210742]
ソフトウェア自然性仮説(Software Naturalness hypothesis)は、自然言語処理で使用されるのと同じ手法でプログラミング言語を理解することができると主張している。
この仮説は,事前学習されたトランスフォーマーベース言語モデルを用いて,コード解析タスクを実行することによって検討する。
論文 参考訳(メタデータ) (2020-06-22T21:56:14Z) - Linguistic Typology Features from Text: Inferring the Sparse Features of
World Atlas of Language Structures [73.06435180872293]
我々は、バイト埋め込みと畳み込み層に基づく繰り返しニューラルネットワーク予測器を構築する。
様々な言語型の特徴を確実に予測できることを示す。
論文 参考訳(メタデータ) (2020-04-30T21:00:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。