論文の概要: Not All Irregularity Is Equal: Causally Isolating a Rare Failure Mode in Japanese Morphological Inflection
- arxiv url: http://arxiv.org/abs/2609.21179v1
- Date: Fri, 18 Sep 2026 00:47:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.805445
- Title: Not All Irregularity Is Equal: Causally Isolating a Rare Failure Mode in Japanese Morphological Inflection
- Title(参考訳): すべての不規則性は等しくない:日本語形態変化における希少な故障モードを因果的に分離する
- Abstract要約: 日本語の過去・過去・過去・過去・過去・過去・現在・過去・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・今・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在・現在、そのリストに登録されている日本語動詞の表記法について検討している。
構造的に特異な1つの不規則なサブタイプは、残差の30-43%を不均等に占め、総誤差の約34-48倍に寄与する。
これらの結果から, 神経形態学学習における誤差集中は, 個々の不規則性ではなく, 極低周波形態素パターンと特定の正書法過程との相互作用によって引き起こされることが明らかとなった。
- 参考スコア(独自算出の注目度): 6.1031222024562695
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural morphological generation systems often achieve high aggregate accuracy on benchmark datasets, yet such performance can conceal systematic errors clustered in rare morphological subclasses. We present an orthography-aware diagnosis of Japanese past-tense verb inflection, treating hiragana not merely as a transcriptional medium but as a representational system that encodes morphophonological structure. Using two character-level Transformer architectures evaluated across five random seeds, we show that although both systems exceed 97% aggregate accuracy, a single structurally specific irregular subtype, verbs whose stems end in /e/ and require gemination before the past-tense suffix and make up fewer than 1% of the data, accounts for a disproportionate 30-43% share of residual errors and contributes roughly 34-48x its prevalence to total errors. We then move from diagnosis to causal isolation: controlled ablation experiments show that removing this subtype alone produces larger accuracy gains than removing all irregular verbs combined. These findings indicate that error concentration in neural morphological learning is not driven by irregularity per se, but by the interaction between extreme low-frequency morphological patterns and specific orthographic processes. We argue that morphological evaluation should incorporate fine-grained subclass analysis, and discuss implications for data-efficient, developmentally plausible language model pretraining.
- Abstract(参考訳): ニューラルな形態素生成システムは、しばしばベンチマークデータセット上で高い集約精度を達成するが、そのような性能は希少な形態素サブクラスにクラスターされた系統的なエラーを隠蔽することができる。
本報告では, 日本語の過去の動詞の屈折を正書法で診断し, 平仮名を転写媒体としてだけでなく, 形態音学的構造を符号化する表現体系として扱う。
5種類の無作為種子で評価された2つの文字レベルのトランスフォーマーアーキテクチャを用いて, 両システムは, 97%の集合精度, 構造的に特異な1つの不規則なサブタイプ, 幹が/e/で終了し, 過去の接尾辞の前に発芽を必要とする動詞, 1%未満のデータ, 残差エラーの30~43%を占め, 総誤差の34~48倍の頻度で寄与していることを示す。
次に,診断から因果分離へ移行する:制御されたアブレーション実験により,このサブタイプのみを除去することで,不規則動詞を組み合わせて除去するよりも精度の高いゲインが得られることが示された。
これらの結果から, 神経形態学学習における誤差集中は, 個々の不規則性ではなく, 極低周波形態素パターンと特定の正書法過程との相互作用によって引き起こされることが明らかとなった。
形態学的評価は細粒度のサブクラス分析を取り入れるべきであり、データ効率が高く、発達可能な言語モデルの事前学習に影響を及ぼすことを議論する。
関連論文リスト
- Impute-EM: Native Mixed-State Diffusion Models for Heterogeneous Data Imputation [71.74203645336385]
Impute-EMは、現在のモデルとインプットされていないエントリを交換し、完了したデータに拡散バックボーンをリフィットする。
我々は、この更新を特徴付け、観測されたマスクインデクシングされた辺縁線が、その限界で目標と一致していることを示す。
論文 参考訳(メタデータ) (2026-09-14T09:39:13Z) - Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing [0.0]
本研究では,非自然性から構造誤差を分離する層状LLM補正パイプラインを提案する。
CEFR-J文法抽出器を用いて精度ギャップと慣用ギャップの2つの診断尺度を定量化する。
結果は、明確な記事、第三者の特異な-s、モーダル(可能ならば)は、かなりの精度の難しさを示す。
2次元の指導型は、誤り率と慣用的ギャップをマッピングし、正確だが文法的な項目とエラーが発生しやすいか、複雑な形式を区別する。
論文 参考訳(メタデータ) (2026-08-10T08:42:06Z) - When Irregularity Helps: A Subclass Analysis of Inductive Bias in Neural Morphology [6.1031222024562695]
非常に小さく、構造的に特異的な不規則なサブタイプが、モデルエラーの不均等な共有であることを示す。
これらの結果から, 過度な低周波形態素パターンと特定の形態素過程との相互作用により, 誤差濃度が誘導されることが示唆された。
論文 参考訳(メタデータ) (2026-05-19T23:18:47Z) - Mind Your Moras: Orthography-Aware Error Analysis of Neural Japanese Morphological Generation [6.1031222024562695]
本報告では, 日本語の過去の形態変化の正書法に基づく誤り解析について述べる。
SIGMORPHON 2020 と 2023 の共有タスク規約に従ってフォーマットされたデータセットを用いて,過去センス形成における2つの文字レベルのシーケンス・ツー・シーケンスアーキテクチャの評価を行った。
高い集約精度にもかかわらず、モデルはヒラガナの特定の正書法特性を囲む体系的、言語学的に解釈可能な誤りを示す。
論文 参考訳(メタデータ) (2026-05-19T16:04:33Z) - SLA$^2$P: Self-supervised Anomaly Detection with Adversarial
Perturbation [77.71161225100927]
異常検出は、機械学習の基本的な問題であるが、難しい問題である。
本稿では,非教師付き異常検出のための新しい強力なフレームワークであるSLA$2$Pを提案する。
論文 参考訳(メタデータ) (2021-11-25T03:53:43Z) - Self-Normalized Importance Sampling for Neural Language Modeling [97.96857871187052]
本研究では, 自己正規化重要度サンプリングを提案し, これまでの研究と比較すると, 本研究で考慮された基準は自己正規化されており, さらに修正を行う必要はない。
提案する自己正規化重要度サンプリングは,研究指向と生産指向の両方の自動音声認識タスクにおいて競合することを示す。
論文 参考訳(メタデータ) (2021-11-11T16:57:53Z) - Extracting Grammars from a Neural Network Parser for Anomaly Detection
in Unknown Formats [79.6676793507792]
強化学習は、ある未知のフォーマットで文を解析するために、人工知能を訓練する技術として、最近約束されている。
本稿では、ニューラルネットワークから生成規則を抽出し、これらの規則を用いて、ある文が名目か異常かを決定する手順を提案する。
論文 参考訳(メタデータ) (2021-07-30T23:10:24Z) - Good Classifiers are Abundant in the Interpolating Regime [64.72044662855612]
補間分類器間のテストエラーの完全な分布を正確に計算する手法を開発した。
テストエラーは、最悪の補間モデルのテストエラーから大きく逸脱する、小さな典型的な$varepsilon*$に集中する傾向にある。
以上の結果から,統計的学習理論における通常の解析手法は,実際に観測された優れた一般化性能を捉えるのに十分な粒度にはならない可能性が示唆された。
論文 参考訳(メタデータ) (2020-06-22T21:12:31Z) - Mechanisms for Handling Nested Dependencies in Neural-Network Language
Models and Humans [75.15855405318855]
我々は,「深層学習」手法で訓練された現代人工ニューラルネットワークが,人間の文処理の中心的な側面を模倣するかどうかを検討した。
ネットワークは、大きなコーパスで次の単語を予測するためにのみ訓練されたが、分析の結果、局所的および長距離の構文合意をうまく処理する特別なユニットが出現した。
我々は,複数の名詞の単数/複数状態における体系的な変化を伴う文中の数一致の違反を人間が検出する行動実験において,モデルの予測を検証した。
論文 参考訳(メタデータ) (2020-06-19T12:00:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。