論文の概要: Representing and Parsing Korean Constituency Structure at Different Levels of Granularity
- arxiv url: http://arxiv.org/abs/2608.27035v2
- Date: Fri, 28 Aug 2026 06:14:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.098134
- Title: Representing and Parsing Korean Constituency Structure at Different Levels of Granularity
- Title(参考訳): 粒度の異なる韓国の選挙区構造を表現・解析する
- Abstract要約: 韓国のオエオールは形態学的に複雑な間隔の単位であり、既存の選挙区資源はオエオール内部形態や非オーバト元素の表現方法が異なる。
本稿では,Morpheme+XPOS,Eojeol+XPOS,Eojeol+UPOSの3つの選挙区解析表現を比較した。
- 参考スコア(独自算出の注目度): 11.884270397827171
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Korean constituency parsing raises a representational challenge because the terminal units of a phrase-structure tree do not straightforwardly correspond to simple surface words. Korean eojeols are morphologically complex spacing units, and existing constituency resources differ in how they represent eojeol-internal morphology and non-overt elements. This paper compares three constituency parsing representations derived from the Penn Korean Treebank: Morpheme+XPOS, Eojeol+XPOS, and Eojeol+UPOS. We construct these representations by removing null elements, aligning Penn Korean phrase structure with overt eojeol tokens, preserving Penn Korean phrase labels where possible, and varying the terminal and preterminal layers. We then evaluate canonical non-binary transition-based constituency parsers in top-down, in-order, and bottom-up orders under a shared modeling and evaluation setup. All experiments use gold terminal segmentation and gold preterminal labels and therefore evaluate constituency parsing conditioned on gold morphosyntactic annotation. Eojeol terminals yield shorter transition sequences, but Eojeol+UPOS parsing substantially underperforms the morphologically richer conditions. Eojeol+XPOS narrows this gap, while Morpheme+XPOS gives the strongest results even after its predictions are projected to the eojeol terminal domain. Under these gold-annotation conditions, the results show that fine-grained morphological and XPOS representations provide valuable evidence for the evaluated parsers. This empirical finding concerns the information available for parsing and does not by itself determine the linguistically preferable terminal domain. Independently, linguistic and resource-design considerations motivate eojeol as a stable and interpretable surface domain for phrase-structure annotation, with morpheme-level and XPOS information retained as aligned morphosyntactic evidence.
- Abstract(参考訳): 韓国の選挙区構文解析は、句構造木の終端単位が単純な表層語と直接対応しないため、表現上の課題を提起する。
韓国のオエオールは形態学的に複雑な間隔の単位であり、既存の選挙区資源はオエオール内部形態や非オーバト元素の表現方法が異なる。
本稿では,Morpheme+XPOS,Eojeol+XPOS,Eojeol+UPOSの3つの選挙区解析表現を比較した。
これらの表現は、ヌル要素を除去し、韓国語句構造をOojeolトークンと整列させ、可能であれば韓国語句ラベルを保存し、端末層と端末層を可変させることによって構成する。
次に、共有モデリングおよび評価設定の下で、トップダウン、インオーダー、ボトムアップの順で、標準非二項遷移型選挙区パーサの評価を行う。
全ての実験では,金の終端セグメンテーションと金の先行ラベルを用い,金のモルフォシンタクティックアノテーションを条件とした選挙区解析を評価した。
Eojeol末端は短い遷移配列を生成するが、Eojeol+UPOS解析は形態学的によりリッチな条件を著しく低下させる。
Eojeol+XPOS はこのギャップを狭くし、Morpheme+XPOS はその予測が eojeol 終端領域に投影された後も最強の結果を与える。
これらのゴールドアノテーション条件下では, 微粒な形態素およびXPOS表現が評価されたパーサーに有意義な証拠となることが示唆された。
この経験的発見は、解析に利用可能な情報に関するものであり、言語的に好まれる終端領域をそれ自体が決定しない。
言語学的および資源的設計的考察は、オエオールを句構造アノテーションの安定かつ解釈可能な表面ドメインとして動機付け、形態素レベルとXPOS情報は整列した形態素的証拠として保持する。
関連論文リスト
- DPH Parser: A Bottom-Up Grammar-Driven Parser for Joint Constituency and Dependency Analysis [0.0]
本稿では,HPSG (Generalized Phrase Structure Grammar) とHPSG (Head-driven Phrase Structure Grammar) にインスパイアされた文法駆動型ボトムアップ非重畳構文解析フレームワークを提案する。
このシステムは確率的POSコーパスタグ付け、フレーズ投影、重み付け仮説を組み合わせて、現実的で部分的にノイズのあるテキスト入力を処理する。
現在のシステムは、現代のニューラルネットワークの精度にはまだアプローチしていないが、この結果は、ツリーバンクデータに透過的なルールベースのボトムアップ解析を適用する可能性を示している。
論文 参考訳(メタデータ) (2026-09-05T12:58:58Z) - PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino [1.6481883307499954]
PACUTEは、フィリピンにおける形態学的理解を評価するために設計された4,600のタスクの診断ベンチマークである。
オープンウェイトモデルでは, スケールによらず, 形態素分解にほぼ近い確率で作用することがわかった。
これらの結果は, フィリピン語の単語構造理解の持続的ボトルネックとして, 文字アクセスのみではなく, 生産的形態素組成を同定した。
論文 参考訳(メタデータ) (2026-06-13T06:12:56Z) - Augmenting Molecular Language Models with Local $n$-gram Memory [50.62274418415122]
MolGramは、ローカル文字列パターンをスケーラブルなハッシュルックアップを通じて学習した埋め込みにマッピングし、この領域のコンテキストを隠れた状態に動的に注入する。
非条件分子生成、前方反応予測、単段階の逆合成を含む3つのタスクにおける評価は、モルグラムが一貫して性能を改善することを示す。
論文 参考訳(メタデータ) (2026-06-10T14:07:18Z) - Learn from your own latents and not from tokens: A sample-complexity theory [53.5821824211418]
本研究では,関連するビューやマスキング領域の潜在表現を予測するために訓練されたネットワークについて検討する。
潜在予測は、対数的要因まで、多くのサンプルを$L$で表すことでこれを達成できることを示す。
これは、H-JEPAのような明示的な積み重ねがほとんど冗長であることを示している。
論文 参考訳(メタデータ) (2026-05-26T22:16:42Z) - Constituency Structure over Eojeol in Korean Treebanks [6.030221684048552]
韓国語の単語は形態学的に複雑であり、形態素を構成端末として扱い、単語の内部形態とフレーズレベルの構文構造を融合させる。
本稿では,非構成層に符号化された音声情報の形態的セグメンテーションと微細なきめ細かな部分を有するオエオール系選挙区表現について論じる。
論文 参考訳(メタデータ) (2025-12-27T06:12:26Z) - UD-KSL Treebank v1.3: A semi-automated framework for aligning XPOS-extracted units with UPOS tags [0.0]
本稿では,XPOS 配列から形態素合成構造を同定し,それらの構造を対応する UPOS カテゴリと整合させるセミ言語フレームワークを提案する。
我々はまた、議論的なエッセイから2,998の新たな文を注釈付けすることで、既存のL2-韓国コーパスを広げる。
論文 参考訳(メタデータ) (2025-06-10T17:37:56Z) - Structured Tree Alignment for Evaluation of (Speech) Constituency Parsing [43.758912958903494]
本稿では, 音声評価の問題に起因した, 区切り木間の類似度尺度STRUCT-IOUについて述べる。
パラメータを計算するために,音声領域に強制アライメントを施して接地構文解析木を投影し,予測された接地構造成分と予測された成分を一定の制約下で整列させ,すべての整列構成ペアの平均IOUスコアを算出する。
論文 参考訳(メタデータ) (2024-02-21T00:01:17Z) - Word segmentation granularity in Korean [1.0619039878979954]
韓国語では、単語のセグメンテーションの粒度には複数のレベルがある。
特定の言語処理やコーパスアノテーションタスクでは、いくつかの異なる粒度レベルが提案され、利用されている。
興味深いことに、機能的形態素のみを分離した粒度は、句構造解析の最適性能をもたらす。
論文 参考訳(メタデータ) (2023-09-07T13:42:05Z) - Multilingual Extraction and Categorization of Lexical Collocations with
Graph-aware Transformers [86.64972552583941]
我々は,グラフ対応トランスフォーマアーキテクチャにより拡張されたBERTに基づくシーケンスタグ付けモデルを提案し,コンテキストにおけるコロケーション認識の課題について評価した。
以上の結果から, モデルアーキテクチャにおける構文的依存関係を明示的に符号化することは有用であり, 英語, スペイン語, フランス語におけるコロケーションのタイプ化の差異について考察する。
論文 参考訳(メタデータ) (2022-05-23T16:47:37Z) - Evaluating the Morphosyntactic Well-formedness of Generated Texts [88.20502652494521]
L'AMBRE – テキストのモルフォシンタク的整形性を評価する指標を提案する。
形態的に豊かな言語に翻訳するシステムのダイアクロニックスタディを通じて,機械翻訳作業におけるメトリックの有効性を示す。
論文 参考訳(メタデータ) (2021-03-30T18:02:58Z) - Self-Attention with Cross-Lingual Position Representation [112.05807284056337]
位置符号化(PE)は、自然言語処理タスクの単語順序情報を保存し、入力シーケンスの固定位置インデックスを生成する。
語順が異なるため、言語間の位置関係をモデル化することは、SANがこの問題に取り組むのに役立つ。
我々は、入力文のバイリンガル認識潜在構造をモデル化するために、言語間位置表現によるSANを拡大する。
論文 参考訳(メタデータ) (2020-04-28T05:23:43Z) - Towards Instance-Level Parser Selection for Cross-Lingual Transfer of
Dependency Parsers [59.345145623931636]
我々は、インスタンスレベルの選択(ILPS)という、新しい言語間移動パラダイムを論じる。
本稿では,デレキシライズドトランスファーの枠組みにおけるインスタンスレベルの選択に着目した概念実証研究を提案する。
論文 参考訳(メタデータ) (2020-04-16T13:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。