論文の概要: The Grammar Does the Work: Functional vs. Lexical Dependency Length Minimization Across Universal Dependencies
- arxiv url: http://arxiv.org/abs/2607.01899v1
- Date: Thu, 02 Jul 2026 08:55:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.750298
- Title: The Grammar Does the Work: Functional vs. Lexical Dependency Length Minimization Across Universal Dependencies
- Title(参考訳): 文法は仕事をする: 機能対語彙依存長の最小化と普遍的依存関係
- Abstract要約: 我々は、UDとSUDの122言語を分析し、DLMが2つの異なるレベルで動作することを示す。
文を局所的な機能的アタッチメントでスキャフォールディングすることで、最小化の「文法は作業を行う」と結論付ける。
- 参考スコア(独自算出の注目度): 1.218340575383456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dependency length minimization (DLM) is a well-documented processing universal, but previous studies report a single mean dependency distance (MDD) per language, obscuring variation across syntactic relation types. We analyze 122 languages in UD and SUD (version 2.17), showing that DLM operates on two distinct levels. Grammar-driven optimization targets functional dependencies (det, case, aux), which are universally short (mean 1.71, $σ$ = 0.33) and invariant across typologically diverse languages. Processing-driven optimization operates on lexical dependencies (nsubj, obj, obl), which are longer (mean 2.87), highly variable ($σ$ = 0.63), and constrained by word-order typology. This asymmetry holds in SUD despite reversed head direction (r = 0.92). We conclude that ''the grammar does the work'' of minimization by scaffolding sentences with local functional attachments, leaving processing pressures to determine the ordering of lexical heads.
- Abstract(参考訳): 依存性長最小化(DLM)は、文書化された処理の普遍性であるが、以前の研究では言語ごとの平均依存性距離(MDD)を報告し、構文的関係型間でのばらつきを観測した。
UDとSUD(バージョン2.17)の122言語を分析し,DLMが2つの異なるレベルで動作することを示す。
文法駆動の最適化は関数依存(det, case, aux)をターゲットにしており、これは普遍的に短い(平均1.71, $σ$ = 0.33)。
処理駆動最適化は語彙依存(nsubj, obj, obl)で動作し、より長い(平均2.87)。
この非対称性は、逆方向(r = 0.92)にもかかわらずSUDにおいて成り立つ。
文を局所的な機能的アタッチメントで足場化し, 語彙的頭部の順序を決定するための処理圧力を残し, 最小化の「文法は作業を行う」と結論付けた。
関連論文リスト
- Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction [28.920985595976873]
文法誤り訂正(英: Grammatical Error Correction, GEC)とは、文法の誤用を検出し、訂正することである。
インコンテキスト学習(ICL)機能を持つ大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクにおいて大きな進歩を見せている。
これは主に、セマンティックな類似性ではなく、エラーパターンをキャプチャする適切なコンテキスト内デモを取得することによる。
論文 参考訳(メタデータ) (2026-06-13T18:00:26Z) - Step-by-step Instructions and a Simple Tabular Output Format Improve the Dependency Parsing Accuracy of LLMs [1.088291253486435]
そこで我々は,音声の共通部分タグ付けが,構文的頭部と依存性ラベルの予測に先行する,新しいステップバイステップの指示戦略を提案する。
本手法は,幻覚や汚染を伴わない17言語を対象に,Universal Dependenciesデータセットの最先端精度を実現する。
論文 参考訳(メタデータ) (2025-06-11T17:56:10Z) - Work Smarter...Not Harder: Efficient Minimization of Dependency Length in SOV Languages [0.34530027457862006]
主動詞の横にある短い前動詞構成詞の移動は、SOV言語における依存関係長の国際最小化よりも、前動詞構成詞の順序決定が優れていることを説明できる。
この研究は、言語決定と言語進化における有界合理性の役割に光を当てている。
論文 参考訳(メタデータ) (2024-04-29T13:30:27Z) - Contrastive Instruction Tuning [61.97704869248903]
意味論的に等価な命令-インスタンスペア間の類似性を最大化するために、コントラスト命令チューニングを提案する。
PromptBenchベンチマークの実験によると、CoINはLLMの頑健さを一貫して改善し、文字、単語、文、意味のレベルを平均して2.5%の精度で変化させる。
論文 参考訳(メタデータ) (2024-02-17T00:09:32Z) - The Ups and Downs of Large Language Model Inference with Vocabulary Trimming by Language Heuristics [74.99898531299148]
本研究は,興味のある言語への埋め込みエントリを制限し,時間と記憶効率を高めることによる語彙トリミング(VT)について検討する。
Unicodeベースのスクリプトフィルタリングとコーパスベースの選択という2つの言語を異なる言語ファミリやサイズに適用する。
その結果、VTは小型モデルのメモリ使用量を50%近く削減し、生成速度が25%向上した。
論文 参考訳(メタデータ) (2023-11-16T09:35:50Z) - Sort by Structure: Language Model Ranking as Dependency Probing [25.723591566201343]
事前学習型言語モデル (LM) のインフォームドな選択は、性能上重要であるが、環境上はコストがかかる。
本稿では,LMの文脈的埋め込みからラベル付き木が回復可能な程度を計測することにより,特定の言語における依存関係を解析するために,LMのランク付けを提案する。
本手法は,46のタイプ的およびアーキテクチャ的に多様なLM言語対に対して,計算量の少ない命令の79%のLM選択を,計算量の少ない命令のフルグレードのトレーニングよりも最適に予測する。
論文 参考訳(メタデータ) (2022-06-10T08:10:29Z) - Examining Scaling and Transfer of Language Model Architectures for
Machine Translation [51.69212730675345]
言語モデル(LM)は単一のレイヤのスタックで処理し、エンコーダ・デコーダモデル(EncDec)は入力と出力の処理に別々のレイヤスタックを使用する。
機械翻訳において、EncDecは長年好まれてきたアプローチであるが、LMの性能についての研究はほとんどない。
論文 参考訳(メタデータ) (2022-02-01T16:20:15Z) - Zero-Shot Cross-Lingual Machine Reading Comprehension via Inter-Sentence
Dependency Graph [47.451893128956065]
我々は,Universal Dependencies (UD) の構文的特徴を取り入れ,直接ゼロショット設定における言語間機械読解(MRC)の課題をターゲットにしている。
文間のグローバルな構文関係を形成するために,依存関係木を接続する文間依存グラフ(ISDG)を構築した。
次に、グローバル依存グラフを符号化するIDDGエンコーダを提案し、ワンホップとマルチホップの依存関係パスの両方を通して、文間関係を明示的に解決する。
論文 参考訳(メタデータ) (2021-12-01T13:58:39Z) - GATE: Graph Attention Transformer Encoder for Cross-lingual Relation and
Event Extraction [107.8262586956778]
言語に依存しない文表現を学習するために、普遍的な依存解析を伴うグラフ畳み込みネットワーク(GCN)を導入する。
GCNは、長い範囲の依存関係を持つ単語をモデル化するのに苦労する。
そこで本研究では,構文的距離の異なる単語間の依存関係を学習するための自己認識機構を提案する。
論文 参考訳(メタデータ) (2020-10-06T20:30:35Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。