論文の概要: HomoEnsNER: Does Language Alignment Outperform Architectural Complexity in Gujarati Named Entity Recognition?
- arxiv url: http://arxiv.org/abs/2608.03105v2
- Date: Wed, 05 Aug 2026 07:03:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.24009
- Title: HomoEnsNER: Does Language Alignment Outperform Architectural Complexity in Gujarati Named Entity Recognition?
- Title(参考訳): HomoEnsNER: 言語アライメントは、エンティティ認識と呼ばれるGujaratiのアーキテクチャ上の複雑さより優れているか?
- Authors: Chandrakant K. Bhogayata,
- Abstract要約: HomoEnsNERは、5つの独立した微調整されたGujaratiBERTモデルの同質アンサンブルである。
いずれも一貫した予算で訓練され、Naamapadam GujaratiテストスプリットでエンティティレベルのF1を使用して評価された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Named Entity Recognition (NER) for Gujarati remains underexplored, hindered by the absence of capitalization cues, rich morphology, lexical ambiguity, and free word order. Prior ensemble work has emphasized architectural diversity by combining heterogeneous classifiers, multilingual encoders, or classical sequence models, rather than exploiting language-aligned monolingual pretraining. This study asks whether, for a low-resource, morphologically rich language like Gujarati, a homogeneous ensemble of a single monolingual encoder outperforms such architectural diversity. We propose HomoEnsNER, a homogeneous ensemble of five independently fine-tuned GujaratiBERT models combined via majority voting, evaluated against a single GujaratiBERT baseline and six heterogeneous alternatives, including combinations with MuRIL-base, MuRIL-large, IndicBERT, mBERT, BiLSTM, CRF, and a stacked BiLSTM-CRF-GujaratiBERT architecture. All eight models were trained under a consistent budget and evaluated using entity-level F1 on the Naamapadam Gujarati test split. HomoEnsNER achieved the highest F1 (0.8442), surpassing the baseline (0.8347) and every heterogeneous alternative (lowest: 0.7855), indicating that language alignment is a more effective, budget-conscious ensembling strategy than architectural complexity for low-resource Indian language NER.
- Abstract(参考訳): グジャラーティのエンティティ認識(NER)という名前は、資本化の手がかりがないこと、豊かな形態、語彙のあいまいさ、自由語順が原因で、未発見のままである。
以前のアンサンブルの作業は、言語に整合したモノリンガル事前学習を利用するのではなく、異種分類器、多言語エンコーダ、古典的なシーケンスモデルを組み合わせることで、アーキテクチャの多様性を強調してきた。
本研究では,1つのモノリンガルエンコーダの同質なアンサンブルであるGujaratiのような低リソースで形態学的にリッチな言語が,そのようなアーキテクチャの多様性を上回っているかどうかを問う。
IndicBERT, mBERT, BiLSTM, CRF, および積み重ねた BiLSTM-CRF-GujaratiBERT アーキテクチャと MuRIL-base, MuRIL-large, IndicBERT, mBERT, BiLSTM-CRF-GujaratiBERT アーキテクチャの組み合わせを含む, 1つの GujaratiBERT ベースラインと6つのヘテロジニアスな代替品に対して, 多数投票による独立に調整された 5 つの GujaratiBERT モデルの同質アンサンブルである HomoEnsNER を提案する。
いずれも一貫した予算で訓練され、Naamapadam GujaratiテストスプリットでエンティティレベルのF1を使用して評価された。
HomoEnsNERは最も高いF1(0.8442)を達成し、ベースライン(0.8347)と全ての異種代替品(最下位: 0.7855)を上回った。
関連論文リスト
- BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi [2.584263027095689]
MahaNERデータセットのさまざまなバリエーションについて、MahaBERT-v2を微調整します。
すべてのモデルは、精度、リコール、F1スコアの標準メトリクスを使用して、Marathi NERテストデータセットで評価される。
論文 参考訳(メタデータ) (2026-07-25T19:40:58Z) - Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences [89.71422932447423]
LOGOSは、自然科学における異種タスクを統一する科学生成言語モデルである。
空間的接触パターンと制約パターンを離散トークンとして表現することにより、モデルは純粋にシーケンシャルな方法で複雑な構造的相互作用をキャプチャする。
多様なタスクにわたって、LOGOSは一貫してドメイン固有のベースラインにマッチまたは性能を向上する。
論文 参考訳(メタデータ) (2026-06-15T16:14:53Z) - Benchmarking POS Tagging for the Tajik Language: A Comparative Study of Neural Architectures on the TajPersParallel Corpus [0.0]
本稿では,タジク語のPOSタグ付け作業における最初のベンチマークについて述べる。
TajPersParallel corpusは、約44,000の辞書エントリからなる並列語彙資源である。
論文 参考訳(メタデータ) (2026-05-06T07:26:56Z) - Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages [76.14451035425229]
大規模自動音声認識システムであるOmnilingual ASRを紹介する。
自己教師付き事前学習を7Bパラメータに拡張し、堅牢な音声表現を学習する。
ASRが提供しなかった500以上の言語を含む1,600以上の言語にカバー範囲を広げている。
論文 参考訳(メタデータ) (2025-11-12T19:48:09Z) - Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning [81.43257201833154]
言語やモダリティ間のアライメントを学習するための双方向命令関係推論およびアライニングフレームワークBi-IRRAを提案する。
Bi-IRRA内において、双方向暗黙的関係推論モジュールは、マスクされた画像とテキストの双方向予測を可能にする。
提案手法は,すべての多言語TIPRデータセットに対して,新しい最先端結果を実現する。
論文 参考訳(メタデータ) (2025-10-20T16:01:11Z) - PARAM-1 BharatGen 2.9B Model [14.552007884700618]
PARAM-1は2.9Bパラメータデコーダのみのテキストのみの言語モデルである。
25%のコーパス割り当てによるIndic言語の公平な表現、インドの形態的構造に適合したSentencePieceトークン化によるトークン化公正性、IndicQA全体にわたる文化的に整合した評価ベンチマーク、コード混合推論、社会言語的堅牢性タスクである。
論文 参考訳(メタデータ) (2025-07-16T06:14:33Z) - Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks [112.6716697906318]
命令ベースユニバーサル音声モデルの包括的評価のためのオープンベンチマークであるDynamic-SUPERB Phase-2を提案する。
第1世代をベースとして、この第2バージョンには125の新しいタスクが含まれており、ベンチマークを合計180タスクに拡張している。
評価結果から, モデルが良好に機能することのないことが示唆された。
論文 参考訳(メタデータ) (2024-11-08T06:33:22Z) - CROP: Zero-shot Cross-lingual Named Entity Recognition with Multilingual
Labeled Sequence Translation [113.99145386490639]
言語間NERは、整列した言語間表現や機械翻訳結果を通じて、言語間で知識を伝達することができる。
ゼロショット言語間NERを実現するために,クロスランガル・エンティティ・プロジェクション・フレームワーク(CROP)を提案する。
多言語ラベル付きシーケンス翻訳モデルを用いて、タグ付けされたシーケンスをターゲット言語に投影し、ターゲットの原文にラベル付けする。
論文 参考訳(メタデータ) (2022-10-13T13:32:36Z) - KinyaBERT: a Morphology-aware Kinyarwanda Language Model [1.2183405753834562]
教師なしサブワードトークン化法は、形態的にリッチな言語を扱うのに最適である。
本稿では, 形態素解析を応用し, 構造的構成性を明確に表現する, 単純かつ効果的な2層BERTアーキテクチャを提案する。
提案手法を低リソース形態素に富んだKinyaarwanda言語上で評価し,モデルアーキテクチャKinyaBERTを命名した。
論文 参考訳(メタデータ) (2022-03-16T08:36:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。