論文の概要: Polish ModernBERT: The Long and Short of Polish Language Understanding
- arxiv url: http://arxiv.org/abs/2609.01379v1
- Date: Tue, 01 Sep 2026 15:13:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.794021
- Title: Polish ModernBERT: The Long and Short of Polish Language Understanding
- Title(参考訳): Polish ModernBERT:ポーランド語理解の長短
- Authors: Michał Perełkiewicz, Sławomir Dadas, Rafał Poświata, Małgorzata Grębowiec,
- Abstract要約: ポーランドの4つのエンコーダのファミリーであるtextbfPolish ModernBERTを紹介した。
ステージ化された選択実験を通じて、ModernBERT事前学習のレシピを適用し、長いコンテキストのベンチマークをリリースする。
Polish ModernBERTは評価されたポーランドのエンコーダの中で最高の全体的なパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 0.018947288891217693
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Encoder-only Transformers remain effective for discriminative and representation-learning tasks, yet Polish encoders still largely rely on BERT/RoBERTa-style architectures. We introduce \textbf{Polish ModernBERT}, a family of four Polish encoders available at Base and Large scales, each with 512-token and 8K context variants. We adapt the ModernBERT pretraining recipe through staged selection experiments and release a long-context benchmark covering legal topic classification, ideological decision-direction prediction, factual-consistency assessment over literary plot summaries, and human-rights violation assessment. Across 30 tasks, Polish ModernBERT achieves the best overall performance among the evaluated Polish encoders, reaching 83.99 and 85.11 for the Base-8K and Large-8K models, respectively. On long-context tasks, the 8K variants improve over matched Polish RoBERTa-8K baselines from 67.47 to 77.15 and from 75.88 to 78.49 at the Base and Large scales, respectively. The Base-8K model achieves this gain with 22\% fewer parameters (149M vs.\ 190M). Efficiency measurements in representative inference setups show lower peak memory usage and latency than matched Polish RoBERTa baselines in both 512-token and 8K settings. Polish ModernBERT-8K-Base additionally achieves the best result on a Polish retrieval benchmark among the evaluated encoders below 300M parameters.
- Abstract(参考訳): エンコーダのみのトランスフォーマーは差別的および表現的学習タスクに有効であるが、ポーランドのエンコーダは依然としてBERT/RoBERTaスタイルのアーキテクチャに依存している。
Base と Large Scale で利用可能な 4 つのポーランドエンコーダのファミリーである \textbf{Polish ModernBERT} を紹介する。
本研究は,ModernBERT事前学習レシピを段階的選択実験を通じて適用し,法的トピック分類,イデオロギー的意思決定方向予測,文学的プロット要約に対する事実整合性評価,人権侵害評価を含む長期コンテキストベンチマークを公表する。
30のタスクで、ポーランドのModernBERTは評価されたポーランドのエンコーダの中で最高のパフォーマンスを達成し、それぞれBase-8KとLarge-8Kで83.99と85.11に達した。
長期のタスクでは、ポーランドのRoBERTa-8Kベースラインを67.47から77.15に、ベースラインを75.88から78.49に改良した。
Base-8Kモデルは22\%のパラメータ(149M対149M)でこのゲインを達成する。
190M。
代表推論設定の効率測定では,512tokenと8Kの設定で一致したポーランドのRoBERTaベースラインよりも,ピークメモリ使用率とレイテンシが低い。
ポーランドのModernBERT-8K-Baseは、300Mパラメータ以下の評価エンコーダのうち、ポーランドの検索ベンチマークで最高の結果を得る。
関連論文リスト
- FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model [0.0]
ポーランド語大言語モデルに適用された極端2ビット量子化の最初の体系的学術評価であるBielik-Q2-Sharpを提案する。
我々は、QuIP#、SpinQuant+GPTQ、ButterflyQuant、QTIP、VPTQ、AQLMの6つの最先端のポストトレーニング量子化手法を比較した。
私たちのベストバリアント(QuIP# E8P12)は22のポーランドのベンチマークで71.92%、IQ2_XXSベースラインでは72.07%を達成しています。
論文 参考訳(メタデータ) (2026-03-04T15:19:35Z) - TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish [0.7233065479782755]
TabiBERTはModernBERTアーキテクチャをベースとしたモノリンガルのトルコ語エンコーダである。
8,192トークンのコンテキスト長(16xオリジナルBERT)をサポートし、最大2.65倍のスピードアップを実現し、GPUメモリ使用量を削減する。
タビベンチで77.58を獲得し、BERTurkを1.62ポイント上回り、8つのカテゴリーのうち5つの最先端技術を確立した。
論文 参考訳(メタデータ) (2025-12-28T20:18:22Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - Evaluation of Transfer Learning for Polish with a Text-to-Text Model [54.81823151748415]
ポーランド語におけるテキスト・テキスト・モデルの質を評価するための新しいベンチマークを導入する。
KLEJベンチマークはテキスト・トゥ・テキスト、en-pl翻訳、要約、質問応答に適応している。
本稿では,ポーランド語のための汎用テキスト・テキスト・ツー・テキスト・モデルであるplT5について述べる。
論文 参考訳(メタデータ) (2022-05-18T09:17:14Z) - DeBERTa: Decoding-enhanced BERT with Disentangled Attention [119.77305080520718]
2つの新しい手法を用いてBERTモデルとRoBERTaモデルを改善する新しいモデルアーキテクチャDeBERTaを提案する。
これらの手法により,モデル事前学習の効率化と,自然言語理解(NLU)と自然言語生成(NLG)の両方の性能向上が期待できる。
論文 参考訳(メタデータ) (2020-06-05T19:54:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。