論文の概要: Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
- arxiv url: http://arxiv.org/abs/2608.05138v1
- Date: Wed, 05 Aug 2026 17:56:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.071743
- Title: Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
- Title(参考訳): ネモトロン・ギリシャ語を教える : コーパスの採掘, 検索の適応, 専門領域横断の現代ギリシア語における接地生成
- Authors: Ayoub Kirouane, Christos Petrocheilos,
- Abstract要約: 現代のギリシャ語はNVIDIAのネモトロン検索モデルに欠落している。
現代ギリシア語に対するネモトロン検索スタックのエンドツーエンド適応について述べる。
HERAは,検索拡張生成のためのギリシャ初の大規模ベンチマークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major multilingual retrieval benchmarks, despite being important for retrieval-augmented generation (RAG) in legal, energy, financial, and medical applications. We present an end-to-end adaptation of the Nemotron retrieval stack for Modern Greek, including corpus mining, synthetic supervision, retrieval model training, reranker adaptation, reader fine-tuning, and a new benchmark called HERA. Our study shows that a parameter-free BM25 baseline outperforms several off-the-shelf multilingual dense retrieval models on specialist Greek corpora. After fine-tuning on 65,773 Greek retrieval pairs, a Nemotron 1B embedder improves nDCG@10 from 0.362 to 0.835 and substantially outperforms its unadapted counterpart. The learned language competence transfers to general-domain Greek, although the advantage over BM25 remains domain-dependent. We further adapt a cross-encoder reranker and demonstrate consistent improvements across specialist domains. Finally, we LoRA-tune a Nemotron 30B-A3B mixture-of-experts reader for grounded generation, increasing judged answer correctness from 29.4% to 66.9% while significantly improving faithfulness and citation quality. We also introduce HERA, the first large-scale Greek benchmark for retrieval-augmented generation, and release our adapted models and benchmark to support future research on Greek-language RAG systems.
- Abstract(参考訳): 現代のギリシャ語はNVIDIAのネモトロン検索モデルや主要な多言語検索ベンチマークに欠けているが、法、エネルギー、ファイナンシャル、医療の分野では検索強化世代(RAG)にとって重要である。
本稿では, コーパスマイニング, 合成指導, 検索モデルトレーニング, リランカ適応, リーダの微調整, HERAと呼ばれる新しいベンチマークを含む, 現代ギリシアにおけるネモトロン検索スタックのエンドツーエンド適応について述べる。
本研究は,パラメータフリーのBM25ベースラインが,ギリシャの専門コーパスを用いた多言語多言語検索モデルよりも優れていることを示す。
65,773個のギリシャの検索ペアを微調整した後、Nemotron 1Bの埋め込み機はnDCG@10を0.362から0.835に改善し、非適応型よりも大幅に向上した。
学識のある言語能力は一般のギリシャ語に移行するが、BM25に対する優位性は依然としてドメインに依存している。
さらに、クロスエンコーダのリランカを適用し、専門ドメイン間で一貫した改善を示す。
最後に、基底生成のためのNemotron 30B-A3B混合エキスパートリーダーをLoRA-Tuneし、判定された回答の正しさを29.4%から66.9%に向上させ、忠実性と引用品質を著しく向上させた。
また,検索拡張生成のためのギリシャ初の大規模ベンチマークであるHERAを導入し,ギリシャ語のRAGシステムに関する今後の研究を支援するため,我々の適応モデルとベンチマークをリリースする。
関連論文リスト
- GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek [27.324768282418102]
GreekMMLUはギリシャ語で大規模言語理解のためのネイティブソースのベンチマークである。
我々は16,857個のサンプルと4,948個のサンプルをプライベートなリーダーボードにリリースし、堅牢で汚染に強い評価を可能にした。
論文 参考訳(メタデータ) (2026-02-05T00:12:18Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - Krikri: Advancing Open Large Language Models for Greek [6.922876845922809]
ギリシャ語に適した最先端の大規模言語モデルであるLlama-Krikri-8Bを紹介する。
Llama-Krikri-8Bは、言語的ニュアンスへの優れた適応を保証するために、高品質なギリシャ語のデータを広範囲に訓練してきた。
論文 参考訳(メタデータ) (2025-05-19T23:18:27Z) - Shall We Pretrain Autoregressive Language Models with Retrieval? A
Comprehensive Study [115.96080028033904]
本稿では,拡張性のある事前学習型検索拡張LM(RETRO)について,標準GPTと検索拡張GPTと比較した。
本研究は, 将来の基盤モデルとしての検索による自己回帰型LMの事前学習の方向性を明らかにするものである。
論文 参考訳(メタデータ) (2023-04-13T18:04:19Z) - Sample-Efficient Unsupervised Domain Adaptation of Speech Recognition
Systems A case study for Modern Greek [70.82099772016234]
M2DS2は,大規模な事前学習音声モデルに対して,単純かつサンプル効率のよい微調整手法である。
ソースドメインの自己スーパービジョンを含め、トレーニングを安定させ、潜伏表現のモード崩壊を避けることができる。
論文 参考訳(メタデータ) (2022-12-31T22:57:30Z) - Improving language models by retrieving from trillions of tokens [50.42630445476544]
大規模コーパスから取得した文書チャンクを条件付けすることで,自動回帰言語モデルを強化する。
2兆ドルのトークンデータベースで、Retrieval-Enhanced Transformer (RETRO)は、PileのGPT-3とJurassic-1に匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2021-12-08T17:32:34Z) - Multi-granular Legal Topic Classification on Greek Legislation [4.09134848993518]
ギリシア語で書かれた法律文書を分類する作業について研究する。
ギリシャの法律文書分類のタスクがオープンな研究プロジェクトで検討されたのはこれが初めてである。
論文 参考訳(メタデータ) (2021-09-30T17:43:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。