論文の概要: Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation
- arxiv url: http://arxiv.org/abs/2602.07954v2
- Date: Wed, 11 Feb 2026 13:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-12 15:03:20.025239
- Title: Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation
- Title(参考訳): Bielik Guard: LLMコンテンツモデレーションのための効率的なポーランド語安全分類器
- Abstract要約: ビエリク・ガード(英語: Bielik Guard)は、ポーランド語の安全分類法である。
ポーランドの6,885のテキストからなるコミュニティアノテーション付きデータセットに基づいて、これらのモデルは、Hate/Aggression、Vulgarities、Sexual Content、Crith、Self-Harmという5つの安全カテゴリのコンテンツを分類する。
- 参考スコア(独自算出の注目度): 0.4349640169711269
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) become increasingly deployed in Polish language applications, the need for efficient and accurate content safety classifiers has become paramount. We present Bielik Guard, a family of compact Polish language safety classifiers comprising two model variants: a 0.1B parameter model based on MMLW-RoBERTa-base and a 0.5B parameter model based on PKOBP/polish-roberta-8k. Fine-tuned on a community-annotated dataset of 6,885 Polish texts, these models classify content across five safety categories: Hate/Aggression, Vulgarities, Sexual Content, Crime, and Self-Harm. Our evaluation demonstrates that both models achieve strong performance on multiple benchmarks. The 0.5B variant offers the best overall discrimination capability with F1 scores of 0.791 (micro) and 0.785 (macro) on the test set, while the 0.1B variant demonstrates exceptional efficiency. Notably, Bielik Guard 0.1B v1.1 achieves superior precision (77.65%) and very low false positive rate (0.63%) on real user prompts, outperforming HerBERT-PL-Guard (31.55% precision, 4.70% FPR) despite identical model size. The models are publicly available and designed to provide appropriate responses rather than simple content blocking, particularly for sensitive categories like self-harm.
- Abstract(参考訳): 大言語モデル(LLM)がポーランド語アプリケーションにますます導入されるにつれて、効率的かつ正確なコンテンツ安全性分類器の必要性が高まっている。
MMLW-RoBERTa-baseに基づく0.1Bパラメータモデルと、PKOBP/polish-roberta-8kに基づく0.5Bパラメータモデルである。
ポーランドの6,885のテキストからなるコミュニティアノテーション付きデータセットに基づいて、これらのモデルは、Hate/Aggression、Vulgarities、Sexual Content、Crith、Self-Harmという5つの安全カテゴリのコンテンツを分類する。
評価の結果,両モデルが複数のベンチマークで高い性能を示した。
0.5B版はF1スコアが0.791(マイクロ)と0.785(マクロ)で最高の全体的な識別能力を提供するが、0.1B版は例外的な効率を示す。
特に、Bielik Guard 0.1B v1.1は、実際のユーザープロンプトに対して優れた精度(77.65%)と非常に低い偽陽性率(0.63%)を達成し、同じモデルサイズにもかかわらずHerBERT-PL-Guard(31.55%、FPR4.70%)を上回っている。
モデルは公開されており、単純なコンテンツブロッキングよりも適切なレスポンスを提供するように設計されている。
関連論文リスト
- Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models [2.1665689529884697]
本稿では,コンパクトな埋め込みモデルと汎用SLMの2つのコンポーネントからなる効率的なRAGアーキテクチャであるB1adeについて述べる。
5つの事前訓練エンコーダのパラメータフリー融合により構築された335Mパラメータ検索モデルであるB1ade-embedは、追加トレーニングをゼロとした500M未満モデルの上位MTEBスコアを達成する。
B1ade-1Bは42.4%の反応で回収された通路を引用し、トレーニング分布の寄与率を5.5ポイント上回っている。
論文 参考訳(メタデータ) (2026-07-29T22:41:25Z) - Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models [0.0]
15の家系にまたがる41のオープンウェイト言語モデルと135M--9Bパラメータ範囲の体系的ゼロショット評価を行った。
我々は,信頼性キャリブレーション,現実的な入力摂動に対する堅牢性,モデルランキングの統計的信頼性,デプロイメント効率,ベンチマーク飽和度を分析した。
これらの知見は、意図分類のためのオープンウェイト言語モデルの選択と評価のための実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-07-29T19:42:33Z) - Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction [5.070542698701158]
大言語モデル(LLM)は強い関係抽出(RE)を実現する
本研究では,小言語モデル(SLM)が汎用ドメインと文学テキスト間のギャップをいかに埋めるかを考察する。
論文 参考訳(メタデータ) (2026-06-21T17:24:31Z) - Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization [54.749573452394664]
定式化自体が単純である場合でも、インスタンスデータが大きくなるにつれて精度が低下する。
我々は, 数値データを構造化ファイルに外部化する単純な推論時アプローチであるBINDを用いて, モデルがプロンプトプロンプトからではなく, データをバインドする。
我々は,モデルのみをバインディングのみに微調整することで仮説を検証し,3つの構造的に異なる最適化カテゴリにおいて,エンドツーエンドのSFTおよびRLよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-20T21:25:41Z) - Benchmarking Cross-Lingual Semantic Alignment in Multilingual Embeddings [0.0]
タスク駆動ベンチマーク(MTEB)は基本的なアライメントの欠点を隠蔽する可能性がある。
意味的親和性 (Semantic Affinity, SA) は, 言語間比と言語内拡散比の有界(0, 1)の測定値である。
4つのデータセット(52の実験)に13のモデルをベンチマークすると、3層構造が明らかになる。
論文 参考訳(メタデータ) (2025-12-29T14:32:57Z) - XplaiNLP at CheckThat! 2025: Multilingual Subjectivity Detection with Finetuned Transformers and Prompt-Based Inference with Large Language Models [2.749729059235755]
このノートには、XplaiがCheckThat!に提出されたことを報告しています。
単言語および機械翻訳によるトレーニングデータに基づいて,変換器エンコーダの教師付き微調整,EuroBERT,XLM-RoBERTa,ジャーマン-BERTの2つの手法を評価する。
ドイツ語の場合、タイポロジーに関連のある言語から翻訳されたトレーニングデータに基づいて微調整されたドイツ語-BERTモデルでは、ベースライン上での競争性能が向上する。
論文 参考訳(メタデータ) (2025-09-15T16:53:41Z) - Mario at EXIST 2025: A Simple Gateway to Effective Multilingual Sexism Detection [8.40042895828361]
EXIST 2025 Task 1は、Llama 3.1 8Bの階層的低ランク適応(LoRA)を通じて、英語とスペイン語のツイートでテキストベースの性差別を検出する。
本手法では,3つの階層的なサブタスク間の依存関係を明示的にモデル化する条件付きアダプタルーティングを導入する。
提案手法は,トレーニング時間を75%削減し,モデルストレージを98%削減すると同時に,すべてのサブタスクで競合性能を実現する。
論文 参考訳(メタデータ) (2025-07-15T05:30:32Z) - PL-Guard: Benchmarking Language Model Safety for Polish [43.39208658482427]
ポーランド語における言語モデルの安全性分類のために,手動で注釈付きベンチマークデータセットを導入する。
また、モデルロバスト性に挑戦するために設計されたこれらのサンプルの逆摂動変異体も作成する。
我々は、アノテーション付きデータの異なる組み合わせを用いてこれらのモデルをトレーニングし、それらのパフォーマンスを評価し、公開されているガードモデルと比較する。
論文 参考訳(メタデータ) (2025-06-19T13:56:41Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - WorldPM: Scaling Human Preference Modeling [130.23230492612214]
我々は、このスケーリングの可能性を強調するために、World Preference Modeling$ (WorldPM)を提案する。
多様なユーザコミュニティをカバーする公開フォーラムから選好データを収集する。
1.5Bから72Bパラメータの範囲で15Mスケールのデータを用いて広範囲なトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-15T17:38:37Z) - Secret Breach Detection in Source Code with Large Language Models [2.5484785866796833]
ソースコードに機密情報を漏洩することは、依然として永続的なセキュリティ上の脅威である。
この研究は、大規模言語モデル(LLM)を用いたソースコードの秘密検出を強化することを目的としている。
局所展開のための細調整された小型モデルの実現可能性を評価する。
論文 参考訳(メタデータ) (2025-04-26T03:33:14Z) - DataComp-LM: In search of the next generation of training sets for language models [200.5293181577585]
DataComp for Language Models (DCLM)は、制御されたデータセット実験のためのテストベッドであり、言語モデルを改善することを目的としている。
我々は、Common Crawlから抽出された240Tトークンの標準化コーパス、OpenLMフレームワークに基づく効果的な事前学習レシピ、53の下流評価スイートを提供する。
DCLMベンチマークの参加者は、412Mから7Bパラメータのモデルスケールでの重複、フィルタリング、データ混合などのデータキュレーション戦略を実験することができる。
論文 参考訳(メタデータ) (2024-06-17T17:42:57Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z) - DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with
Gradient-Disentangled Embedding Sharing [117.41016786835452]
本稿では,DeBERTaモデルの改良を目的とした,事前学習型言語モデルDeBERTaV3を提案する。
ELECTRAでのバニラ埋め込み共有は、トレーニング効率とモデルパフォーマンスを損なう。
そこで本研究では、タグ・オブ・ウォーのダイナミクスを回避するために、新しい勾配距離の埋め込み方式を提案する。
論文 参考訳(メタデータ) (2021-11-18T06:48:00Z) - DeBERTa: Decoding-enhanced BERT with Disentangled Attention [119.77305080520718]
2つの新しい手法を用いてBERTモデルとRoBERTaモデルを改善する新しいモデルアーキテクチャDeBERTaを提案する。
これらの手法により,モデル事前学習の効率化と,自然言語理解(NLU)と自然言語生成(NLG)の両方の性能向上が期待できる。
論文 参考訳(メタデータ) (2020-06-05T19:54:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。