論文の概要: Nürnberg NLP @ GermEval Shared Task 2026: Harmful Content Detection in German Social Media through Error-Independent LLM Voters
- arxiv url: http://arxiv.org/abs/2608.22246v1
- Date: Sun, 23 Aug 2026 07:07:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.662782
- Title: Nürnberg NLP @ GermEval Shared Task 2026: Harmful Content Detection in German Social Media through Error-Independent LLM Voters
- Title(参考訳): Nürnberg NLP @ GermEval Shared Task 2026: Harmful Content Detection in German Social Media through Error-independent LLM Voters (英語)
- Authors: Philipp Steigerwald, Eric Rudolph, Jens Albrecht,
- Abstract要約: GermEval 2026共有タスクは4つのサブタスクで検出される。
有害なクラスは稀で、支配的な多数派クラスと表層言語を共有するが、マクロF1ではスコアを決定する。
システムは89.56 (C2A), 71.63 (DBO), 54.84 (VIO), 83.02 (DEF) のマクロF1に達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Harmful content in German social media does real-world damage, from calls to action to criminal defamation. The GermEval 2026 shared task scores its detection in four subtasks. The technical challenge is a severe class imbalance. The harmful classes are rare and share surface language with the dominant majority class, yet under macro-F1 they decide the score. The decisive lever is then not a stronger single model but error independence. This insight becomes a per-subtask nine-voter ensemble spanning three orthogonal axes: LLM, training method and class scope. Selected mainly on internal cross-validation, the system reaches macro-F1 of 89.56 (C2A), 71.63 (DBO), 54.84 (VIO) and 83.02 (DEF) on the hidden test set, placing first on all four subtasks.
- Abstract(参考訳): ドイツのソーシャルメディアの有害コンテンツは、実世界の被害を被る。
GermEval 2026共有タスクは4つのサブタスクで検出される。
技術的な課題は厳しい階級不均衡です。
有害なクラスは稀で、支配的な多数派クラスと表層言語を共有するが、マクロF1ではスコアを決定する。
決定的なレバーはより強力な単一モデルではなく、エラー独立である。
この洞察は、LLM、トレーニング方法、クラススコープという3つの直交軸にまたがるサブタスク毎の9声アンサンブルとなる。
内部のクロスバリデーションを中心に選択され、システムは89.56 (C2A), 71.63 (DBO), 54.84 (VIO), 83.02 (DEF) のマクロF1に達する。
関連論文リスト
- LinguIUTics at PsyDefDetect: Iterative Imbalance-Aware Fine-tuning of Qwen3-8B for Psychological Defense Mechanism Classification [0.0]
PsyDefDetect 2026の共有タスクでは、LinguIUTicsチームが公式のポジティブクラスリーダーボードで0.3917のマクロF1スコアを達成した。
我々は,階層化クロスバリデーション,少数クラスのラウンドロビン語彙拡張,ロジットバイアスチューニングとアンサンブルブレンディングを備えた後処理パイプラインの3つの戦略を活用する。
論文 参考訳(メタデータ) (2026-05-30T09:47:29Z) - OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation [53.88666485159289]
OpenDeepThinkは、集団ベースのテスト時間計算フレームワークで、ペアワイズBradley-Terryの比較によって選択する。
OpenDeepThinkはGemini 3.1 ProのCodeforces Eloを8回のLCMコールラウンドで+405ポイント引き上げる。
CF-73は、国際グランドマスターアノテーションによる73の専門家評価コードフォース問題と、公式判決に対する99%の地域評価合意のキュレートされたセットである。
論文 参考訳(メタデータ) (2026-05-14T17:57:40Z) - Nürnberg NLP at PsyDefDetect: Multi-Axis Voter Ensembles for Psychological Defence Mechanism Classification [0.0]
PsyDefDetectでは8つの正の防衛カテゴリーが表面言語を共有しており、実用的機能だけが異なる。
この知見を3つの軸にまたがる9声のアンサンブルに変換する。
システムは隠れたテストセットで$Ftest=.420$に達し、21の登録チームの中で第1位となる。
論文 参考訳(メタデータ) (2026-05-08T11:32:31Z) - UCSC-NLP at SemEval-2026 Task 13: Multi-View Generalization and Diagnostic Analysis of Machine-Generated Code Detection [0.0]
本稿では,人書きコードとAI生成コードとを区別するシステムを提案する。
Subtask Aでは、ジェネレータ不変表現を促進するマルチビュートレーニングフレームワークでUniXcoder-baseを微調整します。
サブタスクBでは,重度のクラス不均衡が致命的なマイノリティクラス障害を引き起こすことを示す。
論文 参考訳(メタデータ) (2026-04-28T21:41:59Z) - CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks [64.22418143822016]
CulturALLは、大規模言語モデルの多言語的・多文化的な能力を評価するためのベンチマークである。
51の領域から14の言語で2,610のサンプルが含まれており、16のトピックに分散して、接地されたタスクの全幅をキャプチャしている。
実験の結果、最高のLLMはカルトゥルルルで44.48%の精度を達成し、改善の余地があることが示されている。
論文 参考訳(メタデータ) (2026-04-21T09:21:46Z) - Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection [68.37351671559675]
アクティブな学習は、無視可能なコストで短いプロンプトから何千ものインスタンスに注釈を付けることができる。
LLMラベルはALループ内で人間のラベルを置き換えることができ、ALはコーパス全体を一度にラベル付けできるときに必要か?
277,902人のドイツの政治的TikTokコメントの新しいデータセットについて、両方の質問を調査した。
論文 参考訳(メタデータ) (2026-04-15T14:10:58Z) - LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models [59.0256377330646]
Lensは3.4Kの現代画像と8つのタスクと12の日次シナリオをカバーする60K以上の人間による質問のベンチマークである。
このデータセットは本質的に、基本的な知覚から構成的推論に至るまで、画像不変のプロンプトを処理するためのMLLMの評価をサポートする。
我々は,Qwen2.5-VL-72B,InternVL3-78B,GPT-4oおよび2つの推論モデルQVQ-72B-previewとKim-VLなどの15以上のフロンティアMLLMを評価する。
論文 参考訳(メタデータ) (2025-05-21T15:06:59Z) - ThangDLU at #SMM4H 2024: Encoder-decoder models for classifying text data on social disorders in children and adolescents [49.00494558898933]
本稿では,#SMM4H (Social Media Mining for Health) 2024 Workshopのタスク3とタスク5への参加について述べる。
タスク3は、屋外環境が社会不安の症状に与える影響を議論するツイートを中心にした多クラス分類タスクである。
タスク5は、子供の医学的障害を報告しているツイートに焦点を当てたバイナリ分類タスクを含む。
BART-baseやT5-smallのような事前訓練されたエンコーダデコーダモデルからの転送学習を適用し、与えられたツイートの集合のラベルを同定した。
論文 参考訳(メタデータ) (2024-04-30T17:06:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。