論文の概要: Comparing BERT Sentence-Pair Classification and Few-Shot LLM Prompting for Detecting Threat and Solution Framing in German Climate News
- arxiv url: http://arxiv.org/abs/2606.26489v1
- Date: Thu, 25 Jun 2026 00:48:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.123163
- Title: Comparing BERT Sentence-Pair Classification and Few-Shot LLM Prompting for Detecting Threat and Solution Framing in German Climate News
- Title(参考訳): ドイツの気候ニュースにおける脅威・解フレーム検出のためのBERT文の分類とFew-Shot LLMプロンプトの比較
- Abstract要約: 我々は,ドイツ語の気候ニュース記事から文を脅威指向,解決指向,両方,あるいは両方に分類する2つのアプローチを提案する。
第一のアプローチは、オープンウェイトな大規模言語モデル(Llama 4 Maverick)で、連鎖推論と信頼度スコアによる構造化アウトプットを採用した、数発のプロンプトを使用する。
第二のアプローチは、文ペア分類のためのドイツのBERTモデル(deepset/gbert-large)を微調整する。
- 参考スコア(独自算出の注目度): 1.4465033892011254
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: News media play a central role in shaping public perceptions of climate change, and whether coverage emphasizes threats or solutions has measurable effects on audience engagement and policy support. Automated detection of these framing patterns at the sentence level would allow researchers to analyze large corpora that are infeasible to code manually. We present a systematic comparison of two approaches for classifying sentences from German-language climate news articles as threat-oriented, solution-oriented, both, or neither. The first approach uses few-shot prompting with an open-weights large language model (Llama 4 Maverick), employing chain-of-thought reasoning and structured output with confidence scoring. The second approach fine-tunes a German BERT model (deepset/gbert-large) for sentence-pair classification, where the preceding sentence provides contextual information for the target sentence. Both approaches implement two independent binary classifiers, one for threat framing and one for solution framing. We evaluate both methods on a corpus of 440 Austrian newspaper articles that were manually coded following a detailed coding scheme developed with domain experts. The fine-tuned BERT classifiers achieve an F1 score of 0.83 for both the threat and solution tasks, while the LLM-based classifiers reach an F1 of 0.78. An ablation study confirms that providing the preceding sentence as context improves BERT classification performance substantially compared to single-sentence input. These results contribute to the growing body of work comparing fine-tuned encoder models with prompted generative models for text classification in computational social science.
- Abstract(参考訳): ニュースメディアは、気候変動に対する大衆の認識を形成する上で中心的な役割を果たす。
文レベルでこれらのフレーミングパターンを自動的に検出することで、研究者は手動でコードに不可能な大きなコーパスを分析することができる。
本稿では,ドイツ語の気候ニュース記事から文を脅威指向,解決指向,両方,あるいは両方に分類する2つの手法を体系的に比較する。
第一のアプローチは、オープンウェイトな大規模言語モデル(Llama 4 Maverick)で、連鎖推論と信頼度スコアによる構造化アウトプットを採用した、数発のプロンプトを使用する。
第二のアプローチは、文ペア分類のためのドイツのBERTモデル(deepset/gbert-large)を微調整する。
どちらの手法も2つの独立したバイナリ分類器を実装しており、1つは脅威フレーミング用、もう1つはソリューションフレーミング用である。
オーストリアの新聞記事440件のコーパスにおいて,ドメインの専門家によって開発された詳細なコーディング手法に従って手作業でコード化されている手法を両手法で評価した。
細調整されたBERT分類器は脅威と解決の両方のタスクでF1スコアが0.83、LSMベースの分類器はF1スコアが0.78となる。
アブレーション研究では、先行文を文脈として提供することで、単文入力と比較してBERT分類性能が大幅に向上することを確認した。
これらの結果は、微調整エンコーダモデルと、計算社会科学におけるテキスト分類のための生成モデルの比較に寄与する。
関連論文リスト
- Bangla Sentence Function Classification: Corpus Development, Model Benchmarking, and Interpretability [0.15635627702544694]
本稿では,手動で4つの機能カテゴリにアノテートした1万のBangla文のコーパスを紹介する。
我々はBag-of-Words (BoW)、TF-IDF、Word2Vecなどの複数の特徴表現を評価した。
実験の結果,TF-IDFはWord2Vecより一貫して優れていた。
論文 参考訳(メタデータ) (2026-09-12T10:45:24Z) - SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space [11.534994345027362]
MLLM(Multimodal large language model)は、推論セグメンテーションなどの視覚言語タスクにおいて顕著な機能を示す。
そこで本研究では,従来の問合せの意味を保ちつつ,セグメンテーション性能を劣化させつつ,文法的に正しい言い回しを生成する,新しい逆の言い回しタスクを提案する。
テキストオートエンコーダの低次元意味潜在空間で動作するブラックボックスであるSPARTAを導入する。
論文 参考訳(メタデータ) (2025-10-28T14:09:05Z) - Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning [13.725832389453911]
サイテーション分類は学術的な分析に欠かせない。
先行研究は、引用分類に基づく微調整事前学習言語モデル(PLM)を示唆している。
我々はこれらの課題を克服するためにPLMに適応する新しいフレームワーク、Citssを提案する。
論文 参考訳(メタデータ) (2025-05-20T15:05:27Z) - Localizing Factual Inconsistencies in Attributable Text Generation [74.11403803488643]
本稿では,帰属可能なテキスト生成における事実の不整合をローカライズするための新しい形式であるQASemConsistencyを紹介する。
QASemConsistencyは、人間の判断とよく相関する事実整合性スコアを得られることを示す。
論文 参考訳(メタデータ) (2024-10-09T22:53:48Z) - Co-training for Low Resource Scientific Natural Language Inference [65.37685198688538]
遠隔教師付きラベルに分類器のトレーニング力学に基づいて重みを割り当てる新しいコトレーニング手法を提案する。
予測された信頼度に対する任意のしきい値に基づいてサンプルをフィルタリングするのではなく、重要重みを割り当てることにより、自動ラベル付きデータの使用を最大化する。
提案手法は、遠隔監視ベースラインに対するマクロF1の1.5%の改善と、他の強力なSSLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2024-06-20T18:35:47Z) - Verifying the Robustness of Automatic Credibility Assessment [50.55687778699995]
入力テキストにおける意味保存的変化がモデルを誤解させる可能性があることを示す。
また、誤情報検出タスクにおける被害者モデルと攻撃方法の両方をテストするベンチマークであるBODEGAについても紹介する。
我々の実験結果によると、現代の大規模言語モデルは、以前のより小さなソリューションよりも攻撃に対して脆弱であることが多い。
論文 参考訳(メタデータ) (2023-03-14T16:11:47Z) - Like a Good Nearest Neighbor: Practical Content Moderation and Text
Classification [66.02091763340094]
LaGoNN(Good Nearest Neighbor)は、学習可能なパラメータを導入することなく、隣人の情報で入力テキストを変更するSetFitの変更である。
LaGoNNは望ましくないコンテンツやテキスト分類のフラグ付けに有効であり、SetFitのパフォーマンスを改善する。
論文 参考訳(メタデータ) (2023-02-17T15:43:29Z) - Generate, Discriminate and Contrast: A Semi-Supervised Sentence
Representation Learning Framework [68.04940365847543]
本稿では,大規模未ラベルデータを効果的に活用する半教師付き文埋め込みフレームワークGenSEを提案する。
1) 生成: 生成: 生成/識別器モデルはオープンドメインの未ラベルコーパスから文ペアを合成するために共同で訓練される; 2) 識別: ノイズのある文ペアは識別器によってフィルタリングされ、高品質な正と負の文ペアを取得する; 3) コントラスト: 注釈付きデータと合成されたデータの両方を用いて文表現を学習するために、プロンプトベースのコントラクティブアプローチが提示される。
論文 参考訳(メタデータ) (2022-10-30T10:15:21Z) - InfoCSE: Information-aggregated Contrastive Learning of Sentence
Embeddings [61.77760317554826]
本稿では,教師なし文の埋め込みを学習するための情報型コントラスト学習フレームワーク InfoCSE を提案する。
提案したInfoCSEを,セマンティックテキスト類似性(STS)タスクを用いて,いくつかのベンチマークデータセット上で評価する。
実験の結果, InfoCSE は BERT ベースでは2.60%, BERT 大規模では1.77% でSimCSE より優れていた。
論文 参考訳(メタデータ) (2022-10-08T15:53:19Z) - Speaker Embedding-aware Neural Diarization: a Novel Framework for
Overlapped Speech Diarization in the Meeting Scenario [51.5031673695118]
重なり合う音声のダイアリゼーションを単一ラベル予測問題として再構成する。
話者埋め込み認識型ニューラルダイアリゼーション(SEND)システムを提案する。
論文 参考訳(メタデータ) (2022-03-18T06:40:39Z) - Co-training an Unsupervised Constituency Parser with Weak Supervision [33.63314110665062]
本稿では,あるノードが文中の特定のスパンを支配しているかどうかを識別するために,ブートストラップ分類器に依存する教師なし解析手法を提案する。
両者の相互作用が両者の精度の向上に役立ち、その結果、効果的に解析できることが示される。
論文 参考訳(メタデータ) (2021-10-05T18:45:06Z) - Exploiting Global Contextual Information for Document-level Named Entity
Recognition [46.99922251839363]
我々は、GCDoc(Global Context enhanced Document-level NER)と呼ばれるモデルを提案する。
単語レベルでは、文書グラフは単語間のより広範な依存関係をモデル化するために構築される。
文レベルでは、単一文を超えてより広い文脈を適切にモデル化するために、横断文モジュールを用いる。
我々のモデルは、CoNLL 2003データセットで92.22(BERTで93.40)、Ontonotes 5.0データセットで88.32(BERTで90.49)のスコアに達した。
論文 参考訳(メタデータ) (2021-06-02T01:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。