論文の概要: From a Word-Level Dictionary to Sentence-Level Semantics: Multilingual Grievance Labelling with Contextual Models
- arxiv url: http://arxiv.org/abs/2607.20946v1
- Date: Thu, 23 Jul 2026 05:56:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.298698
- Title: From a Word-Level Dictionary to Sentence-Level Semantics: Multilingual Grievance Labelling with Contextual Models
- Title(参考訳): 単語レベル辞書から文レベルセマンティックへ:文脈モデルを用いた多言語グリーバンスラベリング
- Authors: Lin Tian, Marian-Andrei Rizoiu,
- Abstract要約: グリーバンス(Greevance)は、暴力の脅威を評価する際にアナリストが求める警告の1つだ。
オンラインテキストから大規模に測定されるようになり、多くの場合、重み付けされた用語でスコア付けされる単語レベルのレキシコンで測定される。
我々は、周囲の文脈を読み取ることにより、より忠実にグリーバンスを測定することを示す。
- 参考スコア(独自算出の注目度): 3.5005774502836995
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Grievance is one of the warning signs analysts look for when assessing threats of violence. It is increasingly measured at scale from online text, most often with word-level lexicons like the Grievance Dictionary that score by matching weighted terms. Such matching is a fast and transparent proxy, but it cannot resolve whether a term is asserted, quoted, negated, or condemned. These lexicons are also often evaluated on pools enriched with the very examples they retrieve, so a high score partly reflects agreement with the lexicon's own selection rule. Examining a five-language, 2{,}000-item evaluation pool, we find its halves separated almost perfectly by the lexicon itself: every item labeled ``random'' is in fact lexicon-negative, so the lexicon's apparent macro-AUROC of 0.686 collapses to a 0.500 floor fixed by construction. We keep the dictionary's 22-construct ontology but replace term matching with context-reading models, evaluated on a non-circular benchmark that separates unconditional-random, lexicon-positive, and lexicon-negative strata across five languages. Reading the full post rather than the target sentence alone helps most where the lexicon is silent, raising average precision on lexicon-negative text from 0.14 to 0.20, with the largest gains on quoted, implicit, and cross-sentence grievance. Together, these results show that grievance is measured more faithfully by reading the surrounding context, and more honestly when tested on text the lexicon did not select. We release our code and benchmark at https://github.com/behavioral-ds/multilingual_grievance.
- Abstract(参考訳): グリーバンス(Greevance)は、暴力の脅威を評価する際にアナリストが求める警告の1つだ。
オンラインテキストから大規模に測定されるようになり、多くの場合、重み付けされた単語でスコア付けするGrievance Dictionaryのような単語レベルの辞書で測定される。
このようなマッチングは高速で透明なプロキシだが、ある用語が主張されるか、引用されるか、否定されるかは解決できない。
これらのレキシコンはしばしば、それらが取り出した例に富んだプールで評価されるので、高いスコアはレキシコン自身の選択規則との一致を部分的に反映している。
5言語(2{,}000-item)の評価プールを調べると、そのハーフはレキシコン自身でほぼ完全に分離され、'random'とラベルされたすべての項目は実際にはレキシコン陰性であるため、レキシコンの見かけのマクロ-AUROCは0.686で崩壊し、建設によって固定された0.500階に崩壊する。
辞書の22-構成オントロジーは維持するが、用語マッチングを文脈読解モデルに置き換え、無条件ランダム、レキシコン陽性、レキシコン負の5言語を分離する非循環ベンチマークで評価する。
ターゲットの文のみではなく、全文を読むことは、辞書が沈黙しているほとんどの場所で役立ち、レキシコン陰性テキストの平均精度を0.14から0.20に引き上げ、引用、暗黙、およびクロスセレンスグリーバンスで最大の利益を得る。
これらの結果は、周囲の文脈を読み取ることにより、より忠実に評価され、テキスト上でテストした場合、語彙は選択されなかったことを示している。
コードとベンチマークはhttps://github.com/behavioral-ds/multilingual_grievance.comで公開しています。
関連論文リスト
- When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance [4.093009863847175]
キーワードベースのスコアリングでは,ロバストな負完全/真正の語彙共起パターンが見つかる。
キーワードレキシコンは普遍的な語彙的共起傾向を測定する。
論文 参考訳(メタデータ) (2026-06-24T17:36:39Z) - A Typologically Grounded Evaluation Framework for Word Order and Morphology Sensitivity in Multilingual Masked LMs [2.895343274331944]
我々はmBERTとXLM-Rを英語、中国語、ドイツ語、スペイン語、ロシア語で評価した。
全スクランブルは全言語でゼロに近い単語レベルの再構築精度を駆動する。
トップ5ワードの精度は同じパターンを示しており、フルスクランブルの下では、ゴールドワードが5つの最上位の再構築に現れることはめったにない。
論文 参考訳(メタデータ) (2026-02-28T03:13:34Z) - Levée d'ambiguïtés par grammaires locales [0.0]
本稿では、ゼロサイレントレートの目的に適応し、SilberzteinのINTEXシステム(1993)で実装された語彙的曖昧化手法について述べる。
本稿では,このフレームワークで局所的な曖昧さの文法を検証するためには,トランスデューサの経路を別々に考えるだけでは不十分であることを示す。
論文 参考訳(メタデータ) (2025-10-28T15:38:22Z) - Provably Secure Disambiguating Neural Linguistic Steganography [66.30965740387047]
サブワードに基づく言語モデルを使用する際に生じるセグメンテーションの曖昧さ問題は、時にはデコード障害を引き起こす。
そこで我々はSyncPoolという,セグメンテーションのあいまいさ問題に効果的に対処する,セキュアな曖昧さ回避手法を提案する。
SyncPoolは、候補プールのサイズやトークンの分布を変えないため、確実に安全な言語ステガノグラフィー手法に適用できる。
論文 参考訳(メタデータ) (2024-03-26T09:25:57Z) - Lex2Sent: A bagging approach to unsupervised sentiment analysis [0.628122931748758]
本稿では,テキストの分類方法として,Lex2Sentを提案する。
テキストを分類するために、文書埋め込みと適切な辞書の埋め込みの距離を決定するために埋め込みモデルを訓練する。
本稿では,このモデルがレキシカよりも優れており,バイナリ感情分析のタスクにおいて,高パフォーマンスな数発の微調整手法の基盤となることを示す。
論文 参考訳(メタデータ) (2022-09-26T20:49:18Z) - DP-Parse: Finding Word Boundaries from Raw Speech with an Instance
Lexicon [18.05179713472479]
DP-Parseも同様の原理を用いるが、ワードトークンのインスタンスレキシコンにのみ依存する。
Zero Resource Speech Benchmark 2017で、我々のモデルは5つの言語で新しい音声セグメンテーション状態を設定する。
型レキシコンが欠如しているにもかかわらず、DP-Parseは言語モデルにパイプライン化され、新しい音声単語埋め込みベンチマークで評価されるように、セマンティック表現を学ぶことができる。
論文 参考訳(メタデータ) (2022-06-22T19:15:57Z) - Bilingual Lexicon Induction via Unsupervised Bitext Construction and
Word Alignment [49.3253280592705]
我々は,bitextマイニングと教師なし単語アライメントを組み合わせた手法により,はるかに高品質な語彙を生成可能であることを示す。
私たちの最終モデルは、BUCC 2020共有タスクの最先端を14 $F_1$ポイント、平均12以上の言語ペアで上回ります。
論文 参考訳(メタデータ) (2021-01-01T03:12:42Z) - Speakers Fill Lexical Semantic Gaps with Context [65.08205006886591]
我々は単語の語彙的あいまいさを意味のエントロピーとして運用する。
単語のあいまいさの推定値と,WordNetにおける単語の同義語数との間には,有意な相関関係が認められた。
これは、あいまいさの存在下では、話者が文脈をより情報的にすることで補うことを示唆している。
論文 参考訳(メタデータ) (2020-10-05T17:19:10Z) - Phonotactic Complexity and its Trade-offs [73.10961848460613]
この単純な測度により、言語間のエントロピーを比較することができる。
音素あたりのビット数と単語の平均長との間には-0.74の非常に強い負の相関関係を示す。
論文 参考訳(メタデータ) (2020-05-07T21:36:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。