論文の概要: Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure
- arxiv url: http://arxiv.org/abs/2609.29445v1
- Date: Thu, 24 Sep 2026 12:02:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.904076
- Title: Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure
- Title(参考訳): 異なる2つのエモジ:マルチリンガル・エフェクティブ・ジェネレーション・ベンチマークが実際に何を計測するか
- Abstract要約: 我々は,英語とヒンディー語の17,100文の絵文字要約を生成する8つの命令調整LDMのベンチマークを監査した。
アノテータを固定因子ではなくランダムとして扱うと、他のどのシステムとも大きな違いはない。
選好スコアの代わりに**emoji-affect decodability*を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We audit a multilingual affective generation benchmark eight instruction-tuned LLMs producing emoji summaries for 17,100 Bangla, English and Hindi sentences, with 6,960 human judgements and find its headline conclusions to be artefacts of the measurement instrument rather than properties of the systems. Treating annotators as a random rather than a fixed factor, no system differs significantly from any other ($F(7,14)=0.59$, $p=0.76$), although the conventional analysis declares 19 of 28 pairwise differences significant. Annotator identity explains far more rating variance than system identity, and the winning system changes whenever any single annotator is removed. The ordering that does emerge tracks output length: mean emoji count explains 78.7\% of between-system variance, and a within-item length-matched comparison over 2,599 pairs reverses the leaderboard. We further show that cross-provider anisotropy differences vanish under mean-centring, that per-language token costs change sign with the normalising unit, and that multi-view row-wise splits inflate macro-F1 by $3.1$ points and change the top-ranked system. In place of preference scoring we propose **emoji-affect decodability**, a reference-based probe whose rankings are stable to $\pm0.003$ macro-F1 across seeds.
- Abstract(参考訳): 日本語・英語・ヒンディー語文17,100文の絵文字を合成する8つの命令調整LDMの多言語感情生成ベンチマークを,6,960人の判断で評価し,その見出しがシステムの性質ではなく,測定器の成果であることを確認した。
アノテーションを固定因子ではなくランダムとして扱うと、他のどのシステム(F(7,14)=0.59$, $p=0.76$)と大きく異なるわけではないが、従来の分析では28の対差のうち19は有意である。
アノテーションのアイデンティティは、システムアイデンティティよりもはるかに高い評価のばらつきを説明し、単一のアノテータが取り除かれると、入賞システムは変化する。
平均絵文字数では、システム間の差異の78.7\%が説明され、2,599対以上の長さマッチングの比較がリーダーボードを逆転させる。
さらに、平均セントリングの下でクロスプロジェクタ異方性差が消失し、言語単位当たりのトークンコストが正規化単位に変化し、複数ビューの行分割がマクロF1を3.1ドルポイント増加させ、上位システムを変更することを示す。
選好スコアの代わりに**emoji-affect decodability*を提案する。
関連論文リスト
- Decodable but Misrouted: Sparse Features Uncover a Readout Gap in Vision-Language Models for Harmful Meme Detection [11.020614074201346]
Gemma-3 と Qwen3.5 では,スパースオートエンコーダ,ロールコンディショニングプローブ,因果介入,リカバリ実験を用いて区別を行った。
スパース読み込みは6つのプライマリバイナリタスクすべてでネイティブ予測を上回っている。
ルーティングは、表現のみではなく、有害なミーム分類において、繰り返し発生するボトルネックである。
論文 参考訳(メタデータ) (2026-09-16T16:00:36Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - DEPART: DEcomposing PARiTy across Multilingual LLMs [11.757758630156589]
大きな言語モデル リーダーボードは言語ごとの正確さを報告しますが、なぜ格差が生じるのかを説明することはめったにありません。
本稿では,多言語のパフォーマンス分散を解釈可能なコンポーネントに分解する2段階のベイズ階層フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-27T08:45:48Z) - Prism-$Δ$: Differential Subspace Steering for Prompt Highlighting in Large Language Models [85.18197548789291]
PRISM-$ (Projection-based Relevance-Informed Steering Method) を提案する。
PRISM-$$は20種中19種で最も優れた方法であり、相対的な利得は+10.6%まで上昇し、ステアリングのコストは半減する。
PRISM-$はFlashAttentionと互換性があり、無視できるメモリオーバーヘッドを追加する。
論文 参考訳(メタデータ) (2026-03-11T12:24:45Z) - The Script Tax: Measuring Tokenization-Driven Efficiency and Latency Disparities in Multilingual Language Models [0.0]
2つの正書法変種を同一言語内容と比較することにより,スクリプト税の定量化を行う。
mBERT と XLM-R にまたがって、高いフラッゲーションの正書法は、受精率を3.4倍に向上させる。
サブワードの断片化から「NLLパラドックス」を避けるために、文字単位のビット(BPC)を用いることで、情報コストが大幅に増加することが分かる。
論文 参考訳(メタデータ) (2026-01-19T14:45:40Z) - Powerful rank verification for multivariate Gaussian data with any covariance structure [1.90365714903665]
citeGutmannは、この推測は、最大の観測と2番目に大きい観測を比べた両面の差分テストが正当であると論じている。
提案手法は,2辺差分法が上位のK$の内外における観測値と最小の標準差分を比較した場合に,所望の推測を導出することを示す。
論文 参考訳(メタデータ) (2025-03-03T00:10:09Z) - Revealing the Blind Spot of Sentence Encoder Evaluation by HEROS [68.34155010428941]
文エンコーダ(SE)が類似する文ペアの種類は明らかでない。
HEROSは、ある規則に基づいて原文を新しい文に変換し、テキスト最小対を形成することによって構築される
HEROS上の60以上の教師なしSEの性能を体系的に比較することにより,ほとんどの教師なしエンコーダが否定に敏感であることを明らかにする。
論文 参考訳(メタデータ) (2023-06-08T10:24:02Z) - RankCSE: Unsupervised Sentence Representations Learning via Learning to
Rank [54.854714257687334]
本稿では,教師なし文表現学習のための新しい手法であるRangCSEを提案する。
コントラスト学習を伴うランキング一貫性とランキング蒸留を統一された枠組みに組み込む。
セマンティックテキスト類似性(STS)と転送タスク(TR)の両方について、広範な実験が実施されている。
論文 参考訳(メタデータ) (2023-05-26T08:27:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。