論文の概要: Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation
- arxiv url: http://arxiv.org/abs/2607.18508v1
- Date: Mon, 20 Jul 2026 21:05:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.243686
- Title: Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation
- Title(参考訳): スタイル・オーバー・サブスタンス:感情記述的嗜好評価のショートカット
- Authors: Jiabing Yang, Yixiang Chen, Yuan Xu, Qisen Ma, Tao Yu, Peiyan Li, Yingda Li, Yan Huang, Liang Wang,
- Abstract要約: コンテントブレンドプローブを用いてEmoPreferの系統的ショートカット監査を行う。
記述長とジェネレータの同一性のみを用いた単純なロジスティック回帰は、LoRAに精細化された7Bテキストとオーディオ視覚的判断に相容れない。
結果は、人間の嗜好が本質的にスタイリスティックであることや、記述に感情的な情報がないことを示唆していない。
- 参考スコア(独自算出の注目度): 18.639828982880108
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Preference over model-generated emotion descriptions is emerging as a standard evaluation metric for multimodal emotion understanding, exemplified by the MER2026 MER-Prefer track on EmoPrefer. Such benchmarks assume that predicting the preferred description requires grounded cross-modal understanding of the video. We conduct a systematic shortcut audit of EmoPrefer using content-blind probes. A simple logistic regression using only description length and generator identity, without processing the text, video, or audio, performs comparably to LoRA-finetuned 7B text and audio-visual judges (65.8 versus 66.8 WAF on EmoPrefer-V2). Generator identity is recoverable from description text with 99.5 percent accuracy, every candidate pair contrasts two distinct generators, and the human preference labels agree with a fold-exclusive per-generator win-rate prior on 66 percent of the evaluated pairs. When the human label conflicts with this prior, trained judges still follow the style prior on 63 to 80 percent of the pairs. On a length-matched subset that neutralizes verbosity bias, the tested media configurations yield no statistically significant improvement, while an ODIN-inspired diagnostic that decouples the style shortcut leaves its content head near chance. These results do not imply that human preferences are inherently stylistic or that the descriptions contain no emotional information. Instead, they show that the current scores can be reached without verifying either description against the video. We recommend source-balanced pairing, strict length control, counter-stereotypical sliced reporting, and multi-annotator consensus for future cross-generator evaluations. Code is available at https://github.com/jiabingyang01/EmoPrefer-Audit.
- Abstract(参考訳): EmoPreferのMER2026MER-Preferトラックで実証されたマルチモーダル感情理解のための標準評価指標として,モデル生成感情記述に対する嗜好が浮上している。
このようなベンチマークでは、推奨する記述を予測するには、動画の非モーダルな理解が必要であると仮定している。
コンテントブレンドプローブを用いてEmoPreferの系統的ショートカット監査を行う。
テキスト、ビデオ、オーディオを処理せずに、記述長とジェネレータIDのみを用いる単純なロジスティック回帰は、LoRAに精細化された7Bテキストとオーディオ視覚判断(EmoPrefer-V2では65.8WAFに対して66.8WAF)と互換性がある。
ジェネレータのアイデンティティは、99.5%の精度で記述テキストから復元可能であり、各候補ペアは2つの異なるジェネレータと対比し、ヒトの選好ラベルは評価されたペアの66%に先立って、折りたたみ排他的な1世代当たりの勝利率に一致する。
人間のラベルがそれ以前のものと矛盾する場合、訓練された審査員は、ペアの63~80%に先立ってこのスタイルを踏襲する。
冗長性バイアスを中和する長さマッチングされたサブセットでは、テストされたメディア構成は統計的に有意な改善を得られず、ODINにインスパイアされた診断では、スタイルショートカットを分離し、コンテンツヘッドを近い将来に残す。
これらの結果は、人間の嗜好が本質的にスタイリスティックであることや、その記述が感情的な情報を含んでいないことを示唆していない。
代わりに、ビデオに対するどちらの説明も検証せずに、現在のスコアに到達できることが示される。
我々は、ソースバランスの取れたペアリング、厳密な長さ制御、反ステレオタイプスライスレポート、および将来のクロスジェネレータ評価のためのマルチアノテータコンセンサスを推奨する。
コードはhttps://github.com/jiabingyang01/EmoPrefer-Audit.comで入手できる。
関連論文リスト
- Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence [21.413257942637888]
既存のアプローチは、人書きのルーブリック、好みのデータ、サンプリングされたレスポンスから監督されることが多い。
外部アノテーションやモデルトレーニングなしで空のセットからルーブリックセットを進化させる、クエリのみのフレームワークを導入します。
5つのベンチマークスイートの実験では、Trialでの好みの有効性が示されている。
論文 参考訳(メタデータ) (2026-07-16T15:01:33Z) - Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization [51.93456979139756]
自由文の説明は、ラベルの不一致を超えて人間のラベルのバリエーションを拡大する。
このようなアノテータ固有のラベル説明動作を,大規模言語モデルで学習し,再現できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-05-27T17:55:00Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - RAGR: Review-Augmented Generative Recommendation [61.29879991713178]
Review-Augmented Generative Recommendation (RAGR)は、レビューフィードバックを直接生成ユーザシーケンスに組み込む新しいGRフレームワークである。
RAGRは、すべてのメトリクスにわたる強力なGRバックボーンよりも一貫性があり、大きな利益をもたらす。
論文 参考訳(メタデータ) (2026-05-17T05:21:23Z) - The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking [0.0]
本稿では,"HTML AI Battle"プロジェクトにおける17の公開実験から収集した68個の単一ファイルHTML世代を8週間にわたって比較した。
GPT、Gemini、Grok、Claudeの4つの推論モデルファミリは、カスタムインストラクションなし、パーソナリティチューニングなし、修理プロンプトなし、固定された公開インターフェースプロトコルで比較された。
クロードは最強で一貫した家族であり、平均的なパフォーマンスを導き、主要な人間の重み付けスコアで9/17のプロンプトを獲得した。
論文 参考訳(メタデータ) (2026-05-06T18:19:11Z) - Relational Preference Encoding in Looped Transformer Internal States [0.0]
ループ変換器は内部の反復状態においてどのように人間の嗜好を符号化するかを検討する。
繰り返し洗練された2.6Bパラメータループ変換器であるOuro-2.6B-Thinkingを用いて,各ループ繰り返しから隠れた状態を抽出する。
我々は、HH-RLHFデータセット上で人間の嗜好を予測するために軽量評価器ヘッドを訓練する。
我々のペアワイズ評価器は8,552個の未確認例に対して95.2%の精度を達成し、ベースモデルは完全に凍結されている間に全バッチのL-BFGSプローブ(84.5%)を上回った。
論文 参考訳(メタデータ) (2026-04-10T20:00:49Z) - Same Words, Different Judgments: Modality Effects on Preference Alignment [8.352948546053776]
我々は100のプロンプトで同一のセマンティックコンテンツをテキストと音声で評価する。
オーディオの好みはテキストと同じくらい信頼性があり、レイター間の合意は良好なレベルに達する。
オーディオラッカーは、より狭い決定しきい値、長さバイアスの低減、よりユーザ指向の評価基準を示す。
論文 参考訳(メタデータ) (2026-02-26T07:34:15Z) - Towards Empathetic Conversational Recommender Systems [77.53167131692]
本稿では,共感型会話レコメンデータ(ECR)フレームワークを提案する。
ECRには、感情対応アイテムレコメンデーションと感情対応応答生成という、2つの主要なモジュールが含まれている。
ReDialデータセットの実験は、推奨精度を高め、ユーザの満足度を向上させる上で、我々のフレームワークの有効性を検証する。
論文 参考訳(メタデータ) (2024-08-30T15:43:07Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z) - Exploring Explainable Selection to Control Abstractive Summarization [51.74889133688111]
説明可能性を重視した新しいフレームワークを開発する。
新しいペアワイズ行列は、文の相互作用、中心性、属性スコアをキャプチャする。
コンストラクタ内の文分割アテンション機構は、最終要約が所望のコンテンツを強調することを保証する。
論文 参考訳(メタデータ) (2020-04-24T14:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。