論文の概要: VIBE: A VAD-Informed Benchmark for Entity-Centered Affective Profiling of Large Language Model Outputs
- arxiv url: http://arxiv.org/abs/2608.03810v1
- Date: Tue, 04 Aug 2026 15:22:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.265469
- Title: VIBE: A VAD-Informed Benchmark for Entity-Centered Affective Profiling of Large Language Model Outputs
- Title(参考訳): VIBE: 大規模言語モデル出力のエンティティ中心型影響プロファイルのためのVADインフォームドベンチマーク
- Authors: Andrei Chetvergov, Alexander Evseev, Timofei Sivoraksha, Stepan Ukolov, Mikhail Solovev, Danil Sazanakov, Sergey Bolovtsov,
- Abstract要約: 本稿では,Valence-Arousal-Dominance(VAD)空間における出力のエンティティ中心の感情プロファイルのベンチマークであるVIBEを紹介する。
VIBEは外部スコアから生成を分離し、スカラー選択性、応答レベルVAD、ターゲット指向VADを区別し、Affective Passportを通じてプロファイルをレポートする。
- 参考スコア(独自算出の注目度): 33.72751145910978
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models routinely describe socially salient targets, including political figures, countries, religions, organizations, historical events, and social groups, encoding affective framing alongside factual content: a target may appear favorable or threatening, calm or conflictual, powerful or vulnerable. Existing work captures parts of this space through sentiment, favorability, and emotion benchmarks, but none combines target-directed VAD attribution, an explicit scorer contract, and a passport reporting format. We introduce VIBE, a benchmark for entity-centered affective profiling of LLM outputs in Valence-Arousal-Dominance (VAD) space. Its core contribution is a measurement contract: VIBE separates generation from external scoring, distinguishes scalar favorability, response-level VAD, and target-directed VAD, and reports profiles through an Affective Passport. Three empirical layers support the contract. H1 shows scalar favorability does not subsume arousal and dominance: valence findings are cross-validated (rV = 0.944 judge-human, rV = 0.954 inter-scorer); arousal and dominance are single-scorer directional estimates, not point-precise, consistent with known inter-annotator difficulty on these axes (rA = 0.495, rD = 0.702 among human annotators). H2 shows whole-response and target-directed VAD are different contracts: the same text can carry one affective tone overall while representing the named target differently. H3 is a protocol-drift diagnostic: elicitation conditions shift profiles, motivating context metadata in every affective report. These results motivate entity-centered affective profiling as a documented practice: profiles should be released with scorer identity, coverage, protocol, and interpretation limits.
- Abstract(参考訳): 大規模言語モデルは、政治的人物、国、宗教、組織、歴史的出来事、社会集団を含む社会的に健全な標的を常に記述し、事実コンテンツと共に感情的なフレーミングを符号化する。
既存の作業は、感情、好意性、感情のベンチマークを通じてこの分野の一部をキャプチャするが、ターゲット指向のVAD属性、明示的なスコアリング契約、パスポートレポートフォーマットを組み合わせたものはない。
本稿では,Valence-Arousal-Dominance(VAD)空間におけるLLM出力のエンティティ中心の感情プロファイルのベンチマークであるVIBEを紹介する。
VIBEは外部スコアから生成を分離し、スカラー選択性、応答レベルVAD、ターゲット指向VADを区別し、Affective Passportを通じてプロファイルをレポートする。
3つの経験的なレイヤが契約を支持します。
H1は、スカラーの好適性は、覚醒と支配を仮定しない: 原子価の発見は、クロスバリデーション(rV = 0.944の判断-人間、rV = 0.954のインタースコラー)、覚醒と支配は、単一スコラーの方向推定であり、点精度ではなく、これらの軸上の既知のアノテーション間の困難(rA = 0.495, rD = 0.702)と一致している。
H2は、全応答とターゲット指向のVADが異なるコントラクトであることを示している。同じテキストは、名前の付いたターゲットを異なる方法で表現しながら、全体として1つの感情的なトーンを持てる。
H3はプロトコルドリフト診断(プロトコルドリフト診断)である。
これらの結果は、エンティティ中心の感情プロファイルを文書化されたプラクティスとして動機付けている。
関連論文リスト
- Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Causal Supervision of Attention for Affective Behaviour Analysis [5.611458864154039]
textit11th Affective Behaviour Analysis in-the-wild Competitionにはマルチタスク学習チャレンジが含まれている。
課題は、主題全体にわたって一般化される感情に関連した表現を学習することにある。
本稿では、因果的監視と注意要素の相互共分散規則化を組み合わせた注意プールフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-13T19:11:33Z) - PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark [7.957250777212916]
テキストリッチな画像モデルは、現在、ポスタースケールのレイアウトを設計できますが、それらが科学的コミュニケーション契約を尊重するかどうかを測定する方法はありません。
本稿では、評価可能な指示追従タスクとして、監査可能なハーネスリフレーミングポスター生成であるPOSTERHARNESSを提案する。
論文 参考訳(メタデータ) (2026-07-03T06:39:56Z) - Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion [4.726028690278432]
本稿では、Pascal VOC上で、介入に基づく忠実度、ターゲット外リーク、実行時、再現可能なベンチマークを提案する。
本稿では、地域レベルの干渉信号と証拠を融合させる軽量な補正であるDual-Evidence Attribution(DEA)を提案する。
論文 参考訳(メタデータ) (2026-03-23T22:52:00Z) - DimStance: Multilingual Datasets for Dimensional Stance Analysis [15.66074094588045]
スタンス検出は、著者の特定の目標に対する態度を、フェーバー、中立、反対などのカテゴリに分類する確立したタスクである。
我々は、長い間確立されてきた感情科学の枠組みを利用して、価値(負の)と覚醒(カルムのアクティブ)の実数値次元に沿ってスタンスをモデル化する。
この次元的アプローチは、スタンス表現の根底にある微妙な感情状態を捉え、きめ細かいスタンス解析を可能にする。
論文 参考訳(メタデータ) (2026-01-29T10:02:08Z) - Generalized Visual Relation Detection with Diffusion Models [94.62313788626128]
視覚的関係検出(VRD)は、画像内のオブジェクトペア間の関係(または相互作用)を特定することを目的としている。
本稿では,視覚的関係を連続的な埋め込みとしてモデル化し,一般化されたVRDを条件付き生成方法で実現するための拡散モデルの設計を提案する。
我々のDiff-VRDは、予め定義されたデータセットのカテゴリラベルを超えて、視覚的な関係を生成できる。
論文 参考訳(メタデータ) (2025-04-16T14:03:24Z) - Noisy-Correspondence Learning for Text-to-Image Person Re-identification [50.07634676709067]
本稿では,雑音対応においても頑健な視覚関係を学習するための新しいロバスト二重埋め込み法(RDE)を提案する。
提案手法は,3つのデータセット上での合成ノイズ対応と非合成ノイズ対応を両立させる。
論文 参考訳(メタデータ) (2023-08-19T05:34:13Z) - Disentangled Variational Autoencoder for Emotion Recognition in
Conversations [14.92924920489251]
会話(ERC)における感情認識のためのVAD-VAE(VAD-VAE)を提案する。
VAD-VAEは3つをアンタングルし、Valence-Arousal-Dominance(VAD)を潜在空間から表現する。
実験により、VAD-VAEは2つのデータセット上で最先端のモデルより優れていることが示された。
論文 参考訳(メタデータ) (2023-05-23T13:50:06Z) - Pose-guided Visible Part Matching for Occluded Person ReID [80.81748252960843]
本稿では、ポーズ誘導による特徴の識別を共同で学習し、その部分の可視性を自己判断する Pose-Guided Visible Part Matching (PVPM) 法を提案する。
実験結果から,提案手法は最先端手法と競合する性能を示した。
論文 参考訳(メタデータ) (2020-04-01T04:36:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。