論文の概要: StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech
- arxiv url: http://arxiv.org/abs/2607.22658v1
- Date: Sat, 27 Jun 2026 15:27:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.012394
- Title: StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech
- Title(参考訳): StanceBench:音声によるLLMに基づく対人スタンス評価のためのベンチマーク
- Abstract要約: 会話音声における対人姿勢を測定するためのベンチマークであるStanceBenchを紹介する。
シームレス相互作用コーパスを用いて、StanceBench (1) はロールプロンプトポールを介して9つのスタンス次元を指定し、(2)単一話者の評価を標準化し、(3) LLM-as-a-judgeの堅牢性、バイアス、姿勢推定を報告した。
評価された姿勢、共感、丁寧さは最も容易である。温かさと断定性は、正の歪/非対称性と適度に分離可能である。
正直は最も困難であり、クロスターンの証拠を必要とするため、高い急進的な順序バイアスを示す。
- 参考スコア(独自算出の注目度): 23.716416507216636
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech-to-speech dialogue models increasingly depend on prosody and interactional nuance to convey social intent, yet benchmarks for these cues remain limited. We introduce StanceBench, a benchmark for measuring interpersonal stance in conversational speech and evaluating audio-capable LLMs as automated judges. Using the Seamless Interaction corpus, StanceBench (1) specifies 9 stance dimensions via role-prompt poles, (2) standardizes single-speaker and interaction-based evaluations, and (3) reports LLM-as-a-judge robustness, bias, and stance inference. Across evaluated stances, empathy and politeness are the easiest. Warmth and assertiveness are moderately separable with positivity skew/asymmetry. Honesty is the hardest and shows high prompt order bias, consistent with needing cross-turn evidence. Attentiveness is separable but aligns weakly with humans. Interaction stances are more context-sensitive, with threshold gaps and high variance, especially conflict regulation.
- Abstract(参考訳): 音声と音声の対話モデルは、社会的意図を伝えるための韻律や対話的ニュアンスにますます依存しているが、これらの手がかりのベンチマークは限られている。
本稿では,会話音声における対人姿勢を測定するためのベンチマークであるStanceBenchを紹介し,音声認識可能なLCMを自動判断器として評価する。
シームレスインタラクションコーパスを用いて、StanceBench (1) はロールプロンプトポールを介して9つのスタンス次元を定義し、(2) 単一話者と相互作用に基づく評価を標準化し、(3) LLM-as-a-judgeのロバスト性、バイアス、姿勢推定を報告した。
評価されたスタンス、共感、礼儀正しいことは最も簡単です。
温度と断定性は、正のスキュー/ア対称性と適度に分離可能である。
正直は最も困難であり、クロスターンの証拠を必要とするため、高い急進的な順序バイアスを示す。
注意力は分離可能であるが、人間と弱く一致している。
相互作用のスタンスは文脈に敏感であり、しきい値のギャップと高い分散、特に紛争の規制がある。
関連論文リスト
- SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models [9.873637206435967]
音声対音声言語モデルのストリーミングは、音声クエリに合成音声で直接答えることを目的としている。
標準的なベンチマークでは、これらのシステムが会話の中で自然に振る舞うかどうかを捉えていない。
本研究では,音声合成言語モデルにおける自然性評価のベンチマークであるSPEARBenchを紹介する。
論文 参考訳(メタデータ) (2026-07-06T17:42:59Z) - AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence [1.7294100412670375]
感情知性(EI)は人間のコミュニケーションの中心であり、評価することがますます重要になっている。
AttuneBenchは200個の真のマルチターンヒューマンモデル会話をベースとしたベンチマークである。
感情認識,行動分類,嗜好予測,判断された応答品質のモデルランキングは,ほぼ独立していることがわかった。
論文 参考訳(メタデータ) (2026-05-20T21:06:05Z) - SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models [86.19617358080016]
Social Omniは、3つのコア次元にわたる対話性の評価を運用するベンチマークである。
Social Omniは2000の知覚サンプルと209の相互作用生成インスタンスの品質管理された診断セットを備えている。
本分析により,モデルの知覚的精度と,文脈的に適切な割り込みを生成する能力との間に顕著な疎結合が明らかとなった。
論文 参考訳(メタデータ) (2026-03-17T17:58:44Z) - HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue [29.077783997591037]
HEARTは、人間とLDMを同一のマルチターン感情支援会話で直接比較する最初のフレームワークである。
いくつかのフロンティアモデルは、共感と一貫性の知覚において、平均的な人間の反応に近づいたり、超えたりします。
HEARTは、サポート的対話を、一般的な推論や言語流布とは分離可能な、独立した能力軸として再編成する。
論文 参考訳(メタデータ) (2026-01-09T06:48:08Z) - From Fact to Judgment: Investigating the Impact of Task Framing on LLM Conviction in Dialogue Systems [8.8953040142657]
本研究では,タスクが直接の事実クエリから会話的判断タスクにリフレームされると,LCMの信念がどう変化するかを検討する。
両条件に単純な反論(前の答えは正しくない)の形で圧力を適用する。
以上の結果から, GPT-4o-miniのようなモデルでは, 社会的フレーミング作業下でのシコファン性傾向が明らかにされているが, Llama-8B-Instructのようなモデルでは過度に批判的になる。
論文 参考訳(メタデータ) (2025-11-14T00:55:28Z) - Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play [68.54773980519457]
Speech-DRAMEは3つのレベルで貢献する統合フレームワークである。
音声ロールプレイを評価するための、最初の包括的で再現可能な基盤を提供する。
論文 参考訳(メタデータ) (2025-11-03T06:12:40Z) - Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena [76.21004582932268]
本研究では, LLM-as-a-judgeの使用状況と限界について検討し, 位置, 冗長性, 自己改善バイアスについて検討した。
次に、マルチターン質問セットであるMT-benchとクラウドソースのバトルプラットフォームであるArenaの2つのベンチマークを導入することで、LCMの判断と人間の嗜好の一致を検証する。
論文 参考訳(メタデータ) (2023-06-09T05:55:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。