論文の概要: GLARE: Generating Listening Heads with Appropriate Reactions
- arxiv url: http://arxiv.org/abs/2609.40317v1
- Date: Wed, 30 Sep 2026 17:53:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.300734
- Title: GLARE: Generating Listening Heads with Appropriate Reactions
- Title(参考訳): GLARE: 適切な反応による聴取ヘッドの生成
- Abstract要約: 既存のdyadicデータセットには、きめ細かいリスナ反応アノテーションがない。
既存の評価指標は、リスナーが適切に反応するかどうかではなく、トーキングヘッドとビデオ生成から受け継がれた視覚リアリズムを測定する。
本稿では、反応発生(R-F1)、時間的アライメント(R-tIoU)、非対称時間的偏差(R-ATD)、反応領域視覚品質(R-FID)を共同測定する反応指向評価プロトコルを提案する。
実験結果から、視覚的忠実度と反応レベルの指標の両方において、従来のリスニングヘッド法よりも一貫した利得を示した。
- 参考スコア(独自算出の注目度): 38.103860634900265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While talking head generation has advanced rapidly, generating natural listener behavior in dyadic conversations, which know when to react, how to react, and with what type of response, remains underexplored. Existing dyadic datasets lack fine-grained listener reaction annotations, and prevailing evaluation metrics inherited from talking-head and video generation measure visual realism rather than whether a listener reacted appropriately. We address these gaps along three aspects. First, we curate a listening-head-specific dataset built from RealTalk and Seamless Interaction, comprising approximately 147 hours of paired speaker-listener videos with 64,557 event-level reaction annotations across six categories: nodding, head shaking, smiling, laughing, frowning, and surprised. Second, we introduce an audio-driven baseline built on a flow-matching transformer, namely GLARE, with prosody conditioning derived from Qwen2-Audio and a temporal reaction loss that explicitly supervises frame-wise reactions. Third, we propose a reaction-oriented evaluation protocol that jointly measures reaction occurrence (R-F1), temporal alignment (R-tIoU), asymmetric temporal deviation (R-ATD), and reaction-region visual quality (R-FID), giving a more behaviorally grounded assessment than visual-quality-only metrics. Experiment results show consistent gains over prior listening-head methods in both visual fidelity and reaction-level metrics, suggesting that reaction-aware data, modeling, and evaluation are critical for natural listening behavior.
- Abstract(参考訳): ヘッドジェネレーションは急速に進歩し、いつ反応するか、どのように反応するか、どんな反応でどのように反応するかを知っているダイアディックな会話において、自然なリスナー行動を生成する。
既存のdyadicデータセットには詳細なリスナー反応アノテーションが欠如しており、リスナーが適切に反応したかどうかではなく、トーキングヘッドとビデオ生成から受け継がれた評価指標が視覚リアリズムを測っている。
これらのギャップには3つの側面があります。
まず、RealTalkとSeamless Interactionから構築されたリスニングヘッド固有のデータセットをキュレートし、約147時間のペアリングされたスピーカーリスナービデオと64,557のイベントレベルの反応アノテーションを6つのカテゴリに分けた。
第2に,フローマッチング変換器(GLARE)上に構築された音声駆動ベースラインに,Qwen2-Audioから派生した韻律条件付けと,フレームワイド反応を明示的に監督する時間的反応損失を導入する。
第3に、反応発生(R-F1)、時間的アライメント(R-tIoU)、非対称時間的偏差(R-ATD)、反応領域の視覚的品質(R-FID)を共同で測定し、視覚的品質のみの指標よりも行動的基礎評価を行う反応指向評価プロトコルを提案する。
実験の結果、視覚的忠実度と反応レベルの指標の両方において、従来のリスニングヘッド法よりも一貫した利得が示され、反応認識データ、モデリング、評価が自然なリスニング行動にとって重要であることが示唆された。
関連論文リスト
- EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold [42.914956034834326]
EvolvingAvatarは、対話中にユーザの顔ビデオとダイアディックオーディオに適応する因果生成装置である。
InterHead-Benchは、シングルビューとデュアルビューの会話ビデオから構築された455.95時間のベンチマークである。
論文 参考訳(メタデータ) (2026-09-28T16:56:07Z) - Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning [42.070531160001785]
感情支援システムのための反応認識ポリシー最適化(RAPO)を提案する。
RAPOは、対話を反応駆動プロセスとして扱い、シミュレーションされたユーザ応答を利用して、高密度な自然言語フィードバックを生成する。
RAPOは、肯定的な相互作用の結果の駆動において、強い強化学習ベースラインを著しく上回る。
論文 参考訳(メタデータ) (2026-03-16T15:39:54Z) - ReactMotion: Generating Reactive Listener Motions from Speaker Utterance [93.89117265072464]
話者発話からのリアクティブリスナー運動生成は、話者の発話に適切に反応する自然主義的リスナー身体運動を生成することを目的としている。
提案するReactMotionNetは、話者発話と複数の候補リスナーの動きを、適切な度合いでアノテートする大規模データセットである。
テキスト,音声,感情,動きを共同でモデル化する統合生成フレームワークであるReactMotionを提案する。
論文 参考訳(メタデータ) (2026-03-16T10:37:42Z) - Chronological Thinking in Full-Duplex Spoken Dialogue Language Models [66.84843878538207]
時系列思考は、完全なSDLMの応答品質を改善することを目的としている。
追加のレイテンシがない: ユーザが話すのをやめると、エージェントは考えるのをやめ、それ以上の遅延なしに話し始める。
結果: 客観的指標と人的評価の両面から, 時系列思考の有効性を示す実験を行った。
論文 参考訳(メタデータ) (2025-10-02T10:28:11Z) - Emotional Listener Portrait: Realistic Listener Motion Simulation in
Conversation [50.35367785674921]
リスナーヘッドジェネレーションは、話者から提供される情報を参照して、リスナーの非言語行動を生成することに集中する。
このような反応を生成する上で重要な課題は、会話中のきめ細かい表情の非決定論的性質である。
本稿では,複数の個別な動きコーパスの合成として,各顔の動きを微粒化処理する情緒的リスナー・ポートレート(ELP)を提案する。
ELPモデルは,学習分布からのサンプリングにより,与えられた話者に対する自然な,多様な応答を自動的に生成するだけでなく,所定の姿勢で制御可能な応答を生成することができる。
論文 参考訳(メタデータ) (2023-09-29T18:18:32Z) - ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions [46.66378299720377]
ダイアドインタラクションでは、聴取者の顔反応を予測することは困難であり、同じ話者の振る舞いに応じて異なる反応が適している可能性がある。
本稿では,外挿や予測問題としてタスクを再構築し,複数の異なる顔反応を生成する新しいフレームワーク(ReactFace)を提案する。
論文 参考訳(メタデータ) (2023-05-25T05:55:53Z) - Responsive Listening Head Generation: A Benchmark Dataset and Baseline [58.168958284290156]
本研究では、応答型リスニングヘッド生成タスクを、複数の入力に応答する動きと表現を持つ非言語ヘッドの合成として定義する。
音声によるジェスチャーや音声のヘッド生成とは違って,いくつかの研究分野の恩恵を期待して,このタスクにより多くのモーダルを導入する。
論文 参考訳(メタデータ) (2021-12-27T07:18:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。