論文の概要: Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach
- arxiv url: http://arxiv.org/abs/2607.23845v1
- Date: Sun, 26 Jul 2026 21:16:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.252657
- Title: Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach
- Title(参考訳): 視覚的特徴は他の初期修復検出を改善するか? : 動的マルチモーダルアプローチ
- Abstract要約: Other-initiated Self-Repair または略して Other-initiated repair は会話の相互作用に不可欠なメカニズムである。
本稿では,会話分析から得られた視覚的特徴を取り入れた,OIR検出と分類のための新しいマルチモーダルモデルを提案する。
- 参考スコア(独自算出の注目度): 8.813506953164778
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Other-initiated Self-repair, or in short Other-initiated Repair (OIR), is an essential mechanism in conversational interaction, whereby a recipient signals a problem in speaking, hearing, or understanding, prompting the previous speaker to resolve it. In the case of conversational agents, it is essential to accurately identify these repair initiation strategies to address communication breakdowns efficiently. While conversational analysis studies have shown that OIR initiation is accompanied by both verbal and non-verbal signals such as gaze shifts, facial expressions, body postures, and hand gestures, existing computational approaches rely mainly on text and audio. This paper introduces a novel multimodal model for OIR detection and classification, incorporating a set of visual features drawn from conversation analysis. We evaluate our approach on two corpora with distinct languages and interaction settings. Results demonstrate that visual information consistently improves performance over text and audio baselines, and provide insights into cross-modal feature contributions across two corpora.
- Abstract(参考訳): Other-initiated Self-Repair または略して Other-initiated repair (OIR) は、会話の相互作用において重要なメカニズムであり、受信者は会話、聴覚、理解において問題を信号し、前者の話者にそれを解決するよう促す。
会話エージェントの場合、これらの修復開始戦略を正確に識別し、コミュニケーションのブレークダウンを効率的に解決することが不可欠である。
会話分析研究は、OIR開始には視線シフト、表情、身体姿勢、手の動きといった言語的・非言語的な信号が伴っていることを示したが、既存の計算手法は主にテキストと音声に依存している。
本稿では,会話分析から得られた視覚的特徴を取り入れた,OIR検出と分類のための新しいマルチモーダルモデルを提案する。
異なる言語と相互作用設定を持つ2つのコーパスに対するアプローチを評価する。
その結果、視覚情報はテキストや音声のベースラインよりも常にパフォーマンスを向上し、2つのコーパスにまたがるクロスモーダルな特徴コントリビューションに対する洞察を提供する。
関連論文リスト
- "Mm, Wat?" Detecting Other-initiated Repair Requests in Dialogue [1.0616273526777913]
本研究では,オランダ語対話における修復開始を自動的に検出するマルチモーダルモデルを提案する。
その結果,韻律的手がかりは言語的特徴を補完し,事前学習されたテキストと音声の埋め込みの結果を大幅に改善することがわかった。
論文 参考訳(メタデータ) (2025-10-28T16:58:26Z) - Computational Analysis of Conversation Dynamics through Participant Responsivity [18.116125865284666]
応答性を定量化する手法を開発し評価する。
両手法を人間に注釈を付けた会話の真理集合に対して評価する。
次に,会話談話の様々な側面に対処するために,会話レベルの派生メトリクスを開発する。
論文 参考訳(メタデータ) (2025-09-19T23:13:13Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models [31.584937435966253]
音声対話能力を評価するためにVocalBenchを提案する。
4つのキーディメンションにわたる9,400の慎重にキュレートされたインスタンスで構成されている。
効果的な音声対話に不可欠な、幅広い基本的なスキルをカバーしている。
論文 参考訳(メタデータ) (2025-05-21T16:34:07Z) - Nonverbal Interaction Detection [83.40522919429337]
この研究は、社会的文脈における人間の非言語的相互作用を理解するという新たな課題に対処する。
我々はNVIと呼ばれる新しい大規模データセットを寄贈し、人間とそれに対応する社会グループのための境界ボックスを含むように細心の注意を払ってアノテートする。
第2に,非言語的インタラクション検出のための新たなタスクNVI-DETを構築し,画像から三つ子を識別する。
第3に,非言語相互作用検出ハイパーグラフ (NVI-DEHR) を提案する。
論文 参考訳(メタデータ) (2024-07-11T02:14:06Z) - Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models [56.257840490146]
ConCueは、HOI検出における視覚的特徴抽出を改善するための新しいアプローチである。
コンテクストキューをインスタンスと相互作用検出器の両方に統合するマルチトウワーアーキテクチャを用いたトランスフォーマーベースの特徴抽出モジュールを開発した。
論文 参考訳(メタデータ) (2023-11-26T09:11:32Z) - Re-mine, Learn and Reason: Exploring the Cross-modal Semantic
Correlations for Language-guided HOI detection [57.13665112065285]
ヒューマンオブジェクトインタラクション(HOI)検出は、コンピュータビジョンの課題である。
本稿では,構造化テキスト知識を組み込んだHOI検出フレームワークを提案する。
論文 参考訳(メタデータ) (2023-07-25T14:20:52Z) - Filling the Gap of Utterance-aware and Speaker-aware Representation for
Multi-turn Dialogue [76.88174667929665]
マルチターン対話は、2つ以上の異なる話者の役割から複数の発話からなる。
既存の検索に基づくマルチターン対話モデルでは、事前訓練された言語モデル(PrLM)をエンコーダとして、対話を粗く表現する。
本稿では,対話履歴に係わる効果的な発話認識表現と話者認識表現をモデル化することにより,そのようなギャップを埋める新しいモデルを提案する。
論文 参考訳(メタデータ) (2020-09-14T15:07:19Z) - Multi-Stage Conversational Passage Retrieval: An Approach to Fusing Term
Importance Estimation and Neural Query Rewriting [56.268862325167575]
マルチステージアドホックIRシステムにクエリ再構成を組み込んだ会話経路検索(ConvPR)に取り組む。
本稿では,1項の重要度推定と2項のニューラルクエリ書き換えという2つの手法を提案する。
前者に対しては、周波数に基づく信号を用いて会話コンテキストから抽出した重要な用語を用いて会話クエリを拡張する。
後者では,会話クエリを,事前訓練されたシーケンス列列列モデルを用いて,自然な,スタンドアロンの,人間の理解可能なクエリに再構成する。
論文 参考訳(メタデータ) (2020-05-05T14:30:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。