論文の概要: Negation Beyond the Verbal Channel: Temporal Multimodal Correlates in Dialogue
- arxiv url: http://arxiv.org/abs/2609.16396v1
- Date: Mon, 14 Sep 2026 22:07:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.25401
- Title: Negation Beyond the Verbal Channel: Temporal Multimodal Correlates in Dialogue
- Title(参考訳): 言語チャンネルを超えての否定:対話における時間的マルチモーダル相関
- Abstract要約: バーチャルリアリティーにおける27の人間-人間インタビューについて検討した。
時系列と音響情報を除いた20の時系列モデルを比較し、時間的文脈、相互作用源、モダリティの可用性、イベントのタイミングを体系的に変化させる。
グループで10倍のクロスバリデーションを行い、最強のプローブは話者側の行動から最大.75倍のAUROCに到達した。
- 参考スコア(独自算出の注目度): 44.39196719594625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Negation is typically modeled through its linguistic realization, although spoken interaction is accompanied by tightly coordinated nonverbal behavior. We ask whether contexts centered on spoken negation cues contain measurable multimodal behavioral information: whether they can be distinguished from matched control contexts without lexical or acoustic input, where this information occurs in time, which modalities carry it, and whether it extends to the dialogue partner. We study 27 human-human interviews conducted in virtual reality, comprising temporally aligned gaze, facial, head, body, hand, and finger behavior and 964 annotated negation cues. Treating classification as a predictive probe, we compare 20 time-series models while excluding lexical and acoustic information, and then systematically vary temporal context, interactional source, modality availability, and event timing. Across grouped 10-fold cross-validation, the strongest probes reach up to .75 mean held-out AUROC from speaker-side behavior. Temporal analyses show that predictive information is concentrated around cue onset but remains detectable over a broader surrounding interval, while dialogue-partner behavior carries weaker predictive information with a comparatively diffuse temporal profile. Ablation and timing perturbations further show that facial features produce the largest modality-ablation effect and that the trained probe is sensitive to the temporal organization of the observed events.
- Abstract(参考訳): 否定は言語的実現を通じてモデル化されるのが一般的であるが、音声による相互作用は厳密に調整された非言語行動を伴う。
本研究は,音声否定手法を中心とした文脈が,語彙や音響入力を使わずに一致した制御コンテキストと区別できるのか,どの情報が時間内に発生するのか,どのモダリティが持つのか,対話相手に拡張されるのか,といった,測定可能なマルチモーダルな行動情報を含むかどうかを問う。
バーチャルリアリティーにおいて, 顔, 顔, 頭, 体, 手, 指の動作と, 964の注釈付き否定的手がかりを含む27の人間対人間インタビューについて検討した。
時系列と音響情報を除く20の時系列モデルを比較し,時間的文脈,インタラクションソース,モダリティの可利用性,イベントタイミングを体系的に変化させる。
グループで10倍のクロスバリデーションを行い、最強のプローブは話者側の振る舞いから最大.75個のAUROC平均保持値に達した。
時間的分析では、予測情報はcueオンセットを中心に集中しているが、より広い周囲の間隔で検出可能であり、対話パートナーの振る舞いは比較的拡散した時間的プロファイルを持つ弱い予測情報を運ぶ。
アブレーションとタイミングの摂動は、顔の特徴が最大のモダリティ・アブレーション効果をもたらし、訓練されたプローブが観測された事象の時間的構造に敏感であることを示す。
関連論文リスト
- TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue [79.83228182492354]
自然な会話の話し手は、話と聞き取りを交互に行い、いつ床をつかむか、保持するか、または譲るかをリアルタイムで決める。
そこで本研究では,30時間の人的会話を手作業でラベル付けしたコーパスを,エンド・オブ・ターンと割り込み検出のための標準評価プロトコルと組み合わせたベンチマークTurnBenchを提案する。
一方、割り込み偽陽性は強く型依存的であり、バックチャネル・デンス相互作用スタイルに集中している。
論文 参考訳(メタデータ) (2026-08-25T23:14:36Z) - Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering [87.43777061308658]
フル音声言語モデル(FDSLM)における予測行動の解析
FDSLMは、モデル出力生成に整合した生成状態と、ユーザ入力に整合した知覚状態の2つの状態間の内部焦点を動的に変調する。
ユーザ中断中は、モデルが知覚状態に遷移する前に生成状態に対して過渡的に偏りを保ち、入力の開始を逃す。
論文 参考訳(メタデータ) (2026-06-09T19:08:07Z) - A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning [10.559333552210434]
アルツハイマー病は認知症の主要な原因であり、記憶、推論、コミュニケーション、日常生活に影響を及ぼす。
近年の研究では、自発音声には認知症に関連する貴重な言語的・音響的バイオマーカーが含まれていることが示されている。
本稿では,言語情報と書き起こし情報をエンドツーエンドのトレーニング可能な方法で共同で活用する,認知症自動検出のためのマルチモーダルディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T07:57:49Z) - SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models [86.19617358080016]
Social Omniは、3つのコア次元にわたる対話性の評価を運用するベンチマークである。
Social Omniは2000の知覚サンプルと209の相互作用生成インスタンスの品質管理された診断セットを備えている。
本分析により,モデルの知覚的精度と,文脈的に適切な割り込みを生成する能力との間に顕著な疎結合が明らかとなった。
論文 参考訳(メタデータ) (2026-03-17T17:58:44Z) - Coherence in the brain unfolds across separable temporal regimes [1.3874648807526748]
言語におけるコヒーレンスには、脳が競合する2つの時間的要求を満たす必要がある。
我々は、コヒーレンスを、文脈統合の遅い解離可能なニューラルレシエーションと、イベント駆動の迅速な再構成によって実現していることを示す。
論文 参考訳(メタデータ) (2025-12-23T16:16:42Z) - PersonaDrift: A Benchmark for Temporal Anomaly Detection in Language-Based Dementia Monitoring [0.9668407688201359]
PersonaDriftは、日々のコミュニケーションの進行的な変化を検出するための機械学習と統計的手法を評価するために設計されたベンチマークである。
このベンチマークは、介護者が特に有能であると強調した2種類の縦方向の変化に焦点を当てている。
予備的な結果は, ベースライン変動率の低いユーザにおいて, 単純な統計モデルを用いて, 平坦感が検出できることを示唆している。
論文 参考訳(メタデータ) (2025-11-20T15:15:00Z) - Nonverbal Interaction Detection [83.40522919429337]
この研究は、社会的文脈における人間の非言語的相互作用を理解するという新たな課題に対処する。
我々はNVIと呼ばれる新しい大規模データセットを寄贈し、人間とそれに対応する社会グループのための境界ボックスを含むように細心の注意を払ってアノテートする。
第2に,非言語的インタラクション検出のための新たなタスクNVI-DETを構築し,画像から三つ子を識別する。
第3に,非言語相互作用検出ハイパーグラフ (NVI-DEHR) を提案する。
論文 参考訳(メタデータ) (2024-07-11T02:14:06Z) - Dynamic Time-Alignment of Dimensional Annotations of Emotion using
Recurrent Neural Networks [9.02236667251654]
本稿では,アノテーション間の不整合を補償し,対応する音響特徴とトレースを同期させる手法を提案する。
その結果,提案手法は,音声特徴量とトレースの相関だけでなく,アノテータ間のアノテータ間のアノテータ合意を著しく向上させることができることがわかった。
論文 参考訳(メタデータ) (2022-09-21T09:38:57Z) - Co-Located Human-Human Interaction Analysis using Nonverbal Cues: A
Survey [71.43956423427397]
本研究の目的は,非言語的キューと計算手法を同定し,効果的な性能を実現することである。
この調査は、最も広い範囲の社会現象と相互作用設定を巻き込むことによって、相手と異なる。
もっともよく使われる非言語キュー、計算方法、相互作用環境、センシングアプローチは、それぞれマイクとカメラを備えた3,4人で構成される会話活動、ベクターマシンのサポート、ミーティングである。
論文 参考訳(メタデータ) (2022-07-20T13:37:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。