論文の概要: Multi-Party Backchannel Prediction: a Diagnosis, a Benchmark, and a Ceiling
- arxiv url: http://arxiv.org/abs/2610.01488v1
- Date: Thu, 01 Oct 2026 11:30:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.076606
- Title: Multi-Party Backchannel Prediction: a Diagnosis, a Benchmark, and a Ceiling
- Title(参考訳): マルチパーティバックチャネル予測:診断,ベンチマーク,シーリング
- Abstract要約: バックチャネル予測は、ほとんどすべてダイアド会話で研究されている。
我々は、AMIコーパスに基づくマルチパーティベンチマークを導入し、171のミーティングから682のマスク付きリスナービュー、190のスピーカー、18,697のバックチャネルイベントを作成した。
最先端のダイアディックモデルは、偶然に録音されたオーディオにゼロショットを適用した(AUROC 0.499)が、それでもその凍結した音響特性は情報的のままである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Backchannel prediction has been studied almost entirely in dyadic conversation. We introduce a multi-party benchmark based on the AMI corpus, comprising 682 masked-listener views from 171 meetings, 190 speakers, and 18,697 backchannel events, with a person-disjoint held-out split. A state-of-the-art dyadic model applied zero-shot to meeting audio performs at chance (AUROC 0.499); nevertheless, its frozen acoustic features remain informative: a linear probe reaches 0.704, and retraining the predictor raises performance to 0.751. Retraining reveals a second limitation. Listener conditioning improves prediction for listeners seen during training but not for unseen listeners, and the gap remains under capacity reduction, listener-adversarial training, per-listener adaptation, and oracle lexical conditioning. Adversarial training removes only part of the speaker-identity information, while stronger removal hurts prediction, suggesting that identity is entangled with cues that are useful for backchanneling. A within-model control helps explain this pattern: with the same features and data splits, turn-onset prediction transfers to unseen listeners, while backchannel prediction does not. Backchannel rates also vary about twice as much across individuals as turn-onset rates. Since backchannels occupy only about 1% of frames, frame-level F1 is strongly affected by the base rate. We therefore report AUROC alongside event-F1 on listener-active regions. We release the benchmark and evaluation tools at https://github.com/HafsatiMohammed/bc_multiparty_release.
- Abstract(参考訳): バックチャネル予測は、ほとんどすべてダイアド会話で研究されている。
我々は、AMIコーパスに基づくマルチパーティベンチマークを導入し、ミーティング171件、スピーカー190件、バックチャネルイベント18,697件から682件のマスク付きリスナービューを作成した。
しかし、その凍結した音響特性は、線形プローブが0.704に達し、予測器を再訓練することでパフォーマンスが0.751に向上する(AUROC 0.499)。
再訓練には2つ目の制限がある。
リスナー条件付けは、トレーニング中に見られるリスナーの予測を改善するが、見知らぬリスナーには当てはまらない。
対人訓練は話者同一性情報の一部を除去するが、強い除去は予測を損なう。
モデル内制御は、同じ機能とデータ分割で、ターンオンセットの予測がリスナに転送されるのに対して、バックチャネルの予測はそうではない、というパターンを説明するのに役立ちます。
バックチャネルレートもターンオンセットレートの約2倍の差がある。
バックチャネルがフレームの約1%を占めるため、フレームレベルF1はベースレートに強く影響を受ける。
そこで我々はAUROCとイベントF1をリスナー活動領域で報告する。
ベンチマークと評価ツールはhttps://github.com/HafsatiMohammed/bc_multiparty_releaseでリリースしています。
関連論文リスト
- Sparse Incident-Cluster Learning for 12-hour Port Flood Pre-warning in Digital-Twin Analytics [9.39026429591892]
ポートフラッドデジタル双生児は、破壊前にオペレーターに警告する分析を必要とする。
公式な警告インシデントは少なく、隣接する観測は時間的に依存している。
インシデントクラスタ学習問題として,12時間の浸水予報を定式化する。
論文 参考訳(メタデータ) (2026-09-05T14:10:09Z) - The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping [70.07961857926377]
3つの制御されたビデオタスクにおけるイベントカウントのためのトレーサグラウンドパラメトリックプロファイリングを導入する。
2,190本のビデオでは,レンダリングを保ちながらイベントカウントNと周波数Fが異なる。
80%の信頼性しきい値において、Gemini 3.6 Flashは、0.5Hzと1.0Hzの12イベントまでの永続的な状態遷移を確実にカウントするが、過渡的点滅イベントに対する信頼性の高い正カウント領域は示さない。
論文 参考訳(メタデータ) (2026-08-06T17:57:06Z) - The Limits of Reference-Free Speech Quality Metrics as Evaluators and Rewards on Modern Text-to-Speech [0.21173245847195934]
我々は、参照なし品質予測器を優先最適化のための報酬信号としてテストする。
我々は、各予測器をペアワイズタスクで評価し、スコアの高いクリップがクリップリスナーの好むクリップかどうかを問う。
1つのクリップが可聴性欠陥を持つ場合、予測者はリスナーと一致する傾向がある。
論文 参考訳(メタデータ) (2026-07-02T14:46:23Z) - A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models [64.68800440221138]
大規模音声言語モデル(LALM)は、様々な音声理解タスクにおいて高いパフォーマンスを達成するが、時間的推論に苦慮する。
メカニスティック解析のために設計された3つの基礎的タスクに対して,1,657問のベンチマークを導入する。
拡張性に対する注意の重み付けを比較すると、音声トークン間での注意の再分配は、音声の注意を増大させるよりも効果的であることがわかった。
論文 参考訳(メタデータ) (2026-06-16T01:57:56Z) - Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering [87.43777061308658]
フル音声言語モデル(FDSLM)における予測行動の解析
FDSLMは、モデル出力生成に整合した生成状態と、ユーザ入力に整合した知覚状態の2つの状態間の内部焦点を動的に変調する。
ユーザ中断中は、モデルが知覚状態に遷移する前に生成状態に対して過渡的に偏りを保ち、入力の開始を逃す。
論文 参考訳(メタデータ) (2026-06-09T19:08:07Z) - DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining [3.3842793760651557]
音声合成モデルはターンテイキングを自然に扱うが、ツールコールや複雑な推論を限定的にサポートする。
本稿では、このギャップを2チャンネルの会話音声における生成前訓練によって狭めるDualTurnを提案する。
このモデルは、両方の話者の将来の音声を自動回帰的に生成し、ラベルなしで暗黙的に会話のダイナミクスを学習し、解釈可能なターンテイク信号を予測するように微調整される。
論文 参考訳(メタデータ) (2026-03-09T10:48:37Z) - Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment [5.380078543698624]
マルチチャンネルオーディオアライメントは、生体音響モニタリング、空間オーディオシステム、音響ローカライゼーションにおいて重要な要件である。
マルチチャンネル音声同期を改善するために,クロスアテンション機構と信頼度重み付けスコアリングを組み合わせた手法を提案する。
提案手法は,BioDCASE 2025 Task 1 チャレンジにおいて,ディープラーニングベースラインの 0.58 に対して,テストデータセットの平均 0.30 MSE で1位となった。
論文 参考訳(メタデータ) (2025-09-21T05:14:06Z) - An Experimental Study on Private Aggregation of Teacher Ensemble
Learning for End-to-End Speech Recognition [51.232523987916636]
差分プライバシー(DP)は、プライバシーデータにノイズのある歪みを課すことで、深層モデルのトレーニングに使用されるユーザー情報を保護するための1つのデータ保護手段である。
本研究では、PATE学習を動的パターン、すなわち音声を扱うように拡張し、音響データの漏洩を避けるために、ASRに関する最初の実験を行う。
論文 参考訳(メタデータ) (2022-10-11T16:55:54Z) - End-to-end contextual asr based on posterior distribution adaptation for
hybrid ctc/attention system [61.148549738631814]
エンドツーエンド(E2E)音声認識アーキテクチャは、従来の音声認識システムのすべてのコンポーネントを単一のモデルに組み立てる。
これはASRシステムを単純化するが、文脈的ASRの欠点を導入している: E2Eモデルは、頻繁な固有名詞を含む発話に対して、より悪い性能を持つ。
本稿では,文脈的単語認識能力を向上させるために,文脈バイアスアテンション(CBA)モジュールをアテンションベースエンコーダデコーダ(AED)モデルに追加することを提案する。
論文 参考訳(メタデータ) (2022-02-18T03:26:02Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。