論文の概要: Jarvis: A Proactive Speech Agent for Multi-Party Conversations
- arxiv url: http://arxiv.org/abs/2610.07506v1
- Date: Mon, 05 Oct 2026 23:18:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.704005
- Title: Jarvis: A Proactive Speech Agent for Multi-Party Conversations
- Title(参考訳): Jarvis: 多人数会話のためのプロアクティブ音声エージェント
- Abstract要約: マルチパーティ・ヒューマン・会話に参加するリアルタイム・プロアクティブ・スピーチ・エージェントであるJarvisを紹介した。
前もって共有された文書の中で、ジャーヴィスは議論を続行し、グループが事実を見逃したり誤ったりした場合に介入する。
CHI-180-proactiveでは、Jarvisは対処するほとんどのイベントで正しく、グループが問題そのものを解決した時間の97%を沈黙している。
- 参考スコア(独自算出の注目度): 40.976959225848226
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speech agents are reactive and dyadic: they speak when spoken to, and to one person at a time. We ask what it takes for a speech agent to instead take part in a conversation among several people and speak up only when it can help. We introduce Jarvis, a real-time proactive speech agent that audibly participates in multi-party human conversations. Grounded in a document shared beforehand, Jarvis follows the discussion and intervenes when the group misses or misstates a fact and does not correct itself within a few turns. We make three contributions: a problem setting based on epistemic breakdowns that makes proactive intervention measurable, realized as CHI-180-proactive, a synthetic multi-party dataset seeded with known gaps, errors, and self-corrections; a proactive backbone that harnesses a small, open-weight model with deterministic checks and grounds every claim in a source sentence; and interaction techniques for taking the floor in live speech and showing the cited evidence on screen. On CHI-180-proactive, Jarvis is correct on most events it addresses and stays silent 97% of the time when the group resolves an issue itself. A live study with 23 participants confirms these trends with real-time interventions.
- Abstract(参考訳): 音声エージェントは反応し、ダイアディックで、話しかけると話し、一度に一人の人に話しかける。
我々は、スピーチエージェントが、何人かの会話に参加し、いつ助けられるかのみ話すのに何が必要かを尋ねる。
マルチパーティ・ヒューマン・会話に参加するリアルタイム・プロアクティブ・スピーチ・エージェントであるJarvisを紹介した。
前もって共有された文書の中で、ジャーヴィスは議論を続行し、グループが事実を見逃したり誤解させたりした場合に介入し、数回以内に自身を修正しない。
筆者らは, 積極的介入を計測可能とし, CHI-180-proactiveとして実現し, 既知のギャップ, エラー, 自己補正でシードされた合成多因子データセット, 原文中のすべての主張を決定論的に検証し, 根拠をスクリーン上に表示するための対話技術, という3つの課題に貢献する。
CHI-180-proactiveでは、Jarvisが対処するほとんどのイベントが正しく、グループが問題そのものを解決したときの97%は沈黙している。
23人の参加者によるライブ研究は、これらの傾向をリアルタイムな介入で確認している。
関連論文リスト
- MP-Bench: Evaluating Voice Agents as a Multiparty Conversation Participant [138.90198190949545]
MP-Benchは,対話型音声システムに対して,マルチパーティ・コンテクスト内でのアクティブな参加者としての評価を目的とした,最初のベンチマークである。
MP-Benchは、ターンテイキングの認識と応答の適切性という2つの主要な側面に沿ってエージェントの振る舞いを評価する。
リアルタイム音声エージェントは、マルチパーティの理解において22%以下にとどまり、マルチパーティのターンテイクにおいてほぼチャンスであることがわかった。
論文 参考訳(メタデータ) (2026-09-11T17:11:55Z) - TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue [79.83228182492354]
自然な会話の話し手は、話と聞き取りを交互に行い、いつ床をつかむか、保持するか、または譲るかをリアルタイムで決める。
そこで本研究では,30時間の人的会話を手作業でラベル付けしたコーパスを,エンド・オブ・ターンと割り込み検出のための標準評価プロトコルと組み合わせたベンチマークTurnBenchを提案する。
一方、割り込み偽陽性は強く型依存的であり、バックチャネル・デンス相互作用スタイルに集中している。
論文 参考訳(メタデータ) (2026-08-25T23:14:36Z) - Can You Say This for Me? Speaking Up by Proxy in Co-Located Discussion [13.697635046606047]
我々は、仮想プロキシを具体化して話すことができる混合現実システムSecondVoiceを提案する。
プライベートオーバーレイを使用して、ユーザは構造化された仕様プロセスを通じてインテントを指定する。
We compare the complete SecondVoice system with an anonymous text-board channel across two group discussion task。
論文 参考訳(メタデータ) (2026-08-22T11:54:37Z) - Adaptive Turn-Taking for Real-time Multi-Party Voice Agents [4.515705397557082]
マルチパーティ設定において、明示的に割り当てられたロールにターンテイク動作を条件付けるロールプレイング音声エージェントであるModerratorLMを提案する。
RolePlayConvは,多様なアシスタント機能を備えた音声多人数会話の大規模合成データセットである。
論文 参考訳(メタデータ) (2026-06-11T16:27:45Z) - Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue [5.0464110997545415]
既存の音声AIアシスタントは、検出されたすべての一時停止を、話す招待状として扱う。
AIアシスタントが複数のスピーカーと一緒に参加するマルチパーティ設定では、一時停止は豊富であいまいである。
我々はコンテキスト対応のターンテイクを定式化し、検出されたすべての一時停止において、会話の全コンテキストを考慮し、我々のメソッドは、アシスタントが話すべきか、沈黙し続けるべきかを判断する。
論文 参考訳(メタデータ) (2026-03-12T00:44:20Z) - Proactive Hearing Assistants that Isolate Egocentric Conversations [9.444316926459196]
装着者の会話相手を自動的に識別・分離する能動的補聴器を導入する。
本システムは,エゴセントリックな音声で動作し,装着者の自発音声をアンカーとして利用する。
我々の研究は、会話のダイナミクスやエンゲージメントに積極的に適応する補聴器への一歩である。
論文 参考訳(メタデータ) (2025-11-14T16:44:48Z) - SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents [72.79816494079833]
ロールプレイングエージェントは、パーソナライズされた相互作用と感情共鳴を達成するための有望なパラダイムとして登場した。
既存の研究は主にテキストのモダリティに焦点を当て、現実的な対話的なシナリオにおける音声の重要な次元を無視している。
我々は,98の多様な役割と112kの音声ベースの1ターン・マルチターン会話からなる大規模かつ高品質なデータセットであるSpeechRole-Dataを構築した。
論文 参考訳(メタデータ) (2025-08-04T03:18:36Z) - NewsDialogues: Towards Proactive News Grounded Conversation [72.10055780635625]
本稿では,対話システムがニュースの重要な話題に基づいて会話を積極的にリードする新しいタスク,Proactive News Grounded Conversationを提案する。
この課題をさらに発展させるために、人間と人間の対話データセットtsNewsDialoguesを収集し、合計14.6Kの発話を含む1Kの会話を含む。
論文 参考訳(メタデータ) (2023-08-12T08:33:42Z) - Who Responded to Whom: The Joint Effects of Latent Topics and Discourse
in Conversation Structure [53.77234444565652]
会話談話における応答関係を同定し,会話の開始に応答発話をリンクする。
単語分布における潜在トピックと会話を学習し,ペアワイズ開始応答リンクを予測するモデルを提案する。
英語と中国語の会話における実験結果から,我々のモデルは過去の芸術の状況を大きく上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T17:46:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。