論文の概要: VoCa: Designing Speech-Canvas Interaction for Voice-Based Conversational Agents
- arxiv url: http://arxiv.org/abs/2610.04706v1
- Date: Sat, 03 Oct 2026 18:39:31 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:03:24.603155
- Title: VoCa: Designing Speech-Canvas Interaction for Voice-Based Conversational Agents
- Title(参考訳): VoCa:音声対話エージェントのための音声キャンバスインタラクションの設計
- Abstract要約: 人々は、コンテンツを一緒に説明し、整理し、開発するために話しながら書き、スケッチします。
これらの実践にインスパイアされた音声エージェントは,ユーザとのマルチターン会話において,音声と同時にキャンバスを利用できるかを検討する。
音声エージェントであるVoCaを開発した。
- 参考スコア(独自算出の注目度): 10.487246058633538
- License:
- Abstract: People write and sketch while speaking to explain, organize, and develop content together. Inspired by these practices, we investigate how voice agents can use a canvas alongside speech in multi-turn conversations with users. We conducted a two-part formative study: an observational study of how pairs coordinated speech and boardwork, followed by a design workshop that informed a design space for speech-canvas interaction with voice agents. Building on these insights, we developed VoCa, a voice agent that coordinates speech with visual object creation, annotation, and attention guidance. A five-day deployment with 18 participants examined usability, experiences of speech-canvas interaction, patterns of use, and desired improvements. Participants' experiences highlighted opportunities for speech-canvas interaction in learning, work, and daily life, alongside challenges in coordinating what agents say and show in ways users can follow and influence. These findings inform how voice agents can use a canvas alongside speech in conversation.
- Abstract(参考訳): 人々は、コンテンツを一緒に説明し、整理し、開発するために話しながら書き、スケッチします。
これらの実践にインスパイアされた音声エージェントは,ユーザとのマルチターン会話において,音声と同時にキャンバスを利用できるかを検討する。
音声エージェントと音声キャンバスの相互作用を設計空間に通知するデザインワークショップで,ペアが音声とボードワークをどのように協調するかの観察的研究を行った。
これらの知見に基づいて,視覚的オブジェクト生成,アノテーション,注意誘導と音声を協調する音声エージェントVoCaを開発した。
18人の参加者による5日間のデプロイメントでは、ユーザビリティ、会話とキャンバスのインタラクションの経験、使用パターン、望ましい改善が検討された。
参加者の経験は、学習、仕事、日常生活における言語とキャンバスの相互作用の機会を強調し、エージェントの発言を調整し、ユーザーがフォローし、影響を及ぼす方法を示すことの課題を強調した。
これらの知見は、会話において、音声エージェントが会話と並行してキャンバスを利用できることを示す。
関連論文リスト
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation [72.46711449668814]
本稿では,対話型顔と会話型音声の両方を同期的に生成する統合フレームワークであるTAVIDを紹介する。
本システムの評価は, 顔のリアリズム, 頭部の応答性, ダイアディック相互作用, 音声品質の4つの側面にまたがる。
論文 参考訳(メタデータ) (2025-12-23T12:04:23Z) - MultiVox: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions [70.93364531054273]
音声と視覚を融合させる音声アシスタントの能力を評価する最初のベンチマークであるMultiVoxを紹介する。
具体的には、MultiVoxには、多種多様なパラ言語的特徴を包含する1000の人間の注釈付き音声対話が含まれている。
10の最先端モデルに対する我々の評価は、人間はこれらのタスクに長けているが、現在のモデルは、常に文脈的に接地された応答を生成するのに苦労していることを示している。
論文 参考訳(メタデータ) (2025-07-14T23:20:42Z) - Towards Developmentally Plausible Rewards: Communicative Success as a Learning Signal for Interactive Language Models [49.22720751953838]
本研究では,子どもの言語習得に触発された対話型環境で言語モデルを訓練する手法を提案する。
この設定では、話者は1ターンの対話でリスナーに何らかの情報を伝達しようと試み、コミュニケーションの成功が達成されれば報酬を受け取る。
論文 参考訳(メタデータ) (2025-05-09T11:48:36Z) - ConvoFusion: Multi-Modal Conversational Diffusion for Co-Speech Gesture Synthesis [50.69464138626748]
マルチモーダルなジェスチャー合成のための拡散に基づくアプローチであるConvoFusionを提案する。
提案手法は,条件の異なる条件が与える影響をユーザが調節できる2つの誘導目標を提案する。
本手法は,モノログジェスチャを生成するか,会話ジェスチャを生成するかの訓練が可能である。
論文 参考訳(メタデータ) (2024-03-26T17:59:52Z) - Interactive Conversational Head Generation [68.76774230274076]
対面会話における1つのインターロケータの振る舞いを合成するための新しい対話ヘッド生成ベンチマークを提案する。
長時間・複数回会話に参加可能なインターロカクタを自動的に合成する機能は不可欠であり、様々なアプリケーションにメリットを提供する。
論文 参考訳(メタデータ) (2023-07-05T08:06:26Z) - Visual-Aware Text-to-Speech [101.89332968344102]
テキスト入力と対面コミュニケーションにおけるリスナーの視覚的フィードバックの両方で条件付き音声を合成する新しい視覚認識型音声合成(VA-TTS)タスクを提案する。
音声合成のための音素言語情報とリスナー視覚信号を融合するベースラインモデルを提案する。
論文 参考訳(メタデータ) (2023-06-21T05:11:39Z) - Speaking the Language of Your Listener: Audience-Aware Adaptation via
Plug-and-Play Theory of Mind [4.052000839878213]
我々は、より限られた視覚的・言語的経験を持つ、知識のある話者と聞き手の間の視覚的接地型参照ゲームをモデル化する。
我々は,提案する話者に対して,聴取者の視点から予測された発話の有効性をモニタするシミュレーションモジュールを用いて,参照表現を適応する能力を与える。
論文 参考訳(メタデータ) (2023-05-31T15:17:28Z) - Joining the Conversation: Towards Language Acquisition for Ad Hoc Team
Play [1.370633147306388]
本稿では,アドホックチームプレイ問題の特定の形態として,協調言語獲得の問題を提案し,考察する。
本稿では, 話者の意図と聞き手の意味を, 言語利用者チーム間のコミュニケーションの観察から推定する確率論的モデルを提案する。
論文 参考訳(メタデータ) (2023-05-20T16:59:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。