論文の概要: Can You Say This for Me? Speaking Up by Proxy in Co-Located Discussion
- arxiv url: http://arxiv.org/abs/2608.26185v1
- Date: Sat, 22 Aug 2026 11:54:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.110292
- Title: Can You Say This for Me? Speaking Up by Proxy in Co-Located Discussion
- Title(参考訳): 自分に言えることってあるの? プロキシで話そう
- Authors: Yue Shen, Rehema Abulikemu, Ryan P. McMahan, Yan Chen,
- Abstract要約: 我々は、仮想プロキシを具体化して話すことができる混合現実システムSecondVoiceを提案する。
プライベートオーバーレイを使用して、ユーザは構造化された仕様プロセスを通じてインテントを指定する。
We compare the complete SecondVoice system with an anonymous text-board channel across two group discussion task。
- 参考スコア(独自算出の注目度): 13.697635046606047
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Equal participation in co-located discussion is important for effective collaboration, yet people often hold back when they anticipate negative interpersonal or professional consequences, especially when raising a point requires voicing it themselves. We present SecondVoice, a mixed-reality system that enables people to speak up through an embodied virtual proxy. By separating what is said from who says it, SecondVoice brings hesitant points into the live spoken discussion without putting the speaker on the spot. Using a private overlay, users specify their intent through a structured specification process rather than composing a full utterance. The system reformulates the input and voices it into the conversation through the proxy. We characterize a design space of participation channels under social risk. In a preliminary within-subject study (N = 16), we compare the complete SecondVoice system with an anonymous text-board channel across two group discussion tasks. Half of participants reported using SecondVoice for a point they did not say aloud, compared with 18.8% for the text board. Proxy-delivered points entered the spoken floor and were followed by multi-turn group engagement, which we did not observe after text-board posts. Participants described the channel as situationally valuable but identified tradeoffs around timing, ownership, and trust in reformulation.
- Abstract(参考訳): 効果的なコラボレーションには、同じ場所の議論に参加することが重要ですが、ネガティブな対人関係や専門的な成果を期待する場合、特にポイントを上げるには、自分たちで声を上げる必要があります。
我々は、仮想プロキシを具体化して話すことができる混合現実システムSecondVoiceを提案する。
誰がそのことを言ったのかを分けることで、SecondVoiceは、スピーカーをその場に置かずに、生の話し言葉の議論に注意を向ける。
ユーザはプライベートオーバーレイを使用して、完全な発話を構成するのではなく、構造化された仕様プロセスを通じて意図を指定する。
システムは入力を再構成し、プロキシを通じて会話に音声を流す。
社会的リスク下での参加チャネルのデザイン空間を特徴付ける。
予備研究(N = 16)では,2つのグループディスカッション課題にまたがって,SecondVoiceシステムと匿名のテキストボードチャネルを比較した。
回答者の半数が「SecondVoice」を、テキストボードでは「18.8%」と回答していない点で使用したと報告している。
テキスト掲示板の投稿後に観察しなかった多ターングループエンゲージメントで, 発声床にプロキシ提供点が入り込み, 後続の多ターングループエンゲージメントが認められた。
参加者は、チャンネルを状況的に価値あるものと表現したが、タイミング、所有権、改革に対する信頼に関するトレードオフを特定できた。
関連論文リスト
- From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios [68.14493981116665]
人間は、近くの会話から競合するスピーチをフィルタリングしながら、個々の話者に選択的に出席する能力を持つ。
この「カクテルパーティー」のシナリオは、音声認識システムに深刻な課題を呈している。
CHiME-9 MCoRecタスクは、システムが話者のグループを認識し、各会話を音声視覚入力から書き起こさなければならないテストベッドを提供する。
論文 参考訳(メタデータ) (2026-08-09T06:11:38Z) - Adaptive Turn-Taking for Real-time Multi-Party Voice Agents [4.515705397557082]
マルチパーティ設定において、明示的に割り当てられたロールにターンテイク動作を条件付けるロールプレイング音声エージェントであるModerratorLMを提案する。
RolePlayConvは,多様なアシスタント機能を備えた音声多人数会話の大規模合成データセットである。
論文 参考訳(メタデータ) (2026-06-11T16:27:45Z) - From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction [25.529747060487363]
SpeechLLMsは音声から直接音声言語を処理するが、アクセントと声のアイデンティティーの手がかりはバイアスのある振る舞いにつながる可能性がある。
我々は,コヒーレントアウトプットにおけるコンテンツレベルのバイアスとサービス品質の格差を区別し,アクセントと知覚的性別の交叉効果を検討した。
論文 参考訳(メタデータ) (2026-03-19T21:12:49Z) - Moshi: a speech-text foundation model for real-time dialogue [78.88479749811376]
現在の音声対話システムは、パイプラインの独立した音声活動検出と音声合成に依存している。
そこで本研究では,Moshi Moshiが音声認識と音声合成を実現する方法を紹介する。
得られたモデルは、初めてリアルタイムな全音声大言語モデルモダリティである。
論文 参考訳(メタデータ) (2024-09-17T17:55:39Z) - Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System [73.34663391495616]
本稿では,複数話者と目標話者の音声認識タスクを併用する先駆的手法を提案する。
具体的には、Whisperを凍結し、Sidecarセパレータをエンコーダに差し込み、複数の話者に対する混合埋め込みを分離する。
AishellMix Mandarin データセット上で,マルチストーカー ASR 上で許容できるゼロショット性能を提供する。
論文 参考訳(メタデータ) (2024-07-13T09:28:24Z) - A Benchmark for Multi-speaker Anonymization [9.990701310620368]
本稿では,マルチ話者匿名化ベンチマークを提案する。
また、重複する会話のプライバシー漏洩についても論じる。
非オーバーラップシミュレーションと実世界のデータセットによる実験は、マルチスピーカー匿名化システムの有効性を実証している。
論文 参考訳(メタデータ) (2024-07-08T04:48:43Z) - Interactive Conversational Head Generation [68.76774230274076]
対面会話における1つのインターロケータの振る舞いを合成するための新しい対話ヘッド生成ベンチマークを提案する。
長時間・複数回会話に参加可能なインターロカクタを自動的に合成する機能は不可欠であり、様々なアプリケーションにメリットを提供する。
論文 参考訳(メタデータ) (2023-07-05T08:06:26Z) - Question-Interlocutor Scope Realized Graph Modeling over Key Utterances
for Dialogue Reading Comprehension [61.55950233402972]
本稿では,対話読解のためのキーワード抽出手法を提案する。
複数の連続した発話によって形成された単位に対して予測を行い、より多くの回答を含む発話を実現する。
発話のテキスト上に構築されたグラフとして,質問-対話者スコープ実現グラフ(QuISG)モデルを提案する。
論文 参考訳(メタデータ) (2022-10-26T04:00:42Z) - Intelligent Conversational Android ERICA Applied to Attentive Listening
and Job Interview [41.789773897391605]
我々はインテリジェントな会話型android ericaを開発した。
ERICAには,注意深い聞き取り,就職面接,スピードデートなど,いくつかのソーシャルインタラクションタスクを設定した。
40人の高齢者が会話を分解することなく5~7分間の会話を行ったことが評価されている。
論文 参考訳(メタデータ) (2021-05-02T06:37:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。