論文の概要: Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction
- arxiv url: http://arxiv.org/abs/2609.25176v2
- Date: Thu, 24 Sep 2026 12:40:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.308926
- Title: Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction
- Title(参考訳): Qwen-Audio-3.1-Realtime: To Reliable Agentic Voice Interaction
- Abstract要約: 我々は、Think、Act、Speak Coordinateという、ツールの使用、フィードバックの解釈、タスクの完了をモデルに教えるツールを紹介します。
また、Qwen-Audio-3.0-Realtimeを前景として使用し、コーディネーションメモリによる音声対話を永続的なタスクに拡張する、別のVoice Harnessプロトタイプも提示する。
- 参考スコア(独自算出の注目度): 36.155594348195784
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time voice assistants must reason over evolving requests, execute actions, and follow conversational rules. Qwen-Audio-3.1-Realtime brings these requirements together through Think, Act, and Speak and Coordinate. Think combines Core-Cocktail supervised fine-tuning with Multimodality and Multi-Teacher On-Policy Distillation (M$^{2}$-OPD) to transfer language capabilities and develop native audio skills. Act uses self-evolving executable environments and multi-granularity rollouts for Group Relative Policy Optimization (GRPO), teaching the model to use tools, interpret feedback, and complete tasks. Speak and Coordinate aligns whether, when, and how the assistant speaks or acts. We evaluate audio reasoning, multilingual understanding, tool use, conversational behavior, full-duplex interaction, and safety. Compared with Qwen-Audio-3.0-Realtime, 3.1 raises overall task success from 78.4% to 82.0% on our half-duplex speech-to-text adaptation of $τ$-Voice. On speech-to-speech Full-Duplex-Bench v1.5, the response rate to background speech falls from 73.0% to 13.0%. We also present a separate Voice Harness prototype, using Qwen-Audio-3.0-Realtime as its foreground, that extends spoken interaction to persistent tasks through foreground--background coordination and memory.
- Abstract(参考訳): リアルタイム音声アシスタントは、要求の進化を推論し、アクションを実行し、会話ルールに従う必要がある。
Qwen-Audio-3.1-Realtimeはこれらの要件をThink, Act, and Speak and Coordinateを通じてまとめる。
Core-Cocktailによる微調整とMultimodalityとMulti-Teacher On-Policy Distillation(M$^{2}$-OPD)を組み合わせて、言語能力の伝達とネイティブオーディオスキルの開発を行う。
Actは、自己進化可能な環境と、グループ相対ポリシー最適化(GRPO)のための多言語ロールアウトを使用して、ツールの使用、フィードバックの解釈、タスクの完了をモデルに教えている。
Speak and Coordinateは、いつ、いつ、どのようにアシスタントが話すか、どのように振る舞うかを調整します。
音声推論,多言語理解,ツール使用,会話行動,全二重インタラクション,安全性を評価した。
Qwen-Audio-3.0-Realtimeと比較して、3.1はタスク全体の成功率を78.4%から82.0%に引き上げます。
音声合成のFull-Duplex-Bench v1.5では、バックグラウンド音声に対する応答率は73.0%から13.0%に低下する。
また、Qwen-Audio-3.0-Realtimeを前景として使用し、前景の協調と記憶を通じて音声対話を永続的なタスクに拡張する、別のVoice Harnessプロトタイプも提示する。
関連論文リスト
- NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities [51.20614728073928]
NemoLabs VoiceChatは、音声合成ツールのネイティブ機能を備えた、オープンなフル音声モデルである。
ストリーミング音声エンコーダのみの言語モデルと、テキストと構造化関数呼び出しのための並列化された出力ストリームを組み合わせる。
NemoLabs VoiceChatはVoiceBenchの正規化平均55.1、Full-Duplex-Bench 3.0(FDB 3.0)では82.5%のツール選択F1を達成している。
これらの結果から, 音声対話, 音声認識・生成, 汎用言語能力, 外部ツール利用が, 単一のオープン音声に一体化できることが示唆された。
論文 参考訳(メタデータ) (2026-09-18T16:27:22Z) - Realtime-Venus: A full-duplex interaction system with asynchronous delegation [0.0]
音声対話のためのリアルタイム・リアルタイム・オムニ・オーディオ・インタラクションとリアルタイム・オーディオ・スポーケンを提示する。
それぞれのモデルは完全な会話として機能し、連続認識、会話制御、およびネイティブ音声生成を統合する。
論文 参考訳(メタデータ) (2026-09-12T08:56:50Z) - Qwen3.5-Omni Technical Report [0.0]
Qwen3.5- Omniは数十億のパラメータにスケールし、256kのコンテキスト長をサポートする。
Qwen3.5-Omniは、215のオーディオとオーディオの視覚的理解、推論、インタラクションのサブタスクとベンチマークで結果を得る。
ARIAはテキストと音声ユニットを動的に調整し、会話音声の安定性と韻律を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-17T08:05:46Z) - Raon-Speech Technical Report [30.64663808404463]
Raon-SpeechChatは、リアルタイムおよび合成対話データに対する連続的なトレーニングにより、自然なフル中心会話を可能にする。
Raon-SpeechChatは高度に訓練された英語と韓国語の音声とテキストのパイプラインを1.38M時間で運行している。
論文 参考訳(メタデータ) (2026-04-08T23:43:46Z) - Fun-Audio-Chat Technical Report [71.07966678560291]
音声トークン(25Hz)とテキストトークン(3Hz)の間の時間分解能は意味情報のミスマッチを緩和し、高い計算コストを発生させる。
本稿では,大規模な音声合成タスクであるFun-Audio-Chatを紹介する。
Fun-Audio-Chat 8BとMoE 30BA3Bは、SpeechTextとSpeech-to-scaleタスクの競合性能を達成する。
論文 参考訳(メタデータ) (2025-12-23T08:35:27Z) - MultiVox: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions [70.93364531054273]
音声と視覚を融合させる音声アシスタントの能力を評価する最初のベンチマークであるMultiVoxを紹介する。
具体的には、MultiVoxには、多種多様なパラ言語的特徴を包含する1000の人間の注釈付き音声対話が含まれている。
10の最先端モデルに対する我々の評価は、人間はこれらのタスクに長けているが、現在のモデルは、常に文脈的に接地された応答を生成するのに苦労していることを示している。
論文 参考訳(メタデータ) (2025-07-14T23:20:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。