論文の概要: A frontend-backend architecture for tool calls in full-duplex speech models
- arxiv url: http://arxiv.org/abs/2609.19334v2
- Date: Fri, 18 Sep 2026 21:59:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.079567
- Title: A frontend-backend architecture for tool calls in full-duplex speech models
- Title(参考訳): 全二重音声モデルにおけるツールコールのためのフロントエンドバックエンドアーキテクチャ
- Abstract要約: フル音声テキスト(S2S)は、強力なエージェントツールコール機能と自然な二重音声インタラクションを実現する。
バックエンドデリゲーションは、自然な二重言語相互作用と強力なエージェントツールコール機能を組み合わせるための効果的でモジュラーなアプローチである。
バックエンドデリゲートはGPT-realtime-miniとQwenwen3-Omni-30B-A3B-Instruct on EVA-Benchを大きく上回る。
- 参考スコア(独自算出の注目度): 29.940627571433392
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Full-duplex speech-to-speech (S2S) models provide natural, low-latency conversational interaction and would benefit from the ability to use external tools and complete voice-agent tasks. We propose a frontend-backend architecture where a duplex speech-to-text frontend learns to emit a delegation token and forwards streaming ASR transcripts to a text-based backend LLM for tool calls. Tool-call results from the backend are injected back into the frontend through a lightweight prefill-and-repeat mechanism and then synthesized using streaming TTS to the user. Our approach largely preserves regular duplex turn-taking, interruption handling, and low-latency interaction as it requires minimal modifications to the frontend model. In a single-turn tool-call evaluation, our system achieves 92-97% tool-call recall, competitive tool-call prediction performance, and 81.2% accuracy in rejecting irrelevant calls. When equipped with a larger backend (e.g., Qwen3-235B-A22B), our system achieves competitive results on Full-Duplex-Bench-V3 compared to open and closed source models, and significantly outperforms GPT-realtime-mini and Qwen3-Omni-30B-A3B-Instruct on EVA-Bench. These results demonstrate that backend delegation is an effective and modular approach for combining natural duplex speech interaction with strong agentic tool-call capabilities.
- Abstract(参考訳): フル二重音声合成(S2S)モデルは、自然な低レイテンシな会話インタラクションを提供し、外部ツールの使用や音声エージェントタスクの完全化の恩恵を受ける。
本稿では,両言語間フロントエンドがデリゲートトークンの発行を学習し,テキストベースのバックエンド LLM に ASR の書き起こしを転送するフロントエンドバックエンドアーキテクチャを提案する。
バックエンドからのツールコールの結果は、軽量のプリフィル・アンド・リピート機構を通じてフロントエンドに注入され、ユーザへのストリーミングTSを使用して合成される。
我々のアプローチは、フロントエンドモデルに最小限の変更を必要とするため、通常の二重化処理、割り込み処理、低レイテンシ相互作用を主に維持する。
単ターンツールコール評価では、92-97%のツールコールリコール、競合ツールコール予測性能、81.2%の精度で無関係な呼び出しを拒否する。
より大型のバックエンド(例えばQwen3-235B-A22B)を備えると、オープンおよびクローズドソースモデルと比較してフルDuplex-Bench-V3の競合結果が得られ、EVA-BenchではGPT-realtime-miniとQwen3-Omni-30B-A3B-Instructを大きく上回っている。
これらの結果から、バックエンドデリゲートは、自然な二重言語相互作用と強力なエージェントツールコール機能を組み合わせるための効果的でモジュラーなアプローチであることが示された。
関連論文リスト
- Enabling Streaming User Transcription in Full-Duplex Speech-to-Speech Models [54.83270723528963]
本稿では,既存のS2Sモデルにストリーミング機能を追加する手法を提案する。
我々のアプローチでは、最小限の追加パラメータが必要であり、ベースS2Sモデルに大きな変更はない。
論文 参考訳(メタデータ) (2026-09-14T15:44:18Z) - Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling [64.40340291543971]
我々は,小さなエッジスケールモデルとのリアルタイムインタラクションを実現するための投機的インタラクションエージェントを提案する。
また、ストリーミング入力と非同期応答を処理するためにモデルを適応させるクロックベースのトレーニング手法を提案する。
このアプローチは、Qwen2.5-3B-InstructとLlama-3.2-3B-Instructモデルを複数のツール呼び出しベンチマークで1.6-2.2$times$ Speedupを提供する。
論文 参考訳(メタデータ) (2026-05-13T11:20:52Z) - Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use [1.851890212523342]
本稿では,スマートカー,スマートホーム,ウェアラブルの3つの主要領域にわたるSpeechLMのツールコール機能を評価するためのAudio2Toolを紹介する。
我々のベンチマークでは、単純な直接コマンドから複雑なマルチインテントやニードル・イン・ア・ヘイスタック抽出から、独立した障害モードまで、多層的な複雑性階層が特徴的である。
現状のSpeechLMとASR-LLMパイプラインの評価は、単純なコマンドでは高い性能を示すが、構成的および音響的課題では著しく低下する。
論文 参考訳(メタデータ) (2026-04-17T16:41:25Z) - MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models [62.05118198431989]
非同期のフル音声モデルは、AI停止のフルタイムの対話性と自然な性質によって区別される。
本フレームワークは,外部情報における知識要求型対話クエリと接地応答の同定を可能にする。
本設計では,再学習を伴わないプラグ・アンド・プレイ検索手法をサポートし,アウト・オブ・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー
論文 参考訳(メタデータ) (2026-04-14T16:17:52Z) - UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents [22.52508596251479]
構築とデータセット生成から評価に至るまで,パイプライン全体を標準化するツール学習用統合フレームワークであるUniToolCallを提案する。
我々は、7つの公開ベンチマークを、関数呼び出し、ターン、会話のレベルできめ細かい評価を施した、クエリ-Action--Observation-Answer (QAOA) 表現に変換する。
Anchoror-Heavy Hybrid-20では、1ターンのStrict Precisionを93.0%達成し、GPT、Gemini、Claudeといった商用モデルを上回っている。
論文 参考訳(メタデータ) (2026-04-13T14:43:47Z) - Close the Loop: Synthesizing Infinite Tool-Use Data via Multi-Agent Role-Playing [16.839489120513505]
InfToolは3つの協調エージェントを編成し、単一のターン呼び出しから複雑なマルチステップのゲートコールにまたがる多様な検証されたトラジェクトリを生成する。
InfToolは、ベース32Bモデルを19.8%から70.9%の精度(+258%)に変換し、Claude-Opusより10倍大きく、競合するClaude-Opusを上回ります。
論文 参考訳(メタデータ) (2025-12-29T17:12:39Z) - Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage [66.67531241554546]
従来のASR-LLM-TTSパイプラインに代わる強力な対話システムとして、エンドツーエンドの音声対話システムが登場している。
本稿では,音声入力システムに直接ツールの使用を拡張するための最初のアプローチを紹介する。
提案するStreaming Retrieval-Augmented Generation (Streaming RAG) は,ユーザ音声と並行してツールクエリを予測することにより,ユーザ知覚のレイテンシを低減する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T14:18:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。