論文の概要: A Voice-Interactive Multi-Agent System for Smart Operating Rooms: Architecture Design and Key Technologies
- arxiv url: http://arxiv.org/abs/2609.11231v2
- Date: Mon, 14 Sep 2026 03:32:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.930321
- Title: A Voice-Interactive Multi-Agent System for Smart Operating Rooms: Architecture Design and Key Technologies
- Title(参考訳): スマートオペレーティングルームのための音声対話型マルチエージェントシステム:アーキテクチャ設計とキーテクノロジー
- Abstract要約: SurgeryRoomAgentは、大言語モデル(LLM)に基づくスマートオペレーティングルームのための音声対話型マルチエージェントシステムである
システムは音声対話パイプラインを通じて自然言語理解、デバイス制御、術中記録、手術報告生成を実現する。
- 参考スコア(独自算出の注目度): 0.2538209532048867
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents SurgicalRoomAgent, a voice-interactive multi-agent system for smart operating rooms based on large language models (LLMs). The system achieves natural language understanding, device control, intraoperative recording, and surgical report generation through a layered architecture comprising a voice interaction pipeline (wake, ASR, turn detection, agent reasoning, TTS) and an agent core (skill registry, task planner, device manager). Three key technologies are investigated: (1) KV Cache prefix warming for low-latency inference, reducing recomputation overhead from approximately 500 ms to tens of milliseconds via byte-level Longest Common Prefix reuse; (2) streaming partial JSON parsing with early parallel task execution, reducing end-to-end latency by approximately 30%; and (3) progressive skill prompt disclosure, which dynamically filters system prompts based on user role, connected devices, and surgical phase to maximize information density within limited context windows. The system is implemented using the Qwen3-27B model with llama.cpp/sglang inference engines. Experimental analysis demonstrates effective operation within a 16,384-token context limit and multi-device parallel control response times meeting OR real-time requirements.
- Abstract(参考訳): 本稿では,大規模言語モデル(LLM)に基づくスマート手術室のための音声対話型マルチエージェントシステムであるStudioRoomAgentを提案する。
本システムは、音声対話パイプライン(ウェイク、ASR、ターン検出、エージェント推論、TS)とエージェントコア(スキルレジストリ、タスクプランナ、デバイスマネージャ)からなる階層アーキテクチャにより、自然言語理解、デバイス制御、術中記録、および手術報告生成を実現する。
1) 低レイテンシ推論のためのKVキャッシュ前処理,約500ミリ秒から数十ミリ秒までの再計算オーバーヘッドの削減,2) 並列タスク実行による部分JSON解析のストリーミング,エンドツーエンドのレイテンシの約30%削減,3) ユーザロール,接続デバイス,および限られたコンテキストウィンドウ内の情報密度を最大化するためにシステムに動的にプロンプトするプロンプトプロンプト公開,の3つの主要な技術について検討した。
このシステムはQwen3-27Bモデルとllama.cpp/sglang推論エンジンを使って実装されている。
実時間要求を満たす16,384のコンテキスト制限とマルチデバイス並列制御応答時間内で有効動作を示す実験的検討を行った。
関連論文リスト
- Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling [64.40340291543971]
我々は,小さなエッジスケールモデルとのリアルタイムインタラクションを実現するための投機的インタラクションエージェントを提案する。
また、ストリーミング入力と非同期応答を処理するためにモデルを適応させるクロックベースのトレーニング手法を提案する。
このアプローチは、Qwen2.5-3B-InstructとLlama-3.2-3B-Instructモデルを複数のツール呼び出しベンチマークで1.6-2.2$times$ Speedupを提供する。
論文 参考訳(メタデータ) (2026-05-13T11:20:52Z) - Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use [1.851890212523342]
本稿では,スマートカー,スマートホーム,ウェアラブルの3つの主要領域にわたるSpeechLMのツールコール機能を評価するためのAudio2Toolを紹介する。
我々のベンチマークでは、単純な直接コマンドから複雑なマルチインテントやニードル・イン・ア・ヘイスタック抽出から、独立した障害モードまで、多層的な複雑性階層が特徴的である。
現状のSpeechLMとASR-LLMパイプラインの評価は、単純なコマンドでは高い性能を示すが、構成的および音響的課題では著しく低下する。
論文 参考訳(メタデータ) (2026-04-17T16:41:25Z) - AgentCgroup: Understanding and Controlling OS Resources of AI Agents [2.8139711959925244]
AIエージェントは、サンドボックスコンテナ内でさまざまなツールコールを実行するマルチテナントクラウド環境にますますデプロイされている。
サンドボックス型AI符号化エージェントにおけるOSレベルの資源動態の系統的特徴について述べる。
予備評価は, マルチテナント分離の改善と資源廃棄物の削減を実証する。
論文 参考訳(メタデータ) (2026-02-10T02:37:42Z) - LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning [27.13598270494417]
LTS-VoiceAgent は Listen-Think-Speak フレームワークである。
意味のある接頭辞を検出するDynamic Semantic Triggerと、背景のThinkerと前景のスピーカーをコーディネートするDual-Role Stream Orchestratorを備えている。
論文 参考訳(メタデータ) (2026-01-26T15:42:35Z) - Qwen3-TTS Technical Report [64.94647392030824]
本稿では,Qwen3-TTSシリーズについて述べる。
Qwen3-TTSは最先端の3秒間音声クローニングと記述ベースの制御をサポートする。
Qwen3-TTSは、2つの音声トークンとともに、リアルタイム合成のためのデュアルトラックLMアーキテクチャを採用している。
論文 参考訳(メタデータ) (2026-01-22T03:51:43Z) - AsyncVoice Agent: Real-Time Explanation for LLM Planning and Reasoning [27.522862635055077]
非同期アーキテクチャが会話音声からストリーミングバックエンドを分離するシステムであるAsyncVoice Agentを提案する。
この設計により、ナレーションと推論が並列に実行され、ユーザーはモデルの推論プロセスを中断し、クエリし、管理することができる。
客観的ベンチマークでは、このアプローチはモノリシックなベースラインに比べて600倍以上のレイテンシを削減している。
論文 参考訳(メタデータ) (2025-10-17T19:00:08Z) - Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage [66.67531241554546]
従来のASR-LLM-TTSパイプラインに代わる強力な対話システムとして、エンドツーエンドの音声対話システムが登場している。
本稿では,音声入力システムに直接ツールの使用を拡張するための最初のアプローチを紹介する。
提案するStreaming Retrieval-Augmented Generation (Streaming RAG) は,ユーザ音声と並行してツールクエリを予測することにより,ユーザ知覚のレイテンシを低減する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T14:18:20Z) - InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions [104.90258030688256]
本研究は,ストリーミング映像とオーディオ入力とのリアルタイムインタラクションを実現するために,非絡み合いのストリーミング知覚,推論,メモリ機構を導入している。
このプロジェクトは人間のような認知をシミュレートし、多モーダルな大規模言語モデルが時間とともに継続的かつ適応的なサービスを提供できるようにする。
論文 参考訳(メタデータ) (2024-12-12T18:58:30Z) - Asynchronous Tool Usage for Real-Time Agents [61.3041983544042]
並列処理とリアルタイムツール利用が可能な非同期AIエージェントを導入する。
私たちの重要な貢献は、エージェントの実行とプロンプトのためのイベント駆動有限状態マシンアーキテクチャです。
この研究は、流体とマルチタスクの相互作用が可能なAIエージェントを作成するための概念的なフレームワークと実践的なツールの両方を提示している。
論文 参考訳(メタデータ) (2024-10-28T23:57:19Z) - Multi-modal Queried Object Detection in the Wild [72.16067634379226]
MQ-Detは、現実世界のオブジェクト検出のための効率的なアーキテクチャと事前学習戦略設計である。
既存の言語クエリのみの検出器に視覚クエリを組み込む。
MQ-Detのシンプルで効果的なアーキテクチャとトレーニング戦略設計は、ほとんどの言語でクエリされたオブジェクト検出器と互換性がある。
論文 参考訳(メタデータ) (2023-05-30T12:24:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。