論文の概要: Multimodal Duplex Interaction Agent
- arxiv url: http://arxiv.org/abs/2609.08977v3
- Date: Sat, 12 Sep 2026 11:55:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 12:40:38.804158
- Title: Multimodal Duplex Interaction Agent
- Title(参考訳): マルチモーダル二重相互作用剤
- Abstract要約: Ganderは、ストリーミングユーザの入力を処理するインタラクションモデルであり、日々の会話と複雑なシナリオの両方で完全なインタラクションを可能にする。
我々は,対話能力,対話能力,理解能力,タスク実行支援ツールなどにわたって,Ganderを評価した。
Ganderは、バックグラウンドノイズ干渉、マルチパーティインタラクション、バックチャネル通信など、さまざまな困難なインタラクション設定をサポートしている。
- 参考スコア(独自算出の注目度): 48.78411737142625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we present Gander, a native multimodal duplex interaction model that builds on MiniCPM-o 4.5 and is further adapted for realtime interaction with an asynchronous agent loop. In contrast to conventional turn based systems, Gander continuously processes streaming user inputs, enabling full-duplex interaction in both everyday conversations and complex workflow agent scenarios. Users can interrupt an ongoing response, while the model can proactively provide intermediate feedback or ask follow up questions. To natively support these capabilities, Gander adopts two key architectural designs: 1) a Cerebellum-Brain collaborative framework, Cerebellum is responsible for realtime interaction while the Brain handles complex reasoning and higher level agentic tasks. The two components interact continuously through tool calling and the agent orchestration runtime. 2) The Cerebellum is built upon a streaming Thinker-Talker architecture, where user inputs and model outputs are flattened into an ordered token stream at the chunk level. We evaluate Gander across conversational ability, interactive capability, understanding, and tool assisted task execution. Internal human evaluations show that Gander maintains natural and expressive spoken dialogue, while benchmark results demonstrate effective turn taking capability and encouraging results on spoken question answering and related understanding tasks. Gander also supports a range of challenging interaction settings, including background noise interference, multi-party interactions, and backchannel communication. While our current evaluation focuses on tool assisted settings, broader long horizon agent tasks and more diverse deployment conditions remain promising directions for further study. We release Gander together with its models, code, and data to facilitate further research and development in the community.
- Abstract(参考訳): 本稿では,MiniCPM-o 4.5上に構築されたネイティブマルチモーダル二重相互作用モデルであるGanderについて述べる。
従来のターンベースシステムとは対照的に、Ganderはストリーミングユーザの入力を継続的に処理し、日々の会話と複雑なワークフローエージェントのシナリオの両方において、完全な二重のインタラクションを可能にする。
ユーザは、進行中のレスポンスを中断したり、モデルが積極的に中間的なフィードバックを提供したり、フォローアップ質問をすることができる。
これらの機能をネイティブにサポートするために、Gander氏は2つの重要なアーキテクチャ設計を採用した。
1)脳と脳の協調フレームワークであるCerebellumは、脳が複雑な推論と高いレベルのエージェントタスクを処理している間、リアルタイムの相互作用に責任を負う。
この2つのコンポーネントは、ツール呼び出しとエージェントオーケストレーションランタイムを通じて継続的に相互作用する。
2) CerebellumはストリーミングのThinker-Talkerアーキテクチャに基づいて構築され,ユーザの入力とモデル出力を,チャンクレベルで順序付きトークンストリームにフラット化する。
我々は,対話能力,対話能力,理解能力,タスク実行支援ツールなどにわたって,Ganderを評価した。
内的人的評価では、ガンダーは自然かつ表現力のある音声対話を維持しており、ベンチマークの結果は効果的なターン取り能力を示し、音声質問応答および関連する理解タスクについて結果を奨励している。
Ganderはまた、バックグラウンドノイズ干渉、マルチパーティインタラクション、バックチャネル通信など、さまざまな困難なインタラクション設定もサポートする。
現在の評価では、ツール支援設定に重点を置いているが、より広範な長期水平エージェントタスクと、より多様な展開条件は、今後の研究に有望な方向を維持している。
私たちはGanderをそのモデル、コード、データとともにリリースし、コミュニティにおけるさらなる研究と開発を促進します。
関連論文リスト
- Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models [53.470209949659115]
RLによる全音声対話モデルを改善する訓練後アライメント手法を提案する。
対話性の4つの標準軸(ターンテイキング、バックチャネル一時停止、ユーザ中断)に対処する。
応答品質に対する追加ベースの報酬は、セマンティックな劣化を防ぐ。
論文 参考訳(メタデータ) (2026-06-09T17:46:55Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models [62.05118198431989]
非同期のフル音声モデルは、AI停止のフルタイムの対話性と自然な性質によって区別される。
本フレームワークは,外部情報における知識要求型対話クエリと接地応答の同定を可能にする。
本設計では,再学習を伴わないプラグ・アンド・プレイ検索手法をサポートし,アウト・オブ・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー・ツー
論文 参考訳(メタデータ) (2026-04-14T16:17:52Z) - InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance [20.740979380270126]
対話型ダイアディック力学の合成フレームワークであるInterDyadを提案する。
我々はまず、参照ビデオから抽出されたアイデンティティ非依存の動作先に基づいて、ビデオの再現を実現するInteractiveを設計する。
MLLM(Multimodal Large Language Model)を利用して,音声から言語意図を抽出し,反応の正確なタイミングと適切性を決定する。
包括的実験により、InterDyadは、自然と文脈的に基底付けられた2人のインタラクションを生成において、最先端の手法を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2026-03-24T12:27:52Z) - Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning [66.52010873968383]
本稿では,RL学習を通じて学習した探索的,適応的な行動を可能にする,交互に探索と推論をインターリーブする対話エージェントを提案する。
広く使われている4つの対話型ベンチマークによる実験結果から,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2026-01-19T14:55:54Z) - Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models [80.28579390566298]
テキスト条件付き自己回帰拡散モデルであるInteract2Arを導入する。
ハンドキネマティクスは専用のパラレルブランチを通じて組み込まれ、高忠実度フルボディ生成を可能にする。
我々のモデルは、時間的動きの合成、外乱へのリアルタイム適応、ディヤディックからマルチパーソンシナリオへの拡張など、一連のダウンストリームアプリケーションを可能にする。
論文 参考訳(メタデータ) (2025-12-22T18:59:50Z) - Diffusion Forcing for Multi-Agent Interaction Sequence Modeling [52.769202433667125]
MAGNetはマルチエージェントモーション生成のための統合された自己回帰拡散フレームワークである。
フレキシブルな条件付けとサンプリングを通じて、幅広いインタラクションタスクをサポートする。
緊密に同期された活動と、ゆるやかに構造化された社会的相互作用の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-12-19T18:59:02Z) - End-to-end Listen, Look, Speak and Act [22.047534228540783]
ELLSAは、より自然で一般的な対話型人工知能への一歩であり、人工知能の幅広い追求に寄与している。
中心となるのはSA-MoE(Attention Mixture-of-Experts)で、それぞれのモダリティを専門の専門家にルーティングすることで、統一された注意バックボーンを通じてそれらを融合させる。
論文 参考訳(メタデータ) (2025-10-19T08:45:46Z) - Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset [113.25650486482762]
4000時間以上の対面インタラクション映像の大規模な収集であるSeamless Interactionデータセットを紹介した。
このデータセットは、ダイドの具体的ダイナミクスを理解するAIテクノロジの開発を可能にする。
そこで我々は,このデータセットを用いて,人間の発話に適応した動作ジェスチャーと表情を生成するモデル群を開発した。
論文 参考訳(メタデータ) (2025-06-27T18:09:49Z) - Breaking Single-Tester Limits: Multi-Agent LLMs for Multi-User Feature Testing [15.383375235673954]
アプリケーション機能テストのためのマルチユーザ対話タスクを自動化するために,LLM(Large Language Models)を利用した新しいマルチエージェントアプローチであるMAdroidを提案する。
具体的には、MAdroidは、ユーザエージェント(オペレータ)とスーパーバイザーエージェント(コーディネータとオブザーバ)の2つの機能タイプを採用している。
マルチユーザ対話型タスク41件を含む評価は,96.8%の動作類似性を有するタスクの82.9%を達成し,提案手法の有効性を示した。
論文 参考訳(メタデータ) (2025-06-21T01:38:53Z) - Inter-Diffusion Generation Model of Speakers and Listeners for Effective Communication [4.49451692966442]
本稿では,効果的なコミュニケーションのための話者と聞き手の拡散間生成モデルを提案する。
初めて、リスナーのフルボディジェスチャーを生成フレームワークに統合する。
論文 参考訳(メタデータ) (2025-05-08T07:00:58Z) - It Takes Two: Real-time Co-Speech Two-person's Interaction Generation via Reactive Auto-regressive Diffusion Model [34.94330722832987]
会話中の2文字の動的動きを合成するための音声駆動自動回帰システムを提案する。
我々の知る限りでは、オンライン方式で2文字の対話型フルボディモーションを生成できる最初のシステムである。
論文 参考訳(メタデータ) (2024-12-03T12:31:44Z) - MUG: Interactive Multimodal Grounding on User Interfaces [12.035123646959669]
本稿では,ユーザとエージェントがインタフェース画面上で協調作業を行うマルチモーダルグラウンドのための対話型タスクMUGを提案する。
ユーザがコマンドを与え、エージェントがコマンドに応答する。MUGはエージェントの応答を見る際に、エージェントがそのアクションを洗練または修正するための追加コマンドを与えるように、複数のラウンドのインタラクションを可能にする。
論文 参考訳(メタデータ) (2022-09-29T21:08:18Z) - A Probabilistic Model Of Interaction Dynamics for Dyadic Face-to-Face
Settings [1.9544213396776275]
我々は,対面設定における対の参加者間の相互作用のダイナミクスを捉える確率論的モデルを開発した。
この相互作用エンコーディングは、あるエージェントの将来のダイナミクスを予測する際に、生成に影響を与えるために使用される。
我々のモデルは, 相互作用する力学に基づいて, モード間のデライン化に成功していることを示す。
論文 参考訳(メタデータ) (2022-07-10T23:31:27Z) - Multi-Domain Dialogue Acts and Response Co-Generation [34.27525685962274]
本稿では,対話行動と応答を同時に生成するニューラルコジェネレーションモデルを提案する。
我々のモデルは, 自動評価と人的評価の両方において, いくつかの最先端モデルに対して, 極めて良好な改善を達成している。
論文 参考訳(メタデータ) (2020-04-26T12:21:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。