論文の概要: Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference
- arxiv url: http://arxiv.org/abs/2609.09628v1
- Date: Wed, 09 Sep 2026 02:40:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.875039
- Title: Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference
- Title(参考訳): 互いに誰なのか : 話者関係推論のためのマルチエージェント推論
- Abstract要約: 音声会話から話者関係を推定することは、社会的に認識された音声理解への重要なステップである。
既存の推論時間LLMアプローチは、微妙で分散的でマルチモーダルなリレーショナルキューを扱うための制限された構造を提供する。
LLMエージェント間の構造的相互作用を通じて推論を整理する,トレーニングフリーなマルチエージェント推論フレームワークを提案する。
- 参考スコア(独自算出の注目度): 18.334093251358833
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inferring speaker relationships from spoken conversations is an important step towards socially aware speech understanding. However, this task remains underexplored, and supervised modeling is costly to train and scale. At the same time, existing inference-time LLM approaches provide limited structure for handling subtle, distributed, and multimodal relational cues that may support multiple plausible interpretations. To address these limitations, we introduce a training-free multi-agent reasoning framework that organizes inference through structured interaction among LLM agents, allowing relationship judgments to be proposed, challenged, and adjudicated without task-specific training. We instantiate this framework with two complementary designs. We propose Multi-Role Multi-Agent Debate as a task-specific adaptation of standard multi-agent debate for speaker relationship inference, assigning agents complementary roles or social-theory-grounded perspectives rather than a single undifferentiated viewpoint. In contrast, we introduce Multi-Agent Compete, a competition-based protocol that compares agent judgments through pairwise adjudication, eliminates weaker candidates, and retains the most defensible one. We evaluate these methods on the Seamless Interaction dataset across different modality settings, covering both binary classification and fine-grained relationship-detail prediction. Results suggest that they improve over zero-shot and existing multi-agent baselines in most cases. Human evaluation further suggests that this task is challenging even for people. LLM methods can sometimes outperform human annotators in text-included settings but are less competitive in the audio setting. Together, these findings suggest that relationship inference benefits from structured inference-time interaction among agents, while acoustic cues are not yet fully captured by current models.
- Abstract(参考訳): 音声会話から話者関係を推定することは、社会的に認識された音声理解への重要なステップである。
しかし、このタスクは未調査のままであり、教師付きモデリングはトレーニングとスケールにコストがかかる。
同時に、既存の推論時LLMアプローチは、複数の妥当な解釈をサポートする可能性のある微妙で分散的でマルチモーダルなリレーショナルキューを扱うための制限された構造を提供する。
これらの制約に対処するために、LLMエージェント間の構造的相互作用を通じて推論を整理し、タスク固有のトレーニングを使わずに関係判断を提案し、挑戦し、調整することができるトレーニングフリーなマルチエージェント推論フレームワークを導入する。
このフレームワークを2つの補完的な設計でインスタンス化する。
本稿では,話者関係推論のための標準マルチエージェント議論のタスク特化としてマルチロール・マルチエージェント・ディベートを提案する。
これとは対照的に、競合ベースのプロトコルであるMulti-Agent Competeを導入する。
本研究では,これらの手法を,二項分類と微粒な関係-詳細予測の両方を網羅し,異なるモード設定におけるSeamless Interactionデータセット上で評価する。
その結果、多くの場合、ゼロショットや既存のマルチエージェントベースラインよりも改善されていることが示唆された。
人的評価はさらに、このタスクが人々にとっても難しいことを示唆している。
LLM法は、テキストを含む設定では人間のアノテータを上回ることがあるが、オーディオ設定では競争力は低い。
これらの結果から, エージェント間の構造的推論時間相互作用による相関推定の利点が示唆された。
関連論文リスト
- MP-Bench: Evaluating Voice Agents as a Multiparty Conversation Participant [138.90198190949545]
MP-Benchは,対話型音声システムに対して,マルチパーティ・コンテクスト内でのアクティブな参加者としての評価を目的とした,最初のベンチマークである。
MP-Benchは、ターンテイキングの認識と応答の適切性という2つの主要な側面に沿ってエージェントの振る舞いを評価する。
リアルタイム音声エージェントは、マルチパーティの理解において22%以下にとどまり、マルチパーティのターンテイクにおいてほぼチャンスであることがわかった。
論文 参考訳(メタデータ) (2026-09-11T17:11:55Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding [73.05946667683259]
最近の大規模言語モデル(MLLM)は、強い認識を示すが、多話者、対話中心の設定に苦戦している。
本質的にエージェント的なタスクを中心に設計されたベンチマークであるAMUSEを紹介します。
我々は、報酬最適化と本質的なマルチモーダル自己評価を統合するデータ効率の高いエージェントアライメントフレームワークRAFTを提案する。
論文 参考訳(メタデータ) (2025-12-18T07:01:47Z) - DEBATE: A Large-Scale Benchmark for Role-Playing LLM Agents in Multi-Agent, Long-Form Debates [10.609797175227644]
マルチエージェントロールプレイングLLM間の相互作用の信頼性を評価するための,最初の大規模実証的ベンチマークであるDEBATEを紹介する。
我々は,シミュレーション群と真正群との重要な相違点を系統的に評価し,同定した。
論文 参考訳(メタデータ) (2025-10-29T02:21:10Z) - OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning [14.105640933123325]
大規模言語モデル(LLM)は、数学的および科学的タスクにおいて顕著な推論能力を示している。
複雑な推論を強化するため、LLMエージェントの集合的知性を活用するためにマルチエージェントシステムが提案されている。
複数エージェントの協調構造を動的に構築・洗練する多エージェント言語強化学習アルゴリズムである$ours$を提案する。
論文 参考訳(メタデータ) (2025-10-20T19:07:51Z) - Benefits and Limitations of Communication in Multi-Agent Reasoning [11.788489289062312]
マルチエージェントシステムの表現性を解析するための理論的枠組みを提案する。
i) タスクを正確に解くために必要なエージェントの数, (ii) エージェント間通信の量と構造, (iii) 達成可能なスピードアップを問題サイズとコンテキストスケールとして導出する。
本研究は,コミュニケーションが有益である状況を特定し,エージェント数と帯域幅のトレードオフを明確化し,いずれのリソースにも制約がある場合の本質的な制約を明らかにする。
論文 参考訳(メタデータ) (2025-10-14T20:04:27Z) - Let's Roleplay: Examining LLM Alignment in Collaborative Dialogues [11.888786446094057]
本稿では,多人数共同作業におけるパートナーとしての大規模言語モデルの有効性に,異なるアライメント手法がどのような影響を与えるかを検討する。
ロールプレイ手法を用いて、協調作業会話における異なる訓練された摩擦剤の介入を評価する。
以上の結果から, 摩擦認識アプローチは, 共通基盤への収束, あるいはタスク関連命題の一致, タスク結果の正当性の両方において, 共通のアライメントベースラインを著しく上回ることがわかった。
論文 参考訳(メタデータ) (2025-09-07T00:58:10Z) - Multi-Level Aware Preference Learning: Enhancing RLHF for Complex Multi-Instruction Tasks [81.44256822500257]
RLHFは、人工知能システムと人間の好みを結びつける主要なアプローチとして登場した。
RLHFは、複雑なマルチインストラクションタスクに直面すると、不十分なコンプライアンス機能を示す。
本稿では,マルチインストラクション能力を向上させる新しいMAPL(Multi-level Aware Preference Learning)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T08:33:11Z) - Low-rank Prompt Interaction for Continual Vision-Language Retrieval [47.323830129786145]
本稿では,マルチモーダル理解の問題に対処するために,低ランクプロンプトインタラクションを提案する。
トレーニングパラメータがレイヤー数やタスク数にスケールすることを考えると、低ランクな相互作用強化分解を提案する。
また、ロバストネストレーニングを確保するために、階層的な低ランクのコントラスト学習を採用しています。
論文 参考訳(メタデータ) (2025-01-24T10:00:47Z) - Multimodal Learning Without Labeled Multimodal Data: Guarantees and Applications [90.6849884683226]
ラベル付き単調データのみを用いた半教師付き環境における相互作用定量化の課題について検討する。
相互作用の正確な情報理論的定義を用いて、我々の重要な貢献は下界と上界の導出である。
本稿では、これらの理論結果を用いてマルチモーダルモデルの性能を推定し、データ収集をガイドし、様々なタスクに対して適切なマルチモーダルモデルを選択する方法について述べる。
論文 参考訳(メタデータ) (2023-06-07T15:44:53Z) - Pre-training Multi-party Dialogue Models with Latent Discourse Inference [85.9683181507206]
我々は、多人数対話の会話構造、すなわち、各発話が応答する相手を理解するモデルを事前訓練する。
ラベル付きデータを完全に活用するために,談話構造を潜在変数として扱い,それらを共同で推論し,談話認識モデルを事前学習することを提案する。
論文 参考訳(メタデータ) (2023-05-24T14:06:27Z) - Rethinking Trajectory Prediction via "Team Game" [118.59480535826094]
本稿では,対話型グループコンセンサスの概念を明示的に導入した,マルチエージェント軌道予測の新しい定式化について述べる。
チームスポーツと歩行者の2つのマルチエージェント設定において,提案手法は既存手法と比較して常に優れた性能を達成している。
論文 参考訳(メタデータ) (2022-10-17T07:16:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。