論文の概要: Disentangling Topology and Diversity in Multi-Agent LLMs for Multilingual Low-Resource Emotion Detection
- arxiv url: http://arxiv.org/abs/2609.14570v2
- Date: Tue, 22 Sep 2026 08:24:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.612048
- Title: Disentangling Topology and Diversity in Multi-Agent LLMs for Multilingual Low-Resource Emotion Detection
- Title(参考訳): マルチリンガル低リソース感情検出のためのマルチエージェントLDMにおけるディペンタングトポロジと多様性
- Abstract要約: マルチエージェントLLMシステムは複数の推論呼び出しを結合するが、事前の作業はしばしば、呼び出しが多様化する方法とどのように接続されているかに矛盾する。
トポロジ的推論とエージェント間多様性の源泉として,これらの要因を独立に研究する。
パラレル学習専門化はQwenで52.83 Macro-F1で最強であり、Llamaで52.94に達する。
- 参考スコア(独自算出の注目度): 0.5918617516642835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent LLM systems combine multiple inference calls, but prior work often confounds how calls are connected with how they are diversified. We study these factors independently: inference topology and source of inter-agent diversity. In a controlled $2 \times 3$ matrix, we cross parallel aggregation and sequential refinement with stochastic sampling, role prompting, and learned QLoRA specialization, under a fixed three-call budget and output protocol within each backbone. Using Qwen2.5-14B-Instruct and Llama-3.1-8B-Instruct, we evaluate all six configurations on multilingual low-resource emotion detection across nine languages. Parallel learned specialization is strongest on Qwen at 52.83 Macro-F1 and reaches 52.94 on Llama. On Qwen it also exceeds same-backbone zero-shot, few-shot, CoT, and seven-call self-consistency baselines. The preferred topology depends on diversity source: sequential refinement helps stochastic and prompted settings, while the learned Width advantage shrinks from 2.83 points on Qwen to 0.17 on Llama. Depth-wise analysis suggests that later learned specialists can overwrite correct early predictions, although the aggregate effect is backbone-dependent. Overall, how agents are differentiated produces larger performance shifts than topology, which should be evaluated jointly with specialization.
- Abstract(参考訳): マルチエージェントLLMシステムは複数の推論呼び出しを結合するが、事前の作業はしばしば、呼び出しが多様化する方法とどのように接続されているかに矛盾する。
我々はこれらの要因を独立に研究する:推論トポロジとエージェント間の多様性の源である。
制御された2ドルの3$行列において、各バックボーン内の固定3コール予算と出力プロトコルの下で、確率的サンプリング、ロールプロンプト、学習QLoRAの特殊化により並列集約とシーケンシャル改善を行う。
Qwen2.5-14B-InstructとLlama-3.1-8B-Instructを用いて、9言語にわたる多言語低リソース感情検出における6つの構成について評価した。
パラレル学習専門化はQwenで52.83 Macro-F1で最強であり、Llamaで52.94に達する。
Qwenでは、同じバックボーンのゼロショット、少数ショット、CoT、および7コールの自己一貫性ベースラインを超えている。
逐次改良は確率的かつ設定を促すのに役立ち、学習されたWidthの利点はQwenの2.83ポイントからLlamaの0.17ポイントに減少する。
深部分析は、後の学習専門家が、バックボーンに依存しているにもかかわらず、正しい早期予測を上書きできることを示唆している。
全体として、エージェントの区別はトポロジーよりも大きなパフォーマンスシフトをもたらし、特殊化とともに評価されるべきである。
関連論文リスト
- SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation [51.46828526392219]
推論セグメンテーションは暗黙の言語学的結論を正確なマスクに変換する。
既存のMLLMセグメンタインタフェースでは、特別なトリガーを使用するか、両方の信号を1つのコンテキストに圧縮する。
明示的なWhat-whereインターフェースであるSeGDePを提示する。
論文 参考訳(メタデータ) (2026-09-08T15:11:32Z) - MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State Probing [1.3700362496838856]
大規模言語モデル(LLM)における幻覚は、信頼性の高いデプロイメントにとって重要な障壁である。
多言語幻覚を検出する新しい3段階積み重ねフレームワークであるMultiHaluDetを紹介する。
本フレームワークは,HluEvalおよびTriviaQAベンチマークで98.55%のAUROCに到達し,最先端検出性能を実現する。
論文 参考訳(メタデータ) (2026-05-24T07:50:03Z) - TacoMAS: Test-Time Co-Evolution of Topology and Capability in LLM-based Multi-Agent Systems [55.81570336226014]
動的マルチエージェントシステムのためのテスト時間共進化フレームワークであるTacoMASを紹介する。
TacoMASはMAS推論をオンライングラフ適応のタスクとして定式化し、ノードは役割固有の能力を持つエージェントを表し、エッジはその通信トポロジを定義する。
4つのベンチマークの実験では、TacoMASは20近いマルチエージェントベースラインを上回り、最強ベースラインよりも平均13.3%向上した。
論文 参考訳(メタデータ) (2026-05-10T13:52:00Z) - DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles [5.647839536820347]
著者間の不一致構造を抽出し活用し,信頼度を良好に推定するフレームワークであるDiscoUQを紹介する。
DiscoUQ-LLM の平均 AUROC は 0.802 であり、最高のベースラインを上回っている。
学習した機能は、ほぼゼロに近いパフォーマンス劣化を伴うベンチマークで一般化される。
論文 参考訳(メタデータ) (2026-03-21T23:24:12Z) - AILS-NTUA at SemEval-2026 Task 8: Evaluating Multi-Turn RAG Conversations [14.20669481486209]
我々はSemEval-2026タスク8(MTRAGEval)のためのAILS-NTUAシステムを提案する。
マルチターン検索拡張生成の3つのサブタスク、すなわち、経路検索(A)、基準接地応答生成(B)、エンドツーエンドRAG(C)のすべてに対処する。
統一アーキテクチャは、(i)クエリ-ダイバーシティ-オーバー・レトリバー-ダイバーシティ戦略と(ii)マルチステージ生成パイプラインという2つの原則に基づいて構築されています。
論文 参考訳(メタデータ) (2026-03-11T08:28:31Z) - MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation [64.2621682259008]
セルフサーチスケーリングによるマルチエージェント強化トレーニングと推論フレームワーク(MARTI-MARS2)
本稿では,MARTI-MARS2を用いたマルチエージェント強化学習・推論フレームワークを提案する。
我々は、MARTI-MARS2が77.7%を獲得し、GPT-5.1のような強力なベースラインを、挑戦的なコード生成ベンチマークで上回っていることを示す。
論文 参考訳(メタデータ) (2026-02-08T07:28:44Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Semantic Bridge: Universal Multi-Hop Question Generation via AMR-Driven Graph Synthesis [3.1427813443719868]
大きな言語モデル(LLM)のトレーニングは、高品質で推論集約的な質問応答ペアの不足という、重大なボトルネックに直面します。
textbfSemantic Bridgeは、任意の情報源から洗練されたマルチホップ推論質問を制御可能とする最初の普遍的フレームワークである。
論文 参考訳(メタデータ) (2025-08-06T10:59:42Z) - MALT: Improving Reasoning with Multi-Agent LLM Training [67.76186488361685]
MALT(Multi-Agent LLM Training)は、推論プロセスを生成、検証、改善ステップに分割する、新しいポストトレーニング戦略である。
MATH、GSM8K、CSQAでは、MALTは、それぞれ15.66%、7.42%、9.40%の相対的な改善で同じベースラインLLMを上回っている。
論文 参考訳(メタデータ) (2024-12-02T19:30:36Z) - M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models [58.54538318912159]
M4LEは、大規模言語モデル(LLM)の時系列能力を評価するためのベンチマークである。
M4LEは、36のNLPタスクタイプと12のドメインからなる多様なNLPタスクプールに基づいている。
我々は,11個のLLM,特に長文入力に最適化されたLLMについて,系統評価を行った。
論文 参考訳(メタデータ) (2023-10-30T03:11:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。