論文の概要: RepoMAS: Solving Progressively Specified Tasks with Issue-Driven Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2609.32490v1
- Date: Sat, 26 Sep 2026 11:33:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.60178
- Title: RepoMAS: Solving Progressively Specified Tasks with Issue-Driven Multi-Agent Systems
- Title(参考訳): RepoMAS: 課題駆動型マルチエージェントシステムによる段階的特定タスクの解決
- Abstract要約: 実際には、ユーザ要求はしばしば不完全であり、追加の要件は推論やツールの使用、実行時にのみ明確になる可能性がある。
初期要求で明示された要求に対して最終的な出力を評価するベンチマークであるProgSpecを紹介する。
本稿では,オープンソースのプロジェクト管理にインスパイアされた課題駆動型マルチエージェントフレームワークであるRepoMASを提案する。
- 参考スコア(独自算出の注目度): 25.835568072320143
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based multi-agent systems (MASs) have shown strong potential for solving complex tasks, but most assume that task requirements are sufficiently specified before execution. In practice, user requests are often incomplete, and additional requirements may only become clear during reasoning, tool use, or execution. We refer to such problems as progressively specified tasks. To systematically study this setting, we introduce ProgSpec, a benchmark that evaluates final outputs against requirements explicitly stated in the initial request and additional requirements supported by the available task evidence. We further propose RepoMAS, an issue-driven multi-agent framework inspired by open-source project management. RepoMAS records newly discovered requirements, conflicts, and failures as structured Issues and uses them to revise the task specification and execution structure during problem solving. Across ProgSpec and five existing benchmarks, RepoMAS achieves the best performance. Further analyses show that its issue-driven revision and repository maintenance mechanisms consistently contribute to performance. These results highlight the importance of allowing MASs to revise not only how a task is solved, but also revise their explicit representation of task requirements during execution.
- Abstract(参考訳): LLMベースのマルチエージェントシステム(MAS)は複雑なタスクを解く強力な可能性を示しているが、ほとんどの場合、実行前にタスク要求が十分に特定されていると仮定する。
実際には、ユーザ要求はしばしば不完全であり、追加の要件は推論やツールの使用、実行時にのみ明確になる可能性がある。
我々は、段階的に指定されたタスクのような問題を参照する。
この設定を体系的に研究するために、初期要求で明記された要求と利用可能なタスクエビデンスによって支持される追加要求に対して最終的な出力を評価するベンチマークであるProgSpecを紹介する。
さらに,オープンソースのプロジェクト管理にインスパイアされた課題駆動型マルチエージェントフレームワークであるRepoMASを提案する。
RepoMASは、新たに発見された要件、コンフリクト、障害を構造化問題として記録し、問題解決時にタスク仕様と実行構造を修正するためにそれらを使用する。
ProgSpecと既存の5つのベンチマークで、RepoMASは最高のパフォーマンスを実現している。
さらに分析したところ、イシュー駆動のリビジョンとリポジトリのメンテナンスメカニズムが一貫してパフォーマンスに寄与していることがわかった。
これらの結果は、MASがタスクの解決方法だけでなく、実行中のタスク要求の明示的な表現を書き換えることの重要性を強調している。
関連論文リスト
- First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves [29.390999668963122]
我々は3,649個の慎重に構築された問題に対して,最先端のマルチモーダル言語モデル (MLLM) を評価する。
既存のMLLMはあらゆるシナリオで破滅的な失敗を示す。
マルチプライオリティなユーザ要求に対する推論を明示的に最適化する,First Things First Reinforcement Learning FTF-rlを提案する。
論文 参考訳(メタデータ) (2026-09-04T14:54:30Z) - REAgent: Requirement-Driven LLM Agents for Software Issue Resolution [35.30650311049838]
課題解決は、与えられた課題記述からパッチを自動的に生成することを目的としている。
本稿では,パッチ生成をガイドする要件駆動型エージェントフレームワークREAgentを提案する。
論文 参考訳(メタデータ) (2026-04-08T09:22:30Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models [64.70546873396624]
大規模言語モデル(LLM)を評価するためのEIFBENCH(Extremely Complex Instruction following Benchmark)を提案する。
EIFBENCHにはマルチタスクシナリオが含まれており、多様なタスクタイプを同時に総合的に評価することができる。
また,LLMのマルチタスクワークフローを正確に満たす能力を高めるために,セグメントポリシー最適化(SegPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-10T02:39:55Z) - RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answering [25.84802288928995]
提案するRISE:Reasoning Enhancement via Iterative Self-Explorationは,モデルの推論能力を高めるために設計された新しいフレームワークである。
MHQAタスクに対処する3つの重要なステップ:質問分解、検索-then-read、自己批判である。
複数のMHQAベンチマークの実験により、RISEは推論精度とタスク性能を大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-05-28T03:48:28Z) - MA-RAG: Multi-Agent Retrieval-Augmented Generation via Collaborative Chain-of-Thought Reasoning [36.3918410061572]
MA-RAGは、複雑な情報探索タスクにおける固有の曖昧さと推論の問題に対処する。
エンドツーエンドの微調整や分離されたコンポーネント拡張に依存する従来のRAGメソッドとは異なり、MA-RAGは特別なAIエージェントの協調的なセットを編成する。
本結果は,検索強化システムにおける協調的,モジュール型推論の有効性を浮き彫りにしたものである。
論文 参考訳(メタデータ) (2025-05-26T15:05:18Z) - MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision [76.42361936804313]
自動MAS設計のための自己進化型推論時間フレームワークMAS-ZEROを紹介する。
MAS-ZEROはメタレベルの設計を採用し、各問題インスタンスに適したMAS構成を反復的に生成し、評価し、洗練する。
論文 参考訳(メタデータ) (2025-05-21T00:56:09Z) - MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains [54.117238759317004]
大規模マルチタスクエージェント理解(MMAU)ベンチマークは、複雑な環境設定を必要としない包括的なオフラインタスクを特徴としている。
ツールユース、DAG(Directed Acyclic Graph)QA、データサイエンスと機械学習コーディング、コンテストレベルのプログラミング、数学の5分野にわたるモデルを評価する。
3K以上の異なるプロンプトを含む20の精巧に設計されたタスクにより、MMAUはLLMエージェントの強度と限界を評価するための包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2024-07-18T00:58:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。