論文の概要: MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding
- arxiv url: http://arxiv.org/abs/2609.14992v1
- Date: Mon, 14 Sep 2026 03:57:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.062877
- Title: MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding
- Title(参考訳): MTAC-IFBench:マルチターンエージェント符号化におけるインストラクションフォローのベンチマーク
- Abstract要約: MTAC-IFBenchは、ソフトウェア開発におけるインストラクションフォローのための包括的なベンチマークである。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
- 参考スコア(独自算出の注目度): 83.0805548642958
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, the rapid development of large language models (LLMs) has reshaped software engineering by enabling autonomous code agents that plan, execute, and utilize external tools iteratively to tackle complex tasks. Beyond achieving functional correctness, these agents must faithfully follow process instructions and constraints throughout the development lifecycle. However, existing benchmarks typically focus on final functional correctness or confine instruction-following evaluation to single-turn, general chat or simple code generation scenarios, leaving instruction-following in multi-turn agentic coding underexplored. To bridge this gap, we propose MTAC-IFBench, a comprehensive benchmark for this critical capability. It features multi-turn progressive software development instructions with diverse constraints spanning 6 primary and 18 secondary categories. With an average of 7.04 turns and 91.33 constraints per instance, it poses a rigorous challenge to current LLMs. To make the evaluation reliable, we construct a checklist for each constraint and functional requirement, and integrate verification scripts and judge agents to verify each checklist item. MTAC-IFBench identifies significant deficiencies in existing code agents in multi-turn instruction-following, with their performance degrading rapidly as the interaction session grows longer.
- Abstract(参考訳): 近年,大規模言語モデル (LLM) の急速な開発は,複雑なタスクに対処するために外部ツールを計画,実行,活用する自律型コードエージェントを実現することによって,ソフトウェア工学を再形成している。
機能的正当性を達成するだけでなく、これらのエージェントは開発ライフサイクルを通してプロセスの指示や制約を忠実に守らなければならない。
しかし、既存のベンチマークでは、通常、単一ターン、一般的なチャット、あるいは単純なコード生成シナリオに対する最終的な機能的正当性や命令追従性の評価に焦点が当てられており、マルチターンエージェントコーディングの過小評価では命令追従が残されている。
このギャップを埋めるため,我々はMTAC-IFBenchを提案する。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
平均7.04回転、1インスタンスあたり91.33の制約があるため、現在のLLMには厳密な課題が生じる。
評価を信頼性のあるものにするために,各制約および機能要件のチェックリストを構築し,検証スクリプトと判定エージェントを統合して各チェックリスト項目の検証を行う。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
関連論文リスト
- CCTU: A Benchmark for Tool Use under Complex Constraints [66.87622847854337]
複雑な制約下での大規模言語モデル(LLM)を評価するためのベンチマークであるCCTUを紹介する。
ベンチマークは、さまざまなツール使用シナリオに対して、慎重にキュレートされ、挑戦的なテストケースが200から成っている。
ステップレベルの検証を行い、コンプライアンスを強制する実行可能な制約検証モジュールを開発する。
論文 参考訳(メタデータ) (2026-03-16T14:05:13Z) - SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration [7.89414068452646]
SWE-CIは継続的インテグレーションループ上に構築された最初のリポジトリレベルのベンチマークである。
コード生成のための評価パラダイムを静的・短期的テキスト機能的正当性から動的・長期的テキスト保守性へシフトすることを目的としている。
論文 参考訳(メタデータ) (2026-03-04T08:20:25Z) - AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios [49.90735676070039]
持続時間と複雑さが増大するタスクを効果的に処理するAIエージェントの能力は、成長を続けている。
エージェントタスクの多様性に十分対処することなく,タスクの難易度の向上を優先している。
本稿では,自然言語命令とAIエージェントを多種多様な日常タスクに活用できるかどうかを判定するエージェントIF-OneDayを提案する。
論文 参考訳(メタデータ) (2026-01-28T13:49:18Z) - EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models [64.70546873396624]
大規模言語モデル(LLM)を評価するためのEIFBENCH(Extremely Complex Instruction following Benchmark)を提案する。
EIFBENCHにはマルチタスクシナリオが含まれており、多様なタスクタイプを同時に総合的に評価することができる。
また,LLMのマルチタスクワークフローを正確に満たす能力を高めるために,セグメントポリシー最適化(SegPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-10T02:39:55Z) - AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios [51.46347732659174]
LLM(Large Language Models)は、現実世界のエージェントアプリケーションにおいて高度な機能を示す。
AgentIFは、エージェントシナリオでLLM命令に従う能力を体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T17:31:10Z) - RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code [7.156224931977546]
RefactorBenchは、人気のあるオープンソースリポジトリで100の大規模な手作りのマルチファイルタスクからなるベンチマークである。
ベースラインは、現在のLMエージェントが単純な構成タスクで苦労していることを明らかにし、ベース命令で22%のタスクしか解決していない。
状態表現の条件にベースラインエージェントを適用することにより、RefactorBenchタスクの解決において43.9%の改善が達成される。
論文 参考訳(メタデータ) (2025-03-10T20:23:24Z) - CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation [10.438717413104062]
大規模言語モデルの命令追従能力を評価するためのベンチマークであるCodeIF-Benchを紹介する。
CodeIF-Benchには、現実世界のソフトウェア開発要件に沿った9種類の検証可能な命令が組み込まれている。
textitStatic Conversation と textitDynamic Conversation の設定の両方において、7つの最先端 LLM の性能を評価する。
論文 参考訳(メタデータ) (2025-03-05T09:47:02Z) - CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation [20.013757490442064]
タスク指向の命令に準拠する大規模言語モデル(LLM)の能力を評価するために設計された最初のベンチマークであるCodeIFを紹介する。
CodeIFは関数合成、アルゴリズム命令、コード説明など幅広いタスクを含んでいる。
我々はLLMによる広範囲な実験を行い、これらの課題の要求を満たす上での強みと限界を分析した。
論文 参考訳(メタデータ) (2025-02-26T14:19:49Z) - BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions [72.56339136017759]
BigCodeBenchは、大規模言語モデル(LLM)に対して、139のライブラリと7つのドメインから1140のきめ細かいタスクに対して、複数の関数呼び出しをツールとして呼び出すためのベンチマークである。
評価の結果,LLMは機能コールを正確に使用するための複雑な指示に従うことができず,スコアは最大60%,人的性能は97%と極めて低いことがわかった。
そこで本研究では,BigCodeBench-Instructという自然言語指向の変種を提案する。
論文 参考訳(メタデータ) (2024-06-22T15:52:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。