論文の概要: RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
- arxiv url: http://arxiv.org/abs/2608.27831v2
- Date: Mon, 31 Aug 2026 12:23:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.371471
- Title: RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
- Title(参考訳): RealSWE:リアルなユーザ要求に基づくコーディングエージェントの構成的評価
- Abstract要約: コーディングエージェントは、GitHubのキュレートされた問題から構築されたSWE-benchベンチマークファミリで一般的に評価されている。
本研究では,6カテゴリの情報分類と4次元の言語スタイルを定義し,実際のユーザプロンプトに適用する。
実際のプロンプトの88%は問題ステートメントしか持たないが、ベンチマークの問題の7%に過ぎないことが判明した。
- 参考スコア(独自算出の注目度): 14.251266069918591
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents are now commonly evaluated on the SWE-bench family of benchmarks, whose tasks are built from curated GitHub issues: long, structured, and information-rich. Real user requests, however, are typically far shorter and less structured. To characterize this gap, we define a six-category information taxonomy and four dimensions of linguistic style, and apply them to real user prompts from SWE-chat and problem statements from SWE-bench Verified and Pro. We find that requests carrying only a problem statement, alone or with limited additional context, account for 88% of real prompts but just 7% of benchmark problems. Furthermore, 87% of real prompts are casually written whereas 94% of benchmark problems are formal. Guided by these observations, we introduce RealSWE, 381 multi-variant task families derived from SWE-bench Verified and Pro. Variants within each family share the same underlying task and gold patch while differing only in information composition and linguistic style. Evaluating seven contemporary LLMs with RealSWE, we find that i) realistic inputs reduce resolution rates by 6.4 pp on average and can change model rankings. Controlled analysis further shows that ii) including Desired Behavior and Motivation significantly affects performance, whereas Environment Information and Reproduction Steps merely add tokens without measurable benefit; iii) linguistic style has only small, model-dependent effects. These findings provide actionable guidance for users and agents: explicitly stating the desired behavior and motivation, which most real prompts omit, substantially improves the LLM's software engineering performance.
- Abstract(参考訳): コーディングエージェントはSWE-benchのベンチマークファミリで一般的に評価され、そのタスクは、長期、構造化、情報豊富なGitHubイシューから構築されている。
しかし、実際のユーザリクエストは、通常、はるかに短く、より構造化されていない。
このギャップを特徴付けるために、6つのカテゴリの情報分類と4次元の言語スタイルを定義し、それらをSWEチャットからの実際のユーザプロンプトとSWEベンチ検証とProの課題ステートメントに適用する。
問題ステートメントのみ、あるいは追加コンテキストが限定された要求は、実際のプロンプトの88%を占めるが、ベンチマークの問題の7%しかありません。
さらに、実際のプロンプトの87%はカジュアルに書かれており、ベンチマーク問題の94%は形式的である。
これらの観測から導かれたRealSWEは,SWE-bench VerifiedとProから派生した381の多変量タスクファミリーである。
各家族内の変数は、情報構成と言語スタイルでのみ異なるが、同じ基本的なタスクと金のパッチを共有している。
RealSWEによる7つの現代LLMの評価
一 現実的な入力は、平均6.4ppの解像度率を減少させ、モデルランキングを変更することができる。
制御された分析は、さらにそれを示している。
二 強制行動及び動機付けを含むものは、性能に著しく影響を与え、一方、環境情報及び再生ステップは、単に、測定可能な利益のないトークンを付加するにすぎない。
三 言語様式は、小さな、モデルに依存した効果しか持たない。
これらの発見は、ユーザとエージェントに対して実行可能なガイダンスを提供する: 望まれる行動とモチベーションを明確に述べる。
関連論文リスト
- xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems [57.62172039072062]
xDailyBenchは、個人生活、ホワイトカラーワーク、学習と研究、ドメイン横断アクティビティなど、51のシナリオにまたがる248の慎重にキュレートされたタスクのベンチマークである。
これらのタスクは、ユーザがAIで実際に完了した、あるいは真に達成することを意図した要求に基づいており、明示的な要件と暗黙的な要件の両方をカバーする、きめ細かいバイナリルーブリックで評価される。
最高のモデルではタスクレベルのスコアが75.6%に達し、すべてのモデルは明示的な要件よりも暗黙的にパフォーマンスが悪く、ギャップは9ポイント以下である。
論文 参考訳(メタデータ) (2026-09-07T17:30:58Z) - SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information [61.41881137371855]
大規模言語モデル(LLM)のベンチマークであるSPIEvalを紹介する。
SPIEvalは、10のアプリに分散された4,335の個人レコードにまたがる250のタスクで構成され、21のツールによるマルチターンインタラクションをサポートする。
最高のパフォーマンスモデルであるGPT-5.5(xhigh)は57.3%の精度しか達成せず、最も弱いモデルは16.4%である。
論文 参考訳(メタデータ) (2026-08-11T09:14:53Z) - Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages [0.8895014147059547]
小さな急激な変化でさえ、出力にかなりの違いをもたらす可能性がある。
複数の摂動型にまたがるロバスト性を評価するベンチマークスイートを提案する。
マイナーな摂動は、主要な企業メトリクスの最大40パーセントのパフォーマンスを低下させることに気付きました。
論文 参考訳(メタデータ) (2026-01-09T22:26:31Z) - What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models [10.883552856100684]
韓国のオンラインコミュニティから,実世界の653の視覚的質問のベンチマークであるHAERAE-Visionを紹介した。
最先端モデル (GPT-5, Gemini 2.5 Pro) でさえも、元のクエリでは50%以下であることがわかった。
論文 参考訳(メタデータ) (2026-01-07T02:33:03Z) - Structured Prompting Enables More Robust Evaluation of Language Models [38.53918044830268]
DSPy+HELMフレームワークを提案する。
構造化されたプロンプトがなければ、HELMはLM性能(平均4%)を過小評価し、性能評価はベンチマークによって異なることがわかった。
これは、構造化されたプロンプトを確立された評価フレームワークに体系的に統合する最初のベンチマーク研究である。
論文 参考訳(メタデータ) (2025-11-25T20:37:59Z) - EDIT-Bench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits [72.23150343093447]
本稿では,実環境におけるコード編集機能の評価のためのベンチマークであるEDIT-Benchを紹介する。
EDIT-Benchは545の問題、複数の自然言語およびプログラミング言語、および様々な現実世界のユースケースからなる。
モデルの性能は、ユーザ命令のカテゴリによって異なります。
論文 参考訳(メタデータ) (2025-11-06T16:05:28Z) - Teaching Language Models To Gather Information Proactively [53.85419549904644]
大規模言語モデル(LLM)は、ますます協力的なパートナーとして機能することが期待されている。
本研究では,アクティブな情報収集という新たなタスクパラダイムを導入する。
キー情報をマスキングする、部分的に特定された現実世界のタスクを生成するスケーラブルなフレームワークを設計する。
このセットアップの中核となるイノベーションは、真に新しい暗黙のユーザー情報を引き出す質問に報酬を与える、強化された微調整戦略です。
論文 参考訳(メタデータ) (2025-07-28T23:50:09Z) - Re-Evaluating Code LLM Benchmarks Under Semantic Mutation [8.58692613099365]
本稿では,コードベンチマークの迅速感度を調査するための実証的研究について述べる。
本稿では,プロンプトテンプレートのセマンティクスと構造を両立させる手法として,プロンプトテンプレートを改良する汎用フレームワークを提案する。
この結果から, 急激な変化であっても, 性能が著しく変化することが示唆された。
論文 参考訳(メタデータ) (2025-06-20T15:30:36Z) - Say It Another Way: Auditing LLMs with a User-Grounded Automated Paraphrasing Framework [17.91981142492207]
本稿では,ユーザ行動に根ざした制御されたフレーズを生成するフレームワークであるAUGMENTを紹介する。
AUGMENTは言語的に情報を得た規則を活用し、命令の順守、意味的類似性、リアリズムのチェックを通じて品質を強制する。
ケーススタディでは、制御されたパラフレーズは、制約のない変動の下で隠されたままの系統的な弱点を明らかにする。
論文 参考訳(メタデータ) (2025-05-06T14:17:30Z) - Out of Style: RAG's Fragility to Linguistic Variation [29.59506089890902]
ユーザクエリは言語的なバリエーションが大きく、依存するRAGコンポーネント間のカスケードエラーを引き起こす可能性がある。
我々は,4つの言語的次元(形式性,可読性,丁寧性,文法的正しさ)がRAG性能に与える影響を分析する。
論文 参考訳(メタデータ) (2025-04-11T03:30:26Z) - On the Worst Prompt Performance of Large Language Models [93.13542053835542]
大規模言語モデル(LLM)の性能は,プロンプトの表現に非常に敏感である。
セマンティックに等価なケースレベルのクエリで構成される新しいベンチマークであるRobustAlpacaEvalを紹介する。
RobustAlpacaEvalとChatGPT、およびLlama、Mistral、Gemmaファミリーの6つのオープンソースLLMによる実験により、モデル性能のかなりのばらつきが明らかになった。
論文 参考訳(メタデータ) (2024-06-08T13:40:38Z) - A Simple Language Model for Task-Oriented Dialogue [61.84084939472287]
SimpleTODはタスク指向対話に対する単純なアプローチであり、すべてのサブタスクのリキャストで訓練された単一因果言語モデルを単一シーケンス予測問題として利用する。
これによりSimpleTODは、事前訓練されたオープンドメイン、GPT-2のような因果言語モデルからのトランスファー学習を完全に活用できる。
論文 参考訳(メタデータ) (2020-05-02T11:09:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。