論文の概要: Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance
- arxiv url: http://arxiv.org/abs/2607.21674v1
- Date: Thu, 23 Jul 2026 10:18:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.95386
- Title: Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance
- Title(参考訳): Exput Format x Model Identity: シングルランド符号化エージェントの性能に対する相互作用効果
- Authors: Yang Yang,
- Abstract要約: 3つのモデル(DeepSeek V4, Doubao 2.0, Qwen 3.7 Max)で制御実験を行う。
エージェントが過剰なスコープで実行する、フォーマット誤用という、明確な障害メカニズムを特定します。
本稿では, モデル固有の戦略, ツールデザインの原則を提案し, エージェント自身のステップに形式的セマンティクスを制約する。
- 参考スコア(独自算出の注目度): 4.342406076796542
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Output format is not a neutral implementation detail -- it can reorder model rankings, amplify or suppress individual model differences, and determine whether a coding agent succeeds or fails. We conducted a controlled single-round experiment with 3 models (DeepSeek V4, Doubao 2.0 Pro, Qwen 3.7 Max) x 3 output formats (full file, JSON Patch, unified diff) x 6 tasks x 20 repetitions, totaling 4,013 runs across 4 open-source projects. Only one project (tqdm) yielded non-zero success rates: dotenv, requests, and jsoup yielded zero successes in 2,551 runs. Our central finding is a format x model interaction with no universally optimal format. Doubao achieves 94% success with JSON Patch (Cohen's h = 1.57, p < 0.001), DeepSeek excels at unified diff (66%, h = 0.63), and Qwen shows a small but significant full-file preference (50%, h = 0.29, p < 0.05). Beyond these headline results, we identify a distinct failure mechanism -- format misuse -- where agents correctly diagnose a problem but execute it with excessive scope, most vividly when a one-line fix is applied as a full-file replacement. We propose a model-specific output strategy, a tool-design principle that constrains format semantics to the agent's own localization step, and release all data and templates for reproducibility. All experimental data are available at https://doi.org/10.5281/zenodo.21505157.
- Abstract(参考訳): アウトプットフォーマットは、中立的な実装の詳細ではなく、モデルのランキングをリオーダーし、個々のモデルの差異を増幅または抑制し、コーディングエージェントが成功するか失敗するかを決定することができる。
3つのモデル(DeepSeek V4、Doubao 2.0 Pro、Qwen 3.7 Max) x 3の出力フォーマット(フルファイル、JSONパッチ、統合diff) x 6のタスク x 20の繰り返し、合計4,013のオープンソースプロジェクトで実行しました。
1つのプロジェクト(tqdm)だけがゼロではない成功率を得た:dotenv、リクエスト、jsoupは2,551回の実行でゼロになった。
我々の中心的な発見は、普遍的に最適なフォーマットを持たない形式xモデルの相互作用である。
DoubaoはJSON Patch(Cohen's h = 1.57, p < 0.001)で94%の成功(Cohen's h = 1.57, p < 0.001)、DeepSeekは統合差分(66%, h = 0.63)で優れ、Qwenは小さいが重要なフルファイルの好み(50%, h = 0.29, p < 0.05)を示している。
ここでは、エージェントが問題を正しく診断し、過剰なスコープで実行する。最も鮮明なのは、1行の修正がフルファイルの置き換えとして適用される場合である。
本稿では, モデル固有の出力戦略, ツール設計の原則として, 形式意味論をエージェント自身のローカライゼーションステップに制約し, 再現性のためにすべてのデータとテンプレートを解放する手法を提案する。
すべての実験データはhttps://doi.org/10.5281/zenodo.21505157で利用可能である。
関連論文リスト
- Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions [0.0]
大規模言語モデルは、プラウシブルな量子コードを生成することができるが、ユーザが要求する特定のソフトウェア開発キット(SDK)バージョンを確実にターゲットできるかどうかは不明である。
本稿では,バージョン忠実度測定のベンチマークであるquantum-api-driftを紹介する。
Qiskitは、v0.43、v1.3、v2.0でかなりのインターフェース変更が行われた代表的量子SDKである。
論文 参考訳(メタデータ) (2026-07-05T01:16:12Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models [2.064923532131528]
デプロイされた言語モデルは、正しいものとフォーマットに準拠した出力を生成する必要がある。
本稿では,GSM8KとMATHという2つの数学的ベンチマークを用いて,この構造化出力信頼性ギャップについて検討する。
対象モデルへのブラックボックスAPIアクセスのみを必要とする反復的なシステムプロンプトであるAloLabを開発した。
論文 参考訳(メタデータ) (2026-05-04T09:07:44Z) - Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models [0.0]
解析データベースの自然言語クエリ用にデプロイされたLLMは、2つの障害に悩まされる。
ClickHouseのCleaned Contoso Retailデータセットに対して,100の自然言語質問に対して,3つのフロンティアLSMをベンチマークした。
論文 参考訳(メタデータ) (2026-04-28T02:53:23Z) - When Career Data Runs Out: Structured Feature Engineering and Signal Limits for Founder Success Prediction [0.0]
ファウンダーのキャリアデータからスタートアップの成功を予測することは難しい。
私たちは、生のフィールド(仕事、教育、出口)から直接構造化された28の機能を設計し、決定論的ルールレイヤとXGの強化された切り株を組み合わせました。
我々のモデルは、ゼロショットLCMベースラインに対するVal F0.5 = 0.3030, Precision = 0.3333, Recall = 0.2222 -- +17.7ppの改善を達成する。
論文 参考訳(メタデータ) (2026-04-01T00:28:53Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction [95.91743732150233]
一連のオープンソースの言語モデルであるGoedel-Prover-V2は、自動定理の新たな最先端を証明した。
我々は、より複雑な定理をマスターするためにモデルを訓練することの困難さを増す合成タスクを生成する。
Goedel-Prover-V2-32Bは、標準モードのpass@32でMiniF2Fの88.1%、自己補正モードの90.4%を達成する。
論文 参考訳(メタデータ) (2025-08-05T16:28:22Z) - ProofAug: Efficient Neural Theorem Proving via Fine-grained Proof Structure Analysis [50.020850767257095]
本稿では,LLMに様々な粒度で自動化手法を付加するProofAugを提案する。
本手法は,オープンソースのDeep-math-7bベースモデルとIsabelle証明アシスタントを用いて,MiniF2Fベンチマークで検証した。
また、ProofAugのLean 4バージョンを実装し、Kimina-Prover-seek-Distill-1.5Bのパス@1のパフォーマンスを44.3%から50.4%に改善します。
論文 参考訳(メタデータ) (2025-01-30T12:37:06Z) - APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets [99.8988504388011]
APIGenは、関数呼び出しアプリケーションのための検証可能な高品質データセットを合成するために設計された、自動データ生成パイプラインである。
APIGenを活用して、21のカテゴリにわたる3,673の実行可能なAPIを収集し、多様な関数呼び出しデータセットを生成します。
機能呼び出しエージェントドメインの分野を推し進めるため、6万の高品質なエントリを含むデータセットをリリースする。
論文 参考訳(メタデータ) (2024-06-26T17:49:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。