論文の概要: PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
- arxiv url: http://arxiv.org/abs/2607.01883v1
- Date: Thu, 02 Jul 2026 08:36:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.747034
- Title: PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
- Title(参考訳): PairCoder++: コード駆動型マルチモーダルおよび構造化アーティファクト生成のためのユニバーサルパラダイムとしてのペアプログラミング
- Authors: Junhao Chen, Xiang Li, Mingjin Chen, Boran Zhang, Henghaofan Zhang, Yibin Xu, Yuehan Cui, Fangsheng Weng, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao,
- Abstract要約: PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
- 参考スコア(独自算出の注目度): 51.92442051257354
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Code is the medium through which large language models generate structured artifacts: charts, scientific figures, vector graphics, CAD models, 3D scenes, and hardware designs are all produced by writing programs. In this regime single pass inference is brittle, because the compiler, renderer, or simulator that decides whether the artifact exists is invisible to the model. We present PairCoder, which grounds review in the toolchain and realizes it as two agent pair programming: a Driver agent writes the program, a Navigator agent reviews it against verification evidence (diagnostics, execution results, and renderings of the current artifact beside the target), and the two switch roles when errors persist. Across 17 public benchmarks and seven models from three vendors, PairCoder improves essentially every benchmark whose artifact is verifiable, on full official metric suites rather than execution alone (for example, Blender scene executability 0.20 to 0.78; TikZ compile rate up 10 to 30 points on every model), at 2.9 to 9.2 times single model cost (about 7 times overall). The improvements concentrate where the toolchain provides an informative oracle and the baseline leaves headroom, and the method ties or mildly regresses where the oracle is weak; we frame pair programming as a reliable recipe for verified code driven generation.
- Abstract(参考訳): コードは、大きな言語モデルが構造化されたアーティファクトを生成する媒体である:チャート、科学図形、ベクトルグラフィックス、CADモデル、3Dシーン、ハードウェアデザインはすべて、プログラムを書くことによって生成される。
このルールでは、アーティファクトが存在するかどうかを判断するコンパイラ、レンダラー、シミュレータがモデルに見えないため、シングルパス推論は不安定である。
PairCoderは、ツールチェーンのレビューを基盤として、プログラムを書くドライバエージェントと、検証証拠(診断、実行結果、ターゲットの横にある現在のアーティファクトのレンダリング)をレビューするナビゲータエージェントと、エラーが持続する際の2つのスイッチロールという、2つのエージェントペアプログラミングとして実現している。
17の公開ベンチマークと3つのベンダーの7つのモデルで、PairCoderは実行のみでなく、完全な公式なメトリックスイート(例えば、ブレンダーシーン実行可能性0.20から0.78; TikZコンパイルレートは各モデルで10から30ポイント)で、アーティファクトが検証可能なすべてのベンチマークを2.9から9.2倍(全体の7倍)で改善している。
改善は、ツールチェーンが情報的オラクルを提供し、ベースラインがヘッドルームを離れる場所に集中し、メソッドは、オラクルが弱い場所を結び付け、緩やかにリグレスします。
関連論文リスト
- CrackMeBench: Binary Reverse Engineering for Agents [3.93181912653522]
CrackMeBenchは、言語モデルエージェントを教育のリバースエンジニアリングタスクで評価するためのベンチマークである。
v0ベンチマークでは、8つのパブリックキャリブレーションCrackMesと、シードされたC、Rust、Goテンプレートから構築された12のメインスコアタスクを組み合わせる。
CrackMeBenchは pass@1 と pass@3 を記録し、リクエスト、ウォールクロック時間、コマンドトレース、ツールカテゴリ、プロバイダがレポートしたトークンの使用状況、推定コスト、定性的な障害ラベルを記録している。
論文 参考訳(メタデータ) (2026-05-11T14:01:36Z) - ProgramBench: Can Language Models Rebuild Programs From Scratch? [59.40748183470308]
ProgramBenchは、ソフトウェアエンジニアリングエージェントがソフトウェアをホリシックに開発する能力を測定する。
エンドツーエンドの動作テストはエージェント駆動ファジィによって生成される。
モデルは、人間が書いたコードと大きく異なるモノリシックでシングルファイルの実装を好む。
論文 参考訳(メタデータ) (2026-05-05T09:17:02Z) - 1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World [5.904589000032003]
実電子商取引を基盤としたベンチマークである1D-Benchを導入し、各インスタンスが参照レンダリングとエクスポート中間表現を提供する。
1Dは1日で短く、設計からコーディングまでのタスクを1日以内で効率的に完了する。
論文 参考訳(メタデータ) (2026-02-20T17:46:51Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - VisCoder2: Building Multi-Language Visualization Coding Agents [63.63232038173407]
可視化符号化エージェントを進化させるための3つの相補的なリソースを紹介する。
VisCoder2は、強力なオープンソースベースラインを著しく上回り、プロプライエタリなモデルのパフォーマンスにアプローチする。
論文 参考訳(メタデータ) (2025-10-24T18:03:57Z) - Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning [70.04746094652653]
機械学習論文を機能コードリポジトリに変換するフレームワークであるPaperCoderを紹介した。
PaperCoderは3つの段階で動作する。計画、図によるシステムアーキテクチャの設計、ファイル依存の特定、構成ファイルの生成である。
次に、モデルベースおよび人的評価の両方に基づいて、機械学習論文からコード実装を生成するPaperCoderを評価する。
論文 参考訳(メタデータ) (2025-04-24T01:57:01Z) - Stable Code Technical Report [7.303784606231683]
安定コード(Stable Code)は、コード補完、推論、数学、その他のソフトウェア工学ベースのタスクをターゲットにした汎用のベースコード言語モデルである。
安定的なコードインストラクションは、質問応答と命令ベースのタスクを実行するために、自然なチャットインターフェースでモデルと会話することを可能にする。
論文 参考訳(メタデータ) (2024-04-01T16:39:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。