論文の概要: MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification
- arxiv url: http://arxiv.org/abs/2608.03474v1
- Date: Tue, 04 Aug 2026 11:14:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.152878
- Title: MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification
- Title(参考訳): MT-Web2Code:マルチターン地域再構築と局所修正のためのベンチマーク符号化エージェント
- Abstract要約: MT-Web2Codeはマルチターンマクロレベル地域再構成とマイクロレベル局所化のための最初のマルチモーダルコーディングベンチマークである。
我々は、構造的およびスタイリスティックな欠陥を黄金のページに繰り返し注入するスケーラブルな逆回転軌道エンジンを開発した。
13のコーディングエージェントの実験では、現在のエージェントは影響を受けていないコンテンツを保存しながら、領域を忠実にターゲットするのに苦労し、局所的な編集のためにきめ細かいビジュアルコードアライメントを欠いている。
- 参考スコア(独自算出の注目度): 26.741669879220684
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in Large Vision-Language Models (LVLMs) have demonstrated impressive capabilities in web UI generation. However, existing benchmarks predominantly focus on single-turn full-page generation from scratch, overlooking the iterative workflow of real-world frontend engineering, where developers repeatedly reconstruct missing regions and modify localized elements within existing codebases. To bridge this gap, we introduce MT-Web2Code, the first multimodal coding benchmark for multi-turn Macro-Level Regional Reconstruction and Micro-Level Localized Modification, which contains 102 tasks spanning 16 vertical domains. To construct deterministic repair trajectories without costly turn-level human annotation, we develop a scalable Reverse-Corruption Trajectory Engine that iteratively injects structural and stylistic defects into golden pages. We further propose a dual-axis evaluation protocol that measures target-region fidelity and the preservation of unaffected content, where regional reconstruction is assessed by a 5-dimensional VLM-based rubric and localized modification by deterministic pixel-grounded alignment. Experiments on 13 frontier coding agents reveal that current agents struggle to faithfully reconstruct target regions while preserving unaffected content, lack fine-grained visual-code alignment for localized edits, and suffer from error snowballing over multiple turns. Beyond benchmarking, our deterministic evaluation metrics provide fine-grained feedback signals that may facilitate future research on training iterative UI coding agents. Our evaluation code and data will soon be released.
- Abstract(参考訳): LVLM(Large Vision-Language Models)の最近の進歩は、Web UI生成における印象的な機能を示している。
しかし、既存のベンチマークはスクラッチからシングルターンフルページ生成に重点を置いており、現実世界のフロントエンドエンジニアリングの反復ワークフローを見落としている。
このギャップを埋めるために、MT-Web2Codeは、マルチターンマクロレベル地域再構成とマイクロレベル局所化のための最初のマルチモーダルコーディングベンチマークであり、16の垂直領域にまたがる102タスクを含む。
コストのかかるターンレベルの人的アノテーションを使わずに決定論的補修軌道を構築するために,構造的およびスタイリスティックな欠陥を黄金のページに繰り返し注入するスケーラブルな逆回転軌道エンジンを開発した。
さらに, 対象領域の忠実度と未影響コンテンツの保存度を測定し, 5次元のVLMベースルーリックを用いて地域再構成を評価し, 決定論的画素グラウンドアライメントにより局所的な修正を行う2軸評価プロトコルを提案する。
13のフロンティアコーディングエージェントの実験では、現在のエージェントは、影響のないコンテンツを保存しながら、ターゲット領域を忠実に再構築するのに苦労し、局所的な編集のためのきめ細かいビジュアルコードアライメントが欠如し、複数回にわたるエラースノーボールに悩まされていることが明らかになった。
ベンチマーク以外にも、私たちの決定論的評価指標は、繰り返しUIコーディングエージェントのトレーニングを後押しする、きめ細かいフィードバック信号を提供します。
評価コードとデータも間もなく公開される予定です。
関連論文リスト
- Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation [147.1183324267404]
ローカルコード編集は、レイアウト、スタイル、コンポーネントの依存関係を通じて伝搬し、以前は忠実だった領域を劣化させながら、1つの視覚的ミスマッチを修正する。
本稿では,視覚フィードバックを構造化された視覚再生コンテキストとして表現するために,ルーブリックを用いたルーブリック誘導フレームワークであるRubSEを紹介する。
RubSEは最終ラウンドおよび最高ラウンド設定での自己進化を著しく上回り、より安定した改良とより高い軌道レベルの性能天井を実現する。
論文 参考訳(メタデータ) (2026-08-25T07:03:46Z) - EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization [9.547789251222838]
ビジュアルクエリローカライゼーション(VQL)は、エゴセントリックなビデオでクエリ対象を検索し、再ローカライズすることを目的としている。
人間の視覚は階層的なプロセスを通じてあいまいさを扱う。
我々は,VQL-2DとVQL-3Dの統一フレームワークである textbfEgoHieraLoc を提案する。
論文 参考訳(メタデータ) (2026-08-10T14:31:01Z) - PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents [62.36339598951133]
PhoenixRepairは、複数の候補編集場所を探索し、より良いパッチを生成するマルチエージェントフレームワークである。
PhoenixRepairはDeepSeek-V3.1の下でSWE-agentよりも7.8%の最大の相対的改善を実現し、MiniMax-M2.5で76.0%のPass@1の最高分解率を達成した。
論文 参考訳(メタデータ) (2026-07-21T08:49:30Z) - SwinAD: Multi-stage feature reconstruction for unsupervised industrial anomaly detection [0.0]
SwinADは、マルチクラスの教師なし異常検出のための再構成ベースのフレームワークである。
階層エンコーダは意味的にリッチなマルチスケール機能を提供する。
特徴多様性保存再構築フレームワークは相補的な再構築仮説を維持している。
論文 参考訳(メタデータ) (2026-07-16T03:39:56Z) - Deep Unrolled Networks in Representation Space Applied to MRI Reconstruction [1.2806323642084227]
ディープ・ネットワーク(DUN)は、物理フォワードモデルと学習された正規化をカスケードネットワークアーキテクチャに統合する。
本稿では,学習した表現空間を操作しながら,物理測定の厳密性を維持するフレームワークであるDUNEを紹介する。
論文 参考訳(メタデータ) (2026-06-19T17:01:41Z) - Beyond Binary Success: A Diagnostic Meta-Evaluation Framework for Fine-Grained Manipulation [98.79811866787263]
診断メタ評価フレームワークであるMetaFineを紹介する。
局所的な空間構造を保存できる視覚エンコーダの能力は,きめ細かな精度の鍵となるボトルネックである。
評価をランキングから診断にシフトすることで、MetaFineは、ベンチマークを実際の物理デキスタリティに基づく階層化された能力の修復のための実行可能なコンパスに変換する。
論文 参考訳(メタデータ) (2026-05-19T15:25:13Z) - Align then Refine: Text-Guided 3D Prostate Lesion Segmentation [5.284052813431228]
体積法は、解剖学的整合性を確保しながら複数のモードを組み合わせる必要がある。
現在のモデルは、クロスモーダル情報を確実に統合するのに苦労している。
3つの重要なイノベーションを取り入れた新しいマルチエンコーダU-Netアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-20T18:13:52Z) - WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models [40.87133775066985]
我々はWebエンジニアリング能力のライフサイクルを統一的に評価するマルチモーダル・ベンチマークであるWebを紹介した。
Webは3つの入力モード(テキスト、画像)と3つのタスクタイプ(生成、編集、修復)にまたがる
評価のために,チェックリストに誘導されたLDM-as-a-Judgeプロトコルを採用し,実際のブラウザで自動生成されたWebサイトを生成するための新しいエージェント-as-a-Judgeパラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-20T13:09:38Z) - Seeing the Unseen: Mask-Driven Positional Encoding and Strip-Convolution Context Modeling for Cross-View Object Geo-Localization [8.559240391514063]
クロスビューオブジェクトジオローカライゼーションは、クロスビューマッチングによる高精度オブジェクトローカライゼーションを可能にする。
既存の手法はキーポイントに基づく位置符号化に依存しており、オブジェクトの形状情報を無視しながら2次元座標のみをキャプチャする。
空間座標と物体シルエットの両方を捕捉するために分割マスクを利用するマスクベースの位置符号化方式を提案する。
EDGeoは、堅牢なクロスビューオブジェクトジオローカライズのためのエンドツーエンドフレームワークである。
論文 参考訳(メタデータ) (2025-10-23T06:07:07Z) - Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling [50.8215545241128]
私たちはaを提案します。
境界モデリングネットワーク(HBMNet)には、オーディオ・ビジュアル・フィーチャー(Audio-Visual Feature)という3つのモジュールが含まれている。
粗提案発電機と微細階層確率発生装置
モダリティの観点からは、フレームレベルの監督によって強化されたオーディオ・ビジュアル・エンコーディングと融合を強化する。
実験により、符号化と融合が主に精度を向上し、フレームレベルの監視リコールが可能であることが示された。
論文 参考訳(メタデータ) (2025-08-04T02:41:09Z) - Mixture-of-Noises Enhanced Forgery-Aware Predictor for Multi-Face Manipulation Detection and Localization [52.87635234206178]
本稿では,多面的操作検出と局所化に適したMoNFAPという新しいフレームワークを提案する。
このフレームワークには2つの新しいモジュールが含まれている: Forgery-aware Unified Predictor (FUP) Module と Mixture-of-Noises Module (MNM)。
論文 参考訳(メタデータ) (2024-08-05T08:35:59Z) - In-Domain GAN Inversion for Faithful Reconstruction and Editability [132.68255553099834]
ドメイン誘導型ドメイン正規化とエンコーダで構成されたドメイン内GANインバージョンを提案し、事前学習されたGANモデルのネイティブ潜在空間における反転コードを正規化する。
エンコーダ構造,開始反転点,および逆パラメータ空間の効果を総合的に解析し,再構成品質と編集特性とのトレードオフを観察する。
論文 参考訳(メタデータ) (2023-09-25T08:42:06Z) - DETR Doesn't Need Multi-Scale or Locality Design [69.56292005230185]
本稿では,"プレーン"特性を維持できる改良型DETR検出器を提案する。
特定の局所性制約を伴わずに、単一スケールの機能マップとグローバルなクロスアテンション計算を使用する。
マルチスケールな特徴マップと局所性制約の欠如を補うために,2つの単純な技術が平易な設計において驚くほど効果的であることを示す。
論文 参考訳(メタデータ) (2023-08-03T17:59:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。