論文の概要: VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair
- arxiv url: http://arxiv.org/abs/2607.14075v1
- Date: Wed, 15 Jul 2026 17:48:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.853542
- Title: VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair
- Title(参考訳): VisualRepair: ビジュアルソフトウェア問題修正のための動的ツールコールとリージョンフォーカス
- Authors: Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu,
- Abstract要約: 画像型認識ツールコール(ITTC)と動的テスト時間領域フォーカス(DTRF)の2つのコアモジュールからなるMLLMベースのビジュアルソフトウェア問題修復フレームワークを提案する。
SWE-bench Multimodalベンチマークの実験は、VisualRepairが一貫して最先端のアプローチより優れていることを示した。
- 参考スコア(独自算出の注目度): 39.86483414759863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated Program Repair (APR) has witnessed significant progress with the advent of Large Language Models (LLMs). However, as modern software systems increasingly expose rich graphical user interfaces, effectively leveraging visual information from bug screenshots has become essential for understanding bugs and generating accurate fixes in multimodal scenarios. Real-world issue reports frequently contain heterogeneous visual attachments including UI screenshots, IDE snapshots, GIFs, and text-centric images, each with distinct visual patterns and domain-specific semantics that impose substantial perceptual demands on MLLMs. Furthermore, bug screenshots often contain large expanses of uninformative and bug-irrelevant regions, distracting the model's attention and limiting patch diversity. To address these challenges, we propose VisualRepair, an MLLM-based framework for visual software issue repair comprising two core modules: Image Type-aware Tool Calling (ITTC), which classifies input images and dynamically invokes a tailored tool-calling chain for robust visual interpretation, and Dynamic Test-time Region Focusing (DTRF), which grounds multiple bug-related region candidates and refines them via an adaptive zoom-in and zoom-out strategy to improve fault localization and promote diverse patch generation. Extensive experiments on the SWE-bench Multimodal benchmark demonstrate that VisualRepair consistently outperforms state-of-the-art approaches. VisualRepair resolves 196 and 25 instances on the test and dev sets, respectively, surpassing the best baseline by 10 and 11 instances. These results highlight the effectiveness of type-aware visual understanding and region-focused localization for automated visual software issue repair.
- Abstract(参考訳): APR(Automated Program repair)は、LLM(Large Language Models)の出現によって大きく進歩した。
しかし、現代のソフトウェアシステムがリッチなグラフィカルユーザインタフェースをますます公開するにつれて、バグのスクリーンショットから視覚情報を効果的に活用することは、バグを理解し、マルチモーダルシナリオで正確な修正を生成するために欠かせないものとなっている。
現実のイシューレポートには、UIスクリーンショット、IDEスナップショット、GIF、テキスト中心の画像など、さまざまな視覚的アタッチメントが含まれており、それぞれに異なる視覚パターンとドメイン固有のセマンティクスがあり、MLLMに対してかなりの知覚的要求を課している。
さらに、バグスクリーンショットには、非形式的かつバグ非関連な領域が多数含まれており、モデルの注意をそらし、パッチの多様性を制限していることが多い。
画像型認識ツールコール(ITTC)は入力イメージを分類し、ロバストな視覚解釈のための調整されたツールコールチェーンを動的に呼び出すもので、動的テスト時間領域フォーカス(DTRF)は複数のバグ関連領域候補を基盤として、適応的なズームインとズームアウト戦略によってそれらを洗練し、障害のローカライゼーションを改善し、多様なパッチ生成を促進する。
SWE-bench Multimodalベンチマークの大規模な実験は、VisualRepairが一貫して最先端のアプローチより優れていることを示している。
VisualRepairは、テストセットと開発セットの196インスタンスと25インスタンスをそれぞれ解決し、最高のベースラインを10インスタンスと11インスタンスに越えている。
これらの結果は、自動視覚ソフトウェア問題修復における、型認識型視覚理解と地域中心の局所化の有効性を強調した。
関連論文リスト
- GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair [40.228155198574356]
本稿では,マルチモーダル自動プログラム修復(APR)を暗黙的な意味的推測から明示的な構造的推論に移行するフレームワークであるGALAを提案する。
GALAは、まずイメージUIグラフを構築して、視覚要素とその構造的関係をキャプチャし、続いて、このUIグラフをリポジトリレベルの構造と相互参照することで、ファイルレベルのアライメントを実行する。
モダリティ間のセマンティクスとリレーショナルの整合性を強制することにより、GALAは高度に正確なビジュアル・ツー・コードマッピングを確立する。
論文 参考訳(メタデータ) (2026-04-09T11:06:25Z) - FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair [45.42550492783294]
MAPR(Multimodal Automated Program repair)は、ソースコード、テキストのイシュー記述、GUIスクリーンショットなどのビジュアルアーティファクトを共同で推論することを要求することで、従来のプログラム修復を拡張している。
我々は,3つの主要なメカニズムを統合したマルチモーダル修復フレームワークであるFailureMemを提案する。これは,構造的ローカライゼーションとフレキシブルな推論とをバランスさせるハイブリッドワークフローエージェントアーキテクチャ,領域レベルの視覚的接地を可能にするアクティブな認識ツール,過去の修復の試みを再利用可能なガイダンスに変換するFailure Memory Bankである。
論文 参考訳(メタデータ) (2026-03-18T15:24:22Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - Chatting with Images for Introspective Visual Thinking [50.7747647794877]
「画像の変更」は、視覚操作を言語誘導の機能変調として再編成する新しいフレームワークである。
表現型言語プロンプトの指導の下で、モデルは複数の画像領域上で動的に共同再符号化を行う。
ViLaVTは、複雑なマルチイメージとビデオベースの空間推論タスクにおいて、強力で一貫した改善を実現する。
論文 参考訳(メタデータ) (2026-02-11T17:42:37Z) - SVRepair: Structured Visual Reasoning for Automated Program Repair [17.545585659174773]
大規模言語モデル(LLM)は、最近、APR(Automated Program repair)の強力な可能性を示している。
構造化された視覚表現を持つマルチモーダルAPRフレームワークである textbfSVRepair を提案する。
SVRepairはまず視覚言語モデルであるtextbfStructured Visual Representation (SVR) を微調整し、不均一な視覚的アーティファクトをアンフェマティックなシーングラフに変換する。
論文 参考訳(メタデータ) (2026-02-05T06:26:46Z) - Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing [41.75392938686494]
大規模言語モデル-(LLM)ベースの自動プログラム修正(APR)技術は、現実のGitHubの課題を解決する上で有望な結果を示している。
これらの自律システムは、視覚情報の解釈と活用の制限により、マルチモーダルな問題のシナリオを解決するのに苦労する。
GUIRepairは,視覚情報を理解し,取得することで,多モーダルな問題シナリオを解決するための多モーダルな推論手法である。
論文 参考訳(メタデータ) (2025-06-19T08:42:11Z) - Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining [67.87810796668981]
インフォメーション・インフォメーション・インフォメーション・クロッピング(ISC)と自己精製デュアルラーニング(SRDL)
Irisは850KのGUIアノテーションだけで、複数のベンチマークで最先端のパフォーマンスを実現している。
これらの改善は、WebとOSエージェントの両方の下流タスクで大幅に向上した。
論文 参考訳(メタデータ) (2024-12-13T18:40:10Z) - More Pictures Say More: Visual Intersection Network for Open Set Object Detection [4.206612461069489]
オープンセットオブジェクト検出(VINO)のための強力なDETRモデルであるVisual Intersection Networkを導入する。
VINOは、すべての時間ステップにまたがるカテゴリのセマンティックな交差を保存するために、マルチイメージのビジュアルバンクを構築する。
提案手法は,対象カテゴリ意味論と領域意味論のより正確な一致を保証するとともに,事前学習時間とリソース要求を著しく低減する。
論文 参考訳(メタデータ) (2024-08-26T05:52:35Z) - Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark [63.296342841358815]
大規模マルチモーダルモデル(LMM)は、単一画像に対する視覚的質問応答において大きな進歩を遂げている。
多数の視覚トークンを処理する能力は、複数画像の質問応答に対する効果的な検索と推論を保証するものではない。
オープンソースで軽量なビジュアルRAGフレームワークであるMIRAGEを導入し、単一の40G A100 GPU上で最大10Kイメージを処理する。
論文 参考訳(メタデータ) (2024-07-18T17:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。