論文の概要: Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations
- arxiv url: http://arxiv.org/abs/2608.09268v1
- Date: Mon, 10 Aug 2026 08:24:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.147644
- Title: Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations
- Title(参考訳): 符号化エージェントは、レポジトリレベル問題をレンダリングコードで解決できるか? : 視覚表現の探索的研究
- Abstract要約: 本稿では,画像のレンダリングがエージェントコーディングの運用コンテキストとして機能するかどうかを検討する。
レンダリングされたコードは、プロンプトトーケンコストを一貫して削減するが、その節約率は、ビジュアル圧縮比と直線的に増加しない。
主にエンドツーエンドの修理精度を保っていますが、基盤となるモデルやエージェントアーキテクチャのパフォーマンス制限を克服することはできません。
- 参考スコア(独自算出の注目度): 30.48772161139388
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual modality has recently been explored as a way to compress textual tokens, including rendering code as images for static code understanding. We study whether this representation can serve as operational context for agentic coding, where an agent must navigate repositories, edit source files, and verify executable patches. Using SWE-bench Verified, we evaluate rendered code in repository-level repair workflows and introduce controlled agent settings to separate unguided repository exploration from more structured repair stages. Our results show a mixed picture. Rendered code consistently reduces prompt-token cost, but the savings do not increase linearly with the nominal visual compression ratio. It largely preserves end-to-end repair accuracy, but does not overcome the performance limits of the underlying model or agent architecture, and can become unstable under aggressive compression. Further analysis suggests that visual code is most useful when raw source reading is a major bottleneck; once repository localization is structured, much of the remaining cost comes from patch--test trial-and-error, where visual compression has limited leverage. Overall, our study positions rendered code as a viable but conditional compression mechanism for realistic coding agents.
- Abstract(参考訳): 静的コード理解のためのイメージとしてのコードレンダリングを含む、テキストトークンを圧縮する方法として、最近ビジュアルモダリティが検討されている。
エージェントはリポジトリをナビゲートし、ソースファイルを編集し、実行可能なパッチを検証する必要がある。
SWE-bench Verifiedを用いて、レポジトリレベルの修復ワークフローでレンダリングされたコードを評価し、制御されたエージェント設定を導入し、非ガイドのリポジトリ探索をより構造化された修復段階から分離する。
私たちの結果は混ざった絵を示している。
レンダリングされたコードは、プロンプトトーケンコストを一貫して削減するが、その節約は、名目的な視覚的圧縮比と直線的に増加しない。
主にエンドツーエンドの修理精度を保っているが、基盤となるモデルやエージェントアーキテクチャのパフォーマンス制限を克服することはできず、アグレッシブな圧縮の下で不安定になる可能性がある。
リポジトリのローカライゼーションが構造化されれば、残りのコストの多くは、ビジュアル圧縮が限られたレバレッジを持つパッチ・テスト・アンド・エラーによるものだ。
本研究は,現実的な符号化エージェントのための実効的だが条件付き圧縮機構として,コードの位置を定めている。
関連論文リスト
- RepoAtlas: Guiding Coding Agents via Evolving Multimodal Repository Views [14.618487825419328]
textbfRepoAtlasは、マルチモーダルリポジトリビューの進化を維持するトレーニング不要なモジュールである。
RepoAtlasは、問題の証拠とエージェントの現在の調査状態を組み合わせることで、一定の予算の下でタスク関連領域を選択する。
我々は,SWE-bench Verified上でRepoAtlasを評価し,入力トークンとモデルコールを平均5.8%,7.8%削減し,解決率を2.4ポイント改善した。
論文 参考訳(メタデータ) (2026-09-15T10:11:51Z) - TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents [54.88208747581851]
トレーニング不要のビジュアルトークンプルーニングは、このコストを削減することができるが、キャッシュ再利用には基本的な制約が伴う。
我々は,emphtextbfTrajectory-textbfrobust textbfAdmission と textbfCoverage-aware textbfEvidence ordering のためのトレーニング不要フレームワーク textbfmethod を提案する。
論文 参考訳(メタデータ) (2026-09-09T15:12:48Z) - CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding [13.113776703707634]
CodeShrinkは適応的なビジュアル圧縮フレームワークで、3つのコンポーネントがある。
Blank-Free Renderingは、ホワイトスペースに依存したレイアウトを、コンパクトなレイアウトと明示的な構造マーカーに置き換え、レイアウトによって引き起こされるトークンを削除する。
支配的トークン選択は、推論中にタスク非関連な視覚トークンをプーンするために、命令とコードイメージを共同で解析する。
論文 参考訳(メタデータ) (2026-07-31T17:15:51Z) - LLM Agents Can See Code Repositories [14.881212557304414]
大規模言語モデルを利用したコーディングエージェントは、ソフトウェア工学のタスクに強いパフォーマンスを示してきた。
ほとんどのエージェントは、ほとんど完全にテキストとしてリポジトリを消費します。
標準テキストインタフェースと並行して、リポジトリ構造を視覚的に表現することで、エージェントは構造をより効率的に理解できるようになる。
論文 参考訳(メタデータ) (2026-06-12T03:14:40Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases [0.0]
BUILD-AND-FINDは、下流エージェントが生成されたリポジトリから意図した選択を復元できるかどうかを評価するプロトコルである。
各タスクに対して、ビルダーは隠されたリポジトリの仕様を見て、仕様に書かれた複数選択の質問バンクを作成します。
このプロトコルは、行動の正しさをアーティファクト側のリカバリから切り離し、リカバリの正確性、再現性、実装のカバレッジ、検査の労力を報告します。
論文 参考訳(メタデータ) (2026-05-07T12:35:27Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Learning to Commit: Generating Organic Pull Requests via Online Repository Memory [11.042326503752756]
大きな言語モデル(LLM)ベースのコーディングエージェントは、制御されたベンチマークで印象的な結果を得るが、実際のメンテナが拒否するプルリクエストを定期的に生成する。
オンラインリポジトリメモリを通じてこのギャップを埋めるフレームワークであるLearning to Commitを紹介します。
論文 参考訳(メタデータ) (2026-03-27T17:58:56Z) - RECODE: Reasoning Through Code Generation for Visual Question Answering [68.86938437188964]
我々は、検証可能な視覚的推論のための新しいモダリティとして、視覚を実行可能コードにリバースエンジニアリングするプロセスであるデレンダリングを活用することを提案する。
我々の研究は、実行可能コードにおける視覚的認識の基盤が、より正確で検証可能なマルチモーダル推論への新たな道を提供することを示した。
論文 参考訳(メタデータ) (2025-10-15T17:05:37Z) - Dense Retrievers Can Fail on Simple Queries: Revealing The Granularity Dilemma of Embeddings [65.31723739561151]
埋め込みは、エンコードされたセマンティクス内のきめ細かいエンティティやイベントを認識できないかもしれない。
本稿では,新たな評価データセットであるCapRetrievalを導入し,文節は画像キャプションであり,クエリはエンティティやイベントの概念を多種多様な形式でターゲットとするフレーズである。
我々は提案したデータ生成戦略でエンコーダを微調整し、小さな0.1Bエンコーダで最先端の7Bモデルを上回る性能を実現した。
論文 参考訳(メタデータ) (2025-06-10T09:00:33Z) - RepoCoder: Repository-Level Code Completion Through Iterative Retrieval
and Generation [96.75695811963242]
RepoCoderはリポジトリレベルのコード補完プロセスを合理化するフレームワークである。
類似性ベースのレトリバーと、事前訓練されたコード言語モデルが組み込まれている。
バニラ検索で拡張されたコード補完アプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2023-03-22T13:54:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。