論文の概要: Imperfect Visual Verification for Code Edition : A Case Study on TikZ
- arxiv url: http://arxiv.org/abs/2606.15693v1
- Date: Thu, 09 Apr 2026 12:21:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.903705
- Title: Imperfect Visual Verification for Code Edition : A Case Study on TikZ
- Title(参考訳): コード版における不完全な視覚的検証 : TikZ を事例として
- Abstract要約: 問題の中心的困難を分離するケーススタディとしてTikZを使用します。
視覚的コードのカスタマイズを不完全なオラクルによる反復的な編集問題と定義する。
その結果,不完全な検証者でさえ,コードに視覚的指示を適用するかどうかを適度に判断し,F1スコアを最大0.815まで達成できることがわかった。
- 参考スコア(独自算出の注目度): 3.6213861298681826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs have significantly advanced code generation, enabling the synthesis of functional programs. While recent systems achieve strong performance on many coding benchmarks, tasks involving programs such as TikZ that generate visual artifacts remain challenging, in particular on visual code customization. Unlike generation from scratch, customization requires localized, semantics-preserving edits: the model must locate relevant code, modify it according to the instruction, and preserve the remaining structure and rendering. Approaches based on post-hoc iterative refinement/correction where a verifier provides feedback to guide corrections, have shown promise. However, in the case of programs with a visual outcome such as in TikZ, where correctness is harder or likely impossible to formalize and evaluate automatically, deterministic verifiers do not exist. Hence, developers can only rely on imperfect verifiers. In this paper, we conduct an empirical study to answer:to what extent can iterative refinement remain effective when the verifier itself is unreliable?} We use TikZ as a focused case study that isolates the core difficulties of the problem (weak code structure, fine-grained visual semantics, and difficult feature localization) in a controlled and challenging setting. We define visual code customization as an iterative editing problem with an imperfect oracle, and introduce a framework for analyzing such iterative refinements. We conduct a large-scale study and evaluate multiple LLM-based and tool-augmented visual verifiers within iterative refinement pipelines, and perform extensive manual annotation of refinement trajectories to assess verifier behavior and feedback quality. Our findings show that even imperfect verifiers can determine with moderate accuracy whether visual instructions are applied to code, achieving F1-scores up to 0.815. Feedback improves iterative refinement, especially for weaker models, adding 11--20 perfect customizations for Qwen3-vl-30b-a3b-Instruct, while stronger models like Gemini-3 gain fewer improvements (+5) but benefit more from accurate verification that prevents premature acceptance. Feedback is effective only when it precisely identifies image issues, provides actionable guidance, addresses all relevant problems, and remains grounded in the original instruction.
- Abstract(参考訳): LLMはコード生成が大幅に進歩し、関数プログラムの合成が可能となった。
近年のシステムでは多くのコーディングベンチマークにおいて高いパフォーマンスが達成されているが、TikZのような視覚的アーティファクトを生成するプログラムに関わるタスクは、特に視覚的コードのカスタマイズにおいて難しいままである。
スクラッチからの生成とは異なり、カスタマイズにはローカライズされたセマンティックス保存編集が必要であり、モデルは関連するコードを特定し、命令に従って修正し、残りの構造とレンダリングを保持する必要がある。
検証者が修正をガイドするためのフィードバックを提供する、ポストホック反復修正/補正に基づくアプローチは、有望であることを示している。
しかし、TikZのような視覚的結果を持つプログラムでは、正しさを形式化し、自動的に評価することが困難または不可能である場合、決定論的検証は存在しない。
したがって、開発者は不完全な検証にのみ依存することができる。
本稿では,検証者自体が信頼できない場合に,どの程度繰り返し改良が有効か,という実験的検討を行った。
問題の中心となる困難(コード構造、きめ細かい視覚的セマンティクス、そして難しい特徴ローカライゼーション)を、制御され、困難な環境で分離する、TikZのケーススタディとして使用しています。
視覚的コードのカスタマイズを不完全なオラクルによる反復的編集問題として定義し、そのような反復的洗練を解析するためのフレームワークを導入する。
大規模な研究を行い、反復精製パイプライン内の複数のLCMベースおよびツール拡張された視覚的検証器を評価し、検証器の挙動とフィードバック品質を評価するために、改良軌跡の広範囲な手作業によるアノテーションを実行する。
その結果,不完全な検証者でさえ,コードに視覚的指示を適用するかどうかを適度に判断し,F1スコアを最大0.815まで達成できることがわかった。
フィードバックにより、特に弱いモデルでは、Qwen3-vl-30b-a3b-Instructの11-20の完全カスタマイズが追加され、Gemini-3のようなより強力なモデルでは改善がより少ない(+5)が、早期の受け入れを妨げる正確な検証の恩恵を受ける。
フィードバックは、イメージの問題を正確に識別し、アクション可能なガイダンスを提供し、関連するすべての問題に対処し、元の命令に基礎を置いている場合にのみ有効である。
関連論文リスト
- RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists [12.810164698494281]
RepoProbeは、リポジトリレベルのコード理解を評価するための新しいベンチマークである。
本稿では,回答をアトミックで検証可能な事実に分解するチェックリストベースの検証プロトコルを提案する。
論文 参考訳(メタデータ) (2026-08-05T12:49:36Z) - Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback [13.976149104483449]
PAIR-Benchは、大規模言語モデル(LLM)を評価するためのプログレッシブベンチマークである。
不正確なプログラムや不完全なプログラムを、フィードバック誘導による改善によって、より正しいプログラムに変換する。
モデルがターゲットの障害を修復するかどうかを計測し、ヒントを超えて一般化し、すでに正しい振る舞いを保持し、どのくらいの助けが必要なのかを測定します。
論文 参考訳(メタデータ) (2026-07-01T18:20:27Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Vibe-Coding: Feedback-Based Automated Verification with no Human Code Inspection, a Feasibility Study [0.0]
本稿では, 集団適応システム(CAS)におけるLCM生成適応マネージャのフィードバックに基づく自動検証について検討する。
ループにおける検証の主な課題は、実行時に生成されたコードの障害を検出する方法と、それをレポートする方法である。
この結果から,プログラムスキルを持たないドメインエキスパートが設計したシステムにおいて,フィードバック精度が信頼性の高いビブ符号化の主要な要因であることが示唆された。
論文 参考訳(メタデータ) (2026-04-16T10:58:03Z) - Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints [17.818522356206977]
ほとんどの大規模言語モデル(LLM)ベースの修復システムは、修理中に固定された動作制約を扱います。
本稿では,Agent-CoEvoを提案する。Agent-CoEvoは共進化的マルチエージェントフレームワークで,候補コードパッチとテストパッチを共同で探索し,洗練する。
Agent-CoEvoは、修復の成功と再現性の両方において、最先端のエージェントベースとエージェントレスベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-06T10:26:46Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Readability-Robust Code Summarization via Meta Curriculum Learning [53.44612630063336]
現実の世界では、コードが貧弱な構造や難読化され、モデルのパフォーマンスが著しく低下することが多い。
本稿では,可読性の低いコードに対するコード要約の堅牢性を向上する,新しい微調整手法であるRoFTCodeSumを提案する。
論文 参考訳(メタデータ) (2026-01-09T02:38:24Z) - Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking [54.43083499412643]
言語モデルの生成能力をプロセス検証器と組み合わせたテストタイムアルゴリズムは、新しい推論能力を引き出すための有望なレバーを提供する。
提案手法は, 理論的に根拠付きバックトラックを用いて, 検証誤差に対して, 確実な堅牢性を実現するための新しいプロセス誘導型テスト時間サンプリングアルゴリズムであるVGBを導入する。
論文 参考訳(メタデータ) (2025-10-03T16:21:14Z) - EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing [170.71134330650796]
EdiVal-Agentは、命令ベースの画像編集のためのオブジェクト指向評価フレームワークである。
標準のシングルターンだけでなく、マルチターンの命令ベースの編集を精度良く評価するように設計されている。
EdiVal-Benchは、インコンテキスト、フローマッチング、拡散パラダイムにまたがる9つの命令タイプと13の最先端編集モデルをカバーするベンチマークである。
論文 参考訳(メタデータ) (2025-09-16T17:45:39Z) - Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset [0.0]
本稿では,22の大規模C/C++プロジェクトから得られた関数レベル修正の信頼性の高いベンチマークであるReDefを紹介する。
欠陥ケースはコミットの反転によって固定され、クリーンケースはポストホック履歴チェックによって検証される。
このパイプラインは3,164の欠陥と10,268のクリーンな修正をもたらし、既存のリソースよりも信頼性の高いラベルを提供する。
論文 参考訳(メタデータ) (2025-09-11T07:07:11Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - LLM Code Customization with Visual Results: A Benchmark on TikZ [6.3303908500560615]
我々は,協調的な視覚的成果を保ちながらコードをカスタマイズする大規模言語モデルの能力を評価する最初のベンチマークであるvTikZを紹介した。
我々のベンチマークは、慎重にキュレートされたvTikZ編集シナリオ、パラメータ化された基底真理、そして視覚フィードバックを利用して正当性を評価するレビューツールから構成されている。
論文 参考訳(メタデータ) (2025-05-07T08:26:54Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。