論文の概要: ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable Correspondence
- arxiv url: http://arxiv.org/abs/2609.01344v1
- Date: Tue, 01 Sep 2026 14:52:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.781456
- Title: ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable Correspondence
- Title(参考訳): ExBind:ビジュアルから実行可能対応のための制御された診断ベンチマーク
- Authors: Ziqian Wang, Yuxiao Cheng, Tingxiong Xiao, Jinli Suo,
- Abstract要約: ExBindはセマンティックローカライゼーションとアクション実行の間の制御された診断ベンチマークである。
表現に依存しない遅延バインディングインスタンスをサンプリングし、SVG、DOM、canvas、tree、 graph、テーブルケースにコンパイルする。
リリースには250ケースのワイドスイート、240ケースのターゲットスイート、50ペアのラテントグループが含まれている。
- 参考スコア(独自算出の注目度): 25.750916054932294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal coding and editing systems must map a visible or semantic referent to the exact executable object that can be edited. A wrong reference may select a valid but incorrect DOM node, SVG element, graph endpoint, hierarchy member, or table cell, while final execution success alone does not reveal the source of the failure. ExBind isolates this visual-to-executable correspondence layer as a controlled diagnostic benchmark between semantic localization and action execution. It samples representation-independent latent binding instances and compiles them into SVG, DOM, canvas, tree, graph, and table cases with deterministic mappings to executable references. Models output only a strict reference; the evaluator maps predictions back to latent structure and scores structural constraints without requiring reasoning traces. The release contains a 250-case broad suite, a disjoint 240-case targeted suite, and 50 paired latent groups. Qwen2.5-VL-3B achieves 98.4% candidate validity but 76.4% exact accuracy, while Qwen3-VL-4B achieves 100.0% validity and 98.8% exact accuracy. In the targeted table suite, all Qwen2.5-VL-3B residual errors are valid correct-row/wrong-column selections. Candidate-order perturbations change case-level outcomes while preserving this error pattern. ExBind is designed for controlled diagnosis rather than population-scale ranking or end-to-end editing evaluation. Code and benchmark records are available at https://github.com/Daerwang2020/Exbind and https://huggingface.co/datasets/Ziqianwwww/ExBind.
- Abstract(参考訳): マルチモーダルコーディングと編集システムでは、可視的または意味論的参照を、編集可能な正確な実行可能なオブジェクトにマッピングしなければならない。
間違った参照は有効なDOMノード、SVG要素、グラフエンドポイント、階層メンバ、テーブルセルを選択することができる。
ExBindは、セマンティックローカライゼーションとアクション実行の間の制御された診断ベンチマークとして、この視覚から実行可能な対応層を分離する。
表現に依存しない遅延バインディングインスタンスをサンプリングし、SVG、DOM、canvas、tree、 graph、テーブルケースにコンパイルし、決定論的に実行可能な参照にマッピングする。
モデルは厳密な参照のみを出力し、評価者は予測を潜在構造にマッピングし、推論トレースを必要とせずに構造的制約をスコアする。
リリースには250ケースのワイドスイート、240ケースのターゲットスイート、50ペアのラテントグループが含まれている。
Qwen2.5-VL-3B は 98.4% の正解率は 76.4% 、Qwen3-VL-4B は 100.0% の正解率は 98.8% である。
対象とするテーブルスイートでは、すべてのQwen2.5-VL-3B残差エラーが正しい行/列列選択である。
候補順の摂動は、このエラーパターンを保持しながらケースレベルの結果を変える。
ExBindは、集団規模のランキングやエンドツーエンドの編集評価よりも、診断を制御するように設計されている。
コードとベンチマーク記録はhttps://github.com/Daerwang2020/Exbindとhttps://huggingface.co/datasets/Ziqianwwww/ExBindで入手できる。
関連論文リスト
- MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces [2.894286977279531]
本研究は,企業検証アーキテクチャが要求を監査しつつ,インターフェース障害,タスク能力,ポリシー適合性,整合性を分離できるかどうかを検討する。
BeTaL-GBI v0.2 は LLM-in-the-loop を2,218,750,380 以上のグリッドポイントで適用し、条件付き性能からフォーマットの入力を分離する。
512の総合的なタスクにおいて、16ゲートポリシーは、116の激しい矛盾を全て検出し、99のクリーンレコードを全て受け入れる。幻覚剤とエビデンスフォーガーサロゲートは無音のプロモーションでブロックされる。
論文 参考訳(メタデータ) (2026-08-21T16:52:38Z) - Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems [0.815557531820863]
Onto-EV-WMは、EV-WMの上に重ねられた診断および検証-ゲート補正インタフェースである。
Onto-EV-WMは8,526のタスクで成功し、スイートレベルの成功率はLIBERO-10で65.98%、LIBERO-Goalで91.39%、LIBERO-ObjectとLIBERO-Spatialで91.38%であった。
論文 参考訳(メタデータ) (2026-08-14T03:13:57Z) - A Reproducibility Protocol for Cross-Implementation Evaluation of Post-Quantum ACVP Test Vectors [0.0]
本研究ではNIST ML-KEMの3つの公開実装のための製品中立プロトコルを定義する。
Protocol v2はプロバイダ固有の機能を凍結し、1つのバリデーションエラーを対称に適用し、選択されたすべてのケースを保存し、バイト、バリデーションバリデーション、サポートされた操作、アダプタエラーを分離する。
論文 参考訳(メタデータ) (2026-08-13T21:29:59Z) - From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing [50.70862449978062]
最近の文書では OmniDocBench v1.6 の 93 以上の TEDS スコアが達成されている。
このギャップを定量化するために、916の現実世界のテーブルの診断ベンチマークであるTableParseMapを紹介します。
論文 参考訳(メタデータ) (2026-08-10T16:59:30Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets [0.0]
言語モデルベンチマークは、2つの異なる測定質問を1つの精度スコアに分解する。
スコアラーに依存しない実行証拠を分離する2層評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-27T11:04:17Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - CYGNET: Cypher Gate for Neural Execution Triage and Cost Containment [0.0]
クエリ生成と運用用Neo4jデータベースの間に,事前実行ゲートを設置する。
ゲートは、ミラーグラフに対する実行が5.6msの中央遅延で終わる4つのバックチェーンを通して構造を検証する。
7つのCypherBenchスキーマ(2348の質問、ACL 2025)では、パイプラインはテスト対象のモデル毎に生成精度を維持し、安全な防御層として動作することを確認した。
論文 参考訳(メタデータ) (2026-06-03T09:13:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。