論文の概要: Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
- arxiv url: http://arxiv.org/abs/2607.19790v1
- Date: Wed, 22 Jul 2026 06:17:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.989846
- Title: Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
- Title(参考訳): トレース:マルチドメインビジュアル推論のための分類誘導環境
- Authors: Md Tanvirul Alam,
- Abstract要約: トレースは、マルチドメインの視覚的推論のための分類誘導環境である。
共有セマンティックステートは、レンダリングされた画像、プロンプト、型付き回答、検証状態、再生可能なインスタンストレースを決定する。
- 参考スコア(独自算出の注目度): 1.7767466724342065
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has substantially improved language-model reasoning, yet its extension to vision-language models remains constrained by the lack of training data that are simultaneously broad, exactly verifiable, and reproducible. We introduce Trace, a taxonomy-guided environment for multidomain visual reasoning. Trace factorizes task construction into a scene grammar and an executable task program, separating visual realization from answer computation. A shared semantic state determines the rendered image, prompt, typed answer, verifier state, and replayable instance trace. The resulting environment comprises 1,000 tasks over 277 scene grammars and 11 visual domains, with controlled semantic and visual variation. RLVR on 64,000 Trace instances improves the macro-average across 24 external benchmarks by 3.51 percentage points for Qwen2.5-VL-3B and 4.06 points for Qwen2.5-VL-7B, providing evidence that broad procedural training can transfer beyond the generated task distributions. Project page: https://maveryn.github.io/trace/.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は言語モデル推論を大幅に改善したが、そのビジョン言語モデルへの拡張は、同時に広く、正確に検証可能で再現可能なトレーニングデータの欠如によって制約を受け続けている。
マルチドメイン視覚推論のための分類誘導環境であるTraceを紹介する。
Traceはタスク構築をシーン文法と実行可能なタスクプログラムに分解し、応答計算から視覚的実現を分離する。
共有セマンティックステートは、レンダリングされた画像、プロンプト、型付き回答、検証状態、再生可能なインスタンストレースを決定する。
277のシーン文法と11の視覚領域に1000のタスクがあり、セマンティックと視覚的バリエーションが制御されている。
64,000のトレースインスタンス上のRLVRは、Qwen2.5-VL-3Bで3.51ポイント、Qwen2.5-VL-7Bで4.06ポイント、24の外部ベンチマークでマクロ平均を改善し、広範囲の手続き的トレーニングが生成されたタスク分布を超えて転送可能であることを示す証拠を提供する。
プロジェクトページ: https://maveryn.github.io/trace/。
関連論文リスト
- Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence [31.954261925882452]
このサーベイは、視覚的に接地された入力と出力の下でコードを生成し、編集し、洗練し、理屈を定めているシステムを調べます。
まず、コードが各タスクで果たす役割によってフィールドを定式化します。
次に、ベンチマークとメソッドをグラフィカルユーザインタフェース、システミックビジュアライゼーション、構造化グラフィックス、フロンティアタスクとフレームワークの4つのドメインにまとめます。
論文 参考訳(メタデータ) (2026-06-14T17:21:43Z) - Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams [8.001015579487921]
Enginuityは、エンジニアリング図上でビジュアル言語モデルを評価するための、最初のオープンデータセットとベンチマークである。
我々は、米軍部隊のコーパス上の2つのタスクを定義し、構造化された部品テーブル抽出と自由形視覚図質問応答というマニュアルを修復する。
ゼロショットおよびチェーン・オブ・フォアプロンプトによる4つのフロンティアVLMの評価を行った。
論文 参考訳(メタデータ) (2026-06-02T09:54:03Z) - Teaching LLMs Program Semantics via Symbolic Execution Traces [0.7046782561282057]
SV-COMP 2025上に構築された500 C 検証タスクの評価フレームワークを提案する。
6家族の14モデルを評価し,総合的精度の高いマスクが致命的な弱点であることを確認した。
わずか$sim$3,000のバグトレースと、推論時の連鎖推論を組み合わせることで、違反検出を17ポイント以上改善する。
論文 参考訳(メタデータ) (2026-05-07T13:01:06Z) - COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm [59.26203051651017]
C-TAOはOpen-Vocabulary Multi-Object Tracking (OVMOT)のための最初の連続アノテーション付きトレーニングセットである
フレームワークボトルネックに対するCOVTrack++は,3つのモジュールによる検出とアソシエーションの双方向相互機構を実現するための相乗的フレームワークである。
TAOの実験では、新しいTAAは検証とテストセットで35.4%、30.5%に達し、新しいAssocAは4.8%、新しいLocAは5.8%向上した。
論文 参考訳(メタデータ) (2026-03-25T07:20:27Z) - TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models [0.0]
TACIT Benchmarkは、6つの推論領域にわたる10のタスクからなるプログラム的なビジュアル推論ベンチマークである。
このベンチマークでは、モデルが決定論的コンピュータビジョンパイプラインを通じて検証されたソリューションイメージを生成する必要がある生成トラックと、構造的に妥当なニアミストラクタを備えた5方向の多重選択を提供する識別トラックの2トラック評価が提供されている。
論文 参考訳(メタデータ) (2026-02-27T11:45:26Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents [93.49577107524176]
座標自由なGUIグラウンドリングのためのVLMに基づくGUI-Actorを提案する。
GUI-Actorの中核となるのは、アテンションベースのアクションヘッドで、専用のACTOR>トークンと関連するすべての視覚的パッチトークンの整合を学ぶ。
実験により、GUI-Actorは、複数のGUIアクショングラウンドベンチマークにおいて、最先端のメソッドよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-06-03T17:59:08Z) - A Hitchhikers Guide to Fine-Grained Face Forgery Detection Using Common Sense Reasoning [9.786907179872815]
視覚と言語の可能性は、いまだに偽造検出に過小評価されている。
顔偽造検出を視覚質問応答(VQA)タスクに変換する方法論が必要である。
このギャップに対処するために,従来の二項決定パラダイムから分岐する多段階的アプローチを提案する。
論文 参考訳(メタデータ) (2024-10-01T08:16:40Z) - CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning [61.21923643289266]
カオス・オブ・マニピュレーション(Chain of Manipulations)は、視覚言語モデル(Vision-Language Models)が、エビデンスを段階的に解決するメカニズムである。
トレーニング後、モデルは外部ツールを介さずに、本質的な操作(グラウンド、ズームインなど)を積極的に行うことで、様々な視覚的問題を解決することができる。
トレーニングされたモデルである textbfCogCoM は、4つのカテゴリの9つのベンチマークで最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-02-06T18:43:48Z) - Semantic Tracklets: An Object-Centric Representation for Visual
Multi-Agent Reinforcement Learning [126.57680291438128]
本研究では,不整合表現によるスケーラビリティの実現について検討する。
視覚多エージェント粒子環境(VMPE)と視覚多エージェントGFootball環境における意味トラックレット'の評価を行った。
特に,この手法は視覚データのみを用いて,GFootball環境における5人のプレイヤーの戦略を学習した最初の方法である。
論文 参考訳(メタデータ) (2021-08-06T22:19:09Z) - Benchmarking Unsupervised Object Representations for Video Sequences [111.81492107649889]
ViMON, OP3, TBA, SCALORの4つのオブジェクト中心アプローチの知覚能力を比較した。
この結果から,制約のない潜在表現を持つアーキテクチャは,オブジェクト検出やセグメンテーション,トラッキングといった観点から,より強力な表現を学習できる可能性が示唆された。
我々のベンチマークは、より堅牢なオブジェクト中心のビデオ表現を学習するための実りあるガイダンスを提供するかもしれない。
論文 参考訳(メタデータ) (2020-06-12T09:37:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。