論文の概要: CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.12786v1
- Date: Tue, 14 Jul 2026 14:01:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.16425
- Title: CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- Title(参考訳): CoRe:視覚言語モデルにおけるクロスイメージ比較推論のための総合的フレームワーク
- Authors: Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong,
- Abstract要約: CoReはクロスイメージ比較推論のための統一されたフレームワークである。
i) CoRe-20K、(i) CoRe-20K、(i) CoRe-20K、(i) CoRe-Bench、(iii) CoRe-Bench、(iii) CoRe-Bench、(iii) 微粒なクロスイメージ比較推論に特化した最初のベンチマーク。
- 参考スコア(独自算出の注目度): 31.521481044102753
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Cross-image comparative reasoning remains challenging for vision-language models (VLMs), especially when correct prediction requires fine-grained attribute grounding and globally consistent reasoning. We present CoRe, a unified framework for this problem. CoRe includes: (i) CoRe-20K, a large-scale triplet-based training set automatically constructed from structured visual metadata through a multi-expert collaborative pipeline, covering counting, depth, distance, and spatial relations; (ii) TriSR, a structured reward framework that jointly supervises attribute grounding, judgment alignment, and triplet consistency under GRPO optimization; and (iii) CoRe-Bench, the first benchmark dedicated to fine-grained cross-image comparative reasoning. Experiments show that CoRe substantially outperforms existing VLMs on CoRe-Bench while remaining competitive on standard multimodal benchmarks, achieving a 28.2-point gain in partial accuracy over the strongest baseline.
- Abstract(参考訳): クロスイメージ比較推論は視覚言語モデル(VLM)では依然として困難であり、特に正確な予測には微粒な属性基底とグローバルに一貫した推論が必要である。
この問題に対する統一的なフレームワークであるCoReを紹介します。
CoRe には以下のものがある。
(i)CoRe-20Kは、多目的協調パイプラインを通じて構造化された視覚メタデータから自動的に構築され、計数、深さ、距離及び空間的関係を網羅する大規模な三重項に基づく訓練セットである。
(ii) GRPO最適化の下での属性接地、判断アライメント、三重項整合を共同で監督する構造的報酬枠組であるTriSR
(iii) CoRe-Benchは、微粒なクロスイメージ比較推論に特化した最初のベンチマークである。
実験の結果、CoReはCoRe-Bench上の既存のVLMよりもかなり優れており、標準マルチモーダルベンチマークでは競争力があり、最強のベースラインよりも精度が28.2ポイント向上した。
関連論文リスト
- SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models [63.28435103335999]
セマンティックオブジェクト対応のための新しいベンチマークであるSOCOを紹介する。
視覚基盤のバックボーンは強い意味構造をエンコードするが、関連するカテゴリ間での伝達対応は不十分であることを示す。
また,LVLMは画像マッチングよりもテキストプロンプト部分のローカライゼーションが優れていることを示す。
論文 参考訳(メタデータ) (2026-05-29T17:58:48Z) - Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization [3.579200789027982]
RLVR(Reinforcement fine-tuning with verible rewards)は、大きな視覚言語モデル(LVLM)にツールの使用や多段階推論などのエージェント機能を持たせるための強力なパラダイムとして登場した。
顕著な経験的成功にもかかわらず、特に視覚エージェント強化細管(Visual Agentic Reinforcement Fine-Tuning, Visual-ARFT)は、このパラダイムの理論的基盤は理解されていない。
EmphTool-Augmented Markov Decision Process (TA-MDP)を導入する。
論文 参考訳(メタデータ) (2026-04-21T17:21:08Z) - Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought [73.39221516441624]
マルチモーダル・チェーン・オブ・ソート(CoT)推論は、推論軌道を構築するために大きな視覚言語モデルを必要とする。
既存のReinforcement Learning with Verifiable Rewards (RLVR) 法は、様々な視覚的接地度を区別することなく、CoTを均一に扱う。
本稿では,隠れ状態の類似性に先立って認識を導き,トークンのエントロピーと統合する知覚探索ポリシー最適化(PEPO)を提案する。
論文 参考訳(メタデータ) (2026-03-24T06:38:00Z) - Beyond the Academic Monoculture: A Unified Framework and Industrial Perspective for Attributed Graph Clustering [75.50670592447219]
分散グラフクラスタリング(AGC)は、構造トポロジとノード属性を共同でモデル化することによって、ノードを凝集性グループに分割する基本的な教師なしタスクである。
この調査は、3つの相補的な視点からAGCを包括的かつ工業的に基礎づけたレビューを提供する。
論文 参考訳(メタデータ) (2026-03-21T14:15:34Z) - Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning [61.753025885751036]
本稿では,3つのタスクにまたがる異種視点を融合する視覚言語モデルの能力を評価するEgo-to-Worldベンチマークを提案する。
我々は,2段階のフレームワークであるCoRLを提案し,チェイン・オブ・ソート(Chain-of-Thought)を教師付き微調整と強化学習を組み合わせた。
我々は、CoRLが、推論と知覚グラウンドのメトリクスの両方において、強力なプロプライエタリおよびオープンソースベースラインを一貫して超越していることを示します。
論文 参考訳(メタデータ) (2026-03-16T04:27:53Z) - PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling [35.2454702825439]
PaCo-RLは、特殊一貫性報酬モデルと効率的なRLアルゴリズムを組み合わせた包括的なフレームワークである。
本研究では,PaCo-Rewardが視覚的整合性に対する人間の認識との整合性を大幅に改善し,PaCo-GRPOが最先端の整合性を実現することを示す。
これらの結果は、一貫した画像生成のための実用的でスケーラブルなソリューションとしてPaCo-RLを約束していることを強調している。
論文 参考訳(メタデータ) (2025-12-02T13:39:03Z) - CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning [93.05917922306196]
Composed Image Retrieval (CIR) は、参照画像と修正テキストから対象画像を見つけることを目的としている。
CIR-CoTは、明示的なChain-of-Thought (CoT)推論を統合するために設計された最初のエンドツーエンド検索指向MLLMである。
論文 参考訳(メタデータ) (2025-10-09T09:41:45Z) - Understanding and Constructing Latent Modality Structures in Multi-modal
Representation Learning [53.68371566336254]
優れたパフォーマンスの鍵は、完全なモダリティアライメントではなく、有意義な潜在モダリティ構造にある、と我々は主張する。
具体的には,1)モダリティ内正規化のための深い特徴分離損失,2)モダリティ間正規化のためのブラウン橋損失,3)モダリティ内正規化およびモダリティ間正規化のための幾何学的整合損失を設計する。
論文 参考訳(メタデータ) (2023-03-10T14:38:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。