論文の概要: Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning
- arxiv url: http://arxiv.org/abs/2608.04926v1
- Date: Wed, 05 Aug 2026 14:55:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.964705
- Title: Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning
- Title(参考訳): 自己教師付きクロス表現学習のための一貫性駆動型共進化
- Authors: Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang,
- Abstract要約: CoCoEvolveを導入し、チャート、テーブル、コード表現間の一貫性を改善します。
横断表現写像を一対多問題として扱う代わりに、明示的な一対一対応を定義する。
CoCoEvolve@Evalは6つの横断表現タスクを網羅する評価スイートである。
- 参考スコア(独自算出の注目度): 22.919432038002643
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As chart images, tabular data, and visualization code play increasingly important roles across diverse domains, cross-representation understanding across these modalities poses fundamental challenges for AI systems: the relationships across representations are inherently \textit{one-to-many}, supervision is ambiguous and costly, and model optimization lacks a principled signal that is both direction-adaptive and representation-generalizable beyond task-specific objectives. We introduce CoCoEvolve to improve consistency across chart, table, and code representations. Instead of treating cross-representation mapping as a one-to-many problem, we define explicit one-to-one correspondences and optimize models using agreement between representations, without additional annotations. During training, CoCoEvolve@Train performs co-evolution across the chart-table-code cycle, while CoCoEvolve@Test applies the same consistency objective at inference time for test-time co-optimization. We also present CoCoEvolve@Eval, an evaluation suite covering all six cross-representation tasks. Across four benchmarks, CoCoEvolve improves performance in both training-time and test-time settings. Our project page: https://xhguo7.github.io/CoCoEvolve/.
- Abstract(参考訳): グラフ画像、表データ、可視化コードがさまざまな領域でますます重要な役割を担っているため、これらのモダリティ間の相互表現理解は、AIシステムに根本的な課題をもたらす: 表現間の関係は本質的に \textit{one-to-many} であり、監督は曖昧でコストがかかる。
CoCoEvolveを導入し、チャート、テーブル、コード表現間の一貫性を改善します。
相互表現マッピングを1対多の問題として扱う代わりに、明示的な1対1対応を定義し、追加アノテーションなしで表現間の一致を用いてモデルを最適化する。
トレーニング中、CoCoEvolve@Trainはチャートテーブルコードのサイクルで共進化を行い、CoCoEvolve@Testはテスト時間の共最適化の推論時間で同じ一貫性の目標を適用します。
また、6つの横断表現タスクすべてをカバーする評価スイートであるCoCoEvolve@Evalも紹介する。
4つのベンチマークで、CoCoEvolveはトレーニング時間とテスト時間の両方のパフォーマンスを改善している。
私たちのプロジェクトページは、https://xhguo7.github.io/CoCoEvolve/です。
関連論文リスト
- Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning [40.68014726208686]
本稿では,RLVRトレーニングにクロスビュー一貫性を注入するConsistRollを提案する。
オリジナルとセマンティックに不変な変換されたビューを同じ世代グループに配置する。
ペアの完了が正確かつ一貫性のある場合にのみ、共同報酬を割り当てる。
論文 参考訳(メタデータ) (2026-06-29T05:45:18Z) - PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling [35.2454702825439]
PaCo-RLは、特殊一貫性報酬モデルと効率的なRLアルゴリズムを組み合わせた包括的なフレームワークである。
本研究では,PaCo-Rewardが視覚的整合性に対する人間の認識との整合性を大幅に改善し,PaCo-GRPOが最先端の整合性を実現することを示す。
これらの結果は、一貫した画像生成のための実用的でスケーラブルなソリューションとしてPaCo-RLを約束していることを強調している。
論文 参考訳(メタデータ) (2025-12-02T13:39:03Z) - Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding [23.138205646078536]
CoT(Chain-of-Thought)プロンプトは、最近、様々なNLPおよびコンピュータビジョンタスクで大きな可能性を示している。
強化学習(RL)に基づく微調整CoT推論は,視覚グラウンディングタスクの性能をパラドックス的に劣化させる可能性がある。
我々は,CoT長と一般化されたインターセクションを用いた新たなトレーニング戦略であるCuRPOを提案する。
論文 参考訳(メタデータ) (2025-11-17T21:22:50Z) - CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning [93.05917922306196]
Composed Image Retrieval (CIR) は、参照画像と修正テキストから対象画像を見つけることを目的としている。
CIR-CoTは、明示的なChain-of-Thought (CoT)推論を統合するために設計された最初のエンドツーエンド検索指向MLLMである。
論文 参考訳(メタデータ) (2025-10-09T09:41:45Z) - Plug-and-Play Regulators for Image-Text Matching [76.28522712930668]
微細な対応と視覚的セマンティックなアライメントの爆発は、画像とテキストのマッチングにおいて大きな可能性を秘めている。
我々は、メッセージ出力を効率的にエンコードして、コンテキストを自動生成し、モーダル表現を集約する、シンプルだが非常に効果的な2つのレギュレータを開発した。
MSCOCOとFlickr30Kデータセットの実験は、複数のモデルで印象的で一貫したR@1ゲインをもたらすことができることを実証している。
論文 参考訳(メタデータ) (2023-03-23T15:42:05Z) - Conditional Prompt Learning for Vision-Language Models [107.06776396086471]
近ごろ提案されたContext Optimization (CoOp) は、文脈単語をプロンプトで学習可能なベクトルの集合に変換する。
CoOpは、CoOpよりもはるかに優れたクラスを非表示に一般化し、単一のデータセットを超える有望な転送可能性を示している。
我々の実験によると、CoCoOpはCoOpよりもはるかに優れたクラスに一般化しており、単一のデータセットを超える有望な転送可能性を示している。
論文 参考訳(メタデータ) (2022-03-10T18:59:41Z) - SA-VQA: Structured Alignment of Visual and Semantic Representations for
Visual Question Answering [29.96818189046649]
本稿では,視覚とテキストのグラフ表現を扱う構造化アライメントを提案する。
実験結果に示すように,このような構造的アライメントは推論性能を向上させる。
提案したモデルは、事前トレーニングなしで、GQAデータセット上で最先端の手法を上回り、VQA-v2データセット上で非事前トレーニングされた最先端の手法を上回ります。
論文 参考訳(メタデータ) (2022-01-25T22:26:09Z) - Learning to Relate Depth and Semantics for Unsupervised Domain
Adaptation [87.1188556802942]
教師なしドメイン適応(UDA)設定において,視覚的タスク関係を符号化してモデル性能を向上させる手法を提案する。
本稿では,意味的および深さ的予測のタスク依存性を符号化する新しいクロスタスク関係層(ctrl)を提案する。
さらに、セマンティック擬似ラベルを利用してターゲットドメインを監督する反復自己学習(ISL)トレーニングスキームを提案する。
論文 参考訳(メタデータ) (2021-05-17T13:42:09Z) - CoADNet: Collaborative Aggregation-and-Distribution Networks for
Co-Salient Object Detection [91.91911418421086]
Co-Salient Object Detection (CoSOD)は、2つ以上の関連する画像を含む所定のクエリグループに繰り返し現れる健全なオブジェクトを発見することを目的としている。
課題の1つは、画像間の関係をモデリングし、活用することによって、コ・サリヤ・キューを効果的にキャプチャする方法である。
我々は,複数画像から有能かつ反復的な視覚パターンを捉えるために,エンドツーエンドの協調集約配信ネットワーク(CoADNet)を提案する。
論文 参考訳(メタデータ) (2020-11-10T04:28:11Z) - Robust Learning Through Cross-Task Consistency [92.42534246652062]
クロスタスク整合性を用いた学習向上のための,広く適用可能な完全計算手法を提案する。
クロスタスク一貫性による学習は,より正確な予測と,アウト・オブ・ディストリビューション・インプットの一般化につながることを観察する。
論文 参考訳(メタデータ) (2020-06-07T09:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。