論文の概要: CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
- arxiv url: http://arxiv.org/abs/2608.28958v1
- Date: Sat, 29 Aug 2026 00:03:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.793916
- Title: CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
- Title(参考訳): CoVA-SFT:ビジュアル抽象化のチェーンのための大規模データセット
- Authors: Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan,
- Abstract要約: CoT推論は大規模言語モデル(LLM)を劇的に改善した
CoVA-SFTは51.9Kサンプルからなる高度に構造化されたコーパスであり、5つの異なるレイアウトファミリーと17の複雑なタスクにわたる222K以上のマルチモーダル推論ステップを含んでいる。
明確な論理式、エージェントレンダリング、検証ループを提供することで、CoVA-SFTはテキストと視覚的抽象化をインターリーブするマルチモーダル言語モデルを教える。
- 参考スコア(独自算出の注目度): 73.85100620647452
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) reasoning has dramatically improved large language models (LLMs) by allowing them to decompose problems into intermediate steps. While CoT is widely effective for linguistic tasks, text-only CoT forces models to serialize visual problems into awkward prose. Although architectural solutions exist to process visual inputs, the community lacks a massive, multi-step, self-corrected dataset to teach models how to build and maintain internal visual workspaces when solving purely textual reasoning problems. To address this limitation, we introduce CoVA-SFT, a highly structured corpus of 51.9K samples containing over 222K multimodal reasoning steps across 5 distinct layout families and 17 complex tasks, and CoVA-Bench, a companion benchmark of 1,700 held-out test samples spanning the same tasks for reproducible evaluation. By providing explicit rationale formulations, agentic renderings, and verification loops, CoVA-SFT teaches multimodal language models to interleave text and visual abstractions. We validate the dataset by demonstrating that models fine-tuned on CoVA-SFT outperform all interleaved CoT baselines by more than 2x on average on CoVA-Bench, though they still fall short of strong text-only CoT baselines, highlighting open challenges for future work.
- Abstract(参考訳): チェーン・オブ・思想(CoT)推論は、問題を中間ステップに分解することで、大きな言語モデル(LLM)を劇的に改善した。
CoTは言語処理に広く有効であるが、テキストのみのCoTは、視覚的な問題を散文にシリアライズするようモデルを強制する。
ビジュアルインプットを処理するアーキテクチャソリューションは存在するが、コミュニティには、純粋にテキストによる推論問題を解決する際に、内部の視覚ワークスペースを構築し維持する方法をモデルに教える、大規模で多段階の自己修正データセットが欠けている。
この制限に対処するため、5つの異なるレイアウトファミリーと17の複雑なタスクにまたがる222K以上のマルチモーダル推論ステップを含む51.9Kサンプルからなる高度に構造化されたコーパスであるCoVA-SFTと、同じタスクにまたがる1,700のホールドアウトテストサンプルのベンチマークであるCoVA-Benchを紹介する。
明確な論理式、エージェントレンダリング、検証ループを提供することで、CoVA-SFTはテキストと視覚的抽象化をインターリーブするマルチモーダル言語モデルを教える。
CoVA-SFTで微調整されたモデルは、CoVA-Benchで平均して2倍以上のCOTベースラインを上回ります。
関連論文リスト
- LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA [39.131225916852834]
思考の連鎖(CoT)推論は、解釈可能性と複雑な推論を高めることが証明されている。
LaV-CoTは、マルチアスペクト・リワード最適化を備えた最初の言語対応Visual CoTフレームワークである。
LaV-CoTはオープンソースベースラインよりも9.5%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-09-12T07:45:44Z) - Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization [69.29207684569695]
CoT推論は多モーダル大言語モデル(MLLM)の解釈可能性と問題解決能力を大幅に向上させる
既存のアプローチはテキストCoTに重点を置いており、視覚的手がかりを活用する能力を制限する。
本稿では、優先最適化による画像レベルのCoT推論のための新しいフレームワークであるUnsupervised Visual CoT (UV-CoT)を紹介する。
論文 参考訳(メタデータ) (2025-04-25T14:48:18Z) - LATTE: Learning to Think with Vision Specialists [110.43838069105998]
我々は、認識を最先端の視覚モデルにオフロードする視覚言語モデルのファミリーであるLATTEを提案する。
我々のアプローチは、認識を最先端の視覚モデルにオフロードすることで、視覚言語モデルが高品質な知覚情報に対する推論のみに集中できるようにする。
論文 参考訳(メタデータ) (2024-12-07T00:42:04Z) - LLaVA-CoT: Let Vision Language Models Reason Step-by-Step [34.32147663809707]
LLaVA-CoTは、自律的な多段階推論を行うために設計された大型ビジョンランゲージモデル(VLM)である。
チェーン・オブ・シークレットのプロンプトとは異なり、LLaVA-CoTは独立に要約、視覚的解釈、論理的推論、結論生成の逐次的な段階に関与する。
100kのトレーニングサンプルとテストタイムのスケーリングだけで、LLaVA-CoTは、幅広いマルチモーダル推論ベンチマークでベースモデルを9.4%上回っている。
論文 参考訳(メタデータ) (2024-11-15T18:58:31Z) - NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision [64.83085920775316]
NPHardEval4Vは4つの古典的NPハード問題に基づくマルチモーダルベンチマークスイートである。
各タスクは、構造化された視覚レイアウトとテキストプロンプトを組み合わせることで、視覚言語的制約の下で推論を行うLVLMの能力を評価するように設計されている。
以上の結果から,これらのモデルは知覚に基づく入力に対して合理的に優れているが,グローバルな最適化,抽象化,制約満足度に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2024-03-04T07:10:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。