論文の概要: Video-FLAIR: Not Whether to Reason, But How
- arxiv url: http://arxiv.org/abs/2608.26495v1
- Date: Thu, 27 Aug 2026 00:34:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.207675
- Title: Video-FLAIR: Not Whether to Reason, But How
- Title(参考訳): Video-FLAIR: 理由と理由
- Authors: Yogesh Kulkarni, Pooyan Fazli,
- Abstract要約: Video-FLAIRは、強化学習を使用して、クエリ毎に適切な推論モードを選択することを学習する。
Video-FLAIRはQwen2.5-VLベースモデルの精度をMathVistaで+5.4、Video-Holmesで+4.8、Video-MMMUで+4.8向上させる。
- 参考スコア(独自算出の注目度): 3.4997248570131343
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal queries can require different types of reasoning. Some can be answered via perceptual reasoning, extracting information directly from the visual signal, while others require compositional reasoning that combines observations or deliberative reasoning that evaluates competing hypotheses. However, many existing methods apply a uniform reasoning strategy across queries, leading to unnecessary computation on simple tasks and insufficient reasoning on complex ones. We introduce Video-FLAIR, a training framework that learns to select the appropriate reasoning mode for each query using reinforcement learning. During training, the model generates responses under all three modes for the same prompt, enabling direct comparison. A composite reward compares these responses to favor the most effective one based on correctness, grounding, and cost, while discouraging unsupported or misaligned deliberation. This yields a supervision signal for learning adaptive reasoning without per-query annotations. Video-FLAIR improves accuracy over the Qwen2.5-VL base model by +5.4 on MathVista, +4.8 on Video-Holmes, and +4.8 on Video-MMMU, while reducing average token usage to 95 compared to 417 for always-thinking baselines.
- Abstract(参考訳): マルチモーダルクエリは、異なるタイプの推論を必要とする可能性がある。
いくつかは知覚的推論によって答えられ、視覚信号から直接情報を抽出するが、他のものは、観察と競合する仮説を評価する熟考的推論を組み合わせた構成的推論を必要とする。
しかし、多くの既存手法がクエリ全体にわたって一様推論戦略を適用しており、単純なタスクに対する不要な計算と複雑なタスクに対する不十分な推論に繋がる。
強化学習を用いて各クエリに対して適切な推論モードを選択することを学習するトレーニングフレームワークであるVideo-FLAIRを紹介する。
トレーニング中、モデルは同じプロンプトのために3つのモードすべてでレスポンスを生成し、直接比較できる。
複合報酬は、これらの反応を比較して、正当性、根拠、コストに基づいて最も効果的なものを好む一方で、支持されたあるいは不一致な熟考を阻止する。
これにより、クエリごとのアノテーションを使わずに適応推論を学習するための監視信号が得られる。
Video-FLAIRはQwen2.5-VLベースモデルの精度をMathVistaで+5.4、Video-Holmesで+4.8、Video-MMMUで+4.8で改善し、平均トークン使用量を常に考えるベースラインで417と比べて95に削減した。
関連論文リスト
- AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning [35.47019695877336]
チェーン・オブ・シント(CoT)推論は難しいビデオ質問のパフォーマンスを向上させるが、単純な質問ではデコードトークンを浪費することが多い。
AdaThinkVはビデオ推論のための適応的フレームワークで、オフラインの難易度ラベルなしで明示的に推論するかどうかを学習する。
AdaThinkV の平均精度は 40.79 であり、平均出力トークンは 257.20 であり、最も評価の高い適応ベースラインを 2.98 ポイント上回っている。
論文 参考訳(メタデータ) (2026-08-03T09:42:42Z) - VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice [88.93674345138054]
CoT推論(Chain-of-thinkt)は、ビデオ理解タスクにおけるマルチモーダルな大規模言語モデルのための強力なツールとして登場した。
本稿では,ビデオ理解フレームワークであるVideoAuto-R1を提案する。
論文 参考訳(メタデータ) (2026-01-08T18:00:59Z) - Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models [56.851611990473174]
動的ビジュアルコンテンツに対する推論は、大きな言語モデルにとって依然として中心的な課題である。
本稿では,時間的精度と推論一貫性を両立させる強化学習手法を提案する。
結果のモデルであるVideo R2は、複数のベンチマークでTAC、VAS、精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-11-28T18:59:58Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models [54.88805865447848]
モデルが全体の効率を向上し,問題の難しさが効率に影響を及ぼすことを示す。
インストラクションモデルが簡単なアウトラインをドラフトし,思考モデルがそれを拡張する,シンプルな2段階パイプラインであるCOTHINKを提案する。
GSM8K、MATH500、AIME24では、COTHINKはトークンの使用量を21.1%削減し、4つの思考モデルの精度を維持し、強力な効率のベースラインと競争し続ける。
論文 参考訳(メタデータ) (2025-05-28T06:24:45Z) - Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models [67.87579664988199]
TONは視覚言語モデル(VLM)のための2段階のトレーニング戦略である
選択的な推論のためのコールドスタートとして機能するシンクまたはノットフォーマットを導入している。
TONは、バニラGRPOと比較して、完成期間を最大90%短縮することができる。
論文 参考訳(メタデータ) (2025-05-22T16:13:29Z) - Thinkless: LLM Learns When to Think [57.857534644932194]
推論モデル(Reasoning Language Models)は、複雑な論理的推論を必要とするタスクにおいて顕著な性能を示す。
我々は,LLMが短文推論と長文推論を適応的に選択できる学習可能なフレームワークであるThinklessを提案する。
Minerva Algebra、MATH-500、GSM8Kなどのベンチマークでは、Thinklessはロングチェーン思考の使用を50%から90%削減することができる。
論文 参考訳(メタデータ) (2025-05-19T17:24:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。