論文の概要: AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
- arxiv url: http://arxiv.org/abs/2608.01980v1
- Date: Mon, 03 Aug 2026 09:42:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.475845
- Title: AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
- Title(参考訳): AdaThinkV:Token-Efficient Video Reasoningのための適応的思考
- Authors: Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang,
- Abstract要約: チェーン・オブ・シント(CoT)推論は難しいビデオ質問のパフォーマンスを向上させるが、単純な質問ではデコードトークンを浪費することが多い。
AdaThinkVはビデオ推論のための適応的フレームワークで、オフラインの難易度ラベルなしで明示的に推論するかどうかを学習する。
AdaThinkV の平均精度は 40.79 であり、平均出力トークンは 257.20 であり、最も評価の高い適応ベースラインを 2.98 ポイント上回っている。
- 参考スコア(独自算出の注目度): 35.47019695877336
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Chain-of-thought (CoT) reasoning can improve performance on difficult video questions but often wastes decoding tokens on simple ones. We study whether a video multimodal large language model can adapt its reasoning effort to each question. We propose AdaThinkV, an adaptive framework for video reasoning that learns whether to reason explicitly without offline difficulty labels, manually tuned confidence thresholds, or an external router. During reinforcement learning, AdaThinkV samples matched rollouts in explicit reasoning and direct answering modes for each prompt. ThinkGain estimates the prompt-level utility of explicit reasoning by balancing its accuracy gain against additional response length, providing supervision for both conditional response generation and autonomous mode selection. For difficult prompts, limited rollout exploration can yield groups in which every response is unsuccessful and accuracy rewards show little variation, providing insufficient signal for learning. We therefore introduce Variance Recovery Policy Optimization (VRPO), which retains and progressively expands these groups to recover informative signals from prompts that are difficult yet solvable. At inference, AdaThinkV selects a response mode and generates the response in a single autoregressive sequence. Across a unified suite of video reasoning evaluations, AdaThinkV achieves a mean accuracy of 40.79 with an average of 257.20 output tokens, outperforming the strongest evaluated adaptive baseline by 2.98 points while using 22.7% fewer tokens. Project page: https://trilarflagz.github.io/AdaThinkV/
- Abstract(参考訳): チェーン・オブ・シント(CoT)推論は難しいビデオ質問のパフォーマンスを向上させるが、単純な質問ではデコードトークンを浪費することが多い。
ビデオマルチモーダルな大言語モデルがその推論を各質問に適応できるかどうかを検討する。
ビデオ推論のための適応的フレームワークであるAdaThinkVを提案する。これは、オフラインの難易度ラベルや手動の信頼度閾値、外部ルータを明示的に判断するかどうかを学習する。
強化学習中、AdaThinkVサンプルは明示的な推論と各プロンプトに対する直接応答モードでロールアウトにマッチした。
ThinkGainは、その精度のゲインと追加の応答長のバランスをとることで、明示的推論の迅速なユーティリティを推定し、条件付き応答生成と自律モード選択の両方を監督する。
難しいプロンプトのために、限定的なロールアウト探索は、すべての応答が失敗し、精度の報奨がほとんど変化しないグループを生み出し、学習に不十分な信号を与える。
そこで我々は,これらのグループを維持し,段階的に拡張して,難解なプロンプトから情報信号を回収する,可変回復政策最適化(VRPO)を導入する。
推論時にAdaThinkVは応答モードを選択し、単一の自己回帰シーケンスで応答を生成する。
AdaThinkVは、一連のビデオ推論評価で平均40.79の精度を平均257.20の出力トークンで達成し、22.7%のトークンを使用しながら、最も高い評価された適応ベースラインを2.98ポイント上回っている。
プロジェクトページ: https://trilarflagz.github.io/AdaThinkV/
関連論文リスト
- VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice [88.93674345138054]
CoT推論(Chain-of-thinkt)は、ビデオ理解タスクにおけるマルチモーダルな大規模言語モデルのための強力なツールとして登場した。
本稿では,ビデオ理解フレームワークであるVideoAuto-R1を提案する。
論文 参考訳(メタデータ) (2026-01-08T18:00:59Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - Thinkless: LLM Learns When to Think [57.857534644932194]
推論モデル(Reasoning Language Models)は、複雑な論理的推論を必要とするタスクにおいて顕著な性能を示す。
我々は,LLMが短文推論と長文推論を適応的に選択できる学習可能なフレームワークであるThinklessを提案する。
Minerva Algebra、MATH-500、GSM8Kなどのベンチマークでは、Thinklessはロングチェーン思考の使用を50%から90%削減することができる。
論文 参考訳(メタデータ) (2025-05-19T17:24:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。