論文の概要: TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models
- arxiv url: http://arxiv.org/abs/2602.18884v1
- Date: Sat, 21 Feb 2026 16:10:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-24 17:42:02.375223
- Title: TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models
- Title(参考訳): TPRU:大規模マルチモーダルモデルにおける時間的・手続き的理解の促進
- Abstract要約: 本稿では,多様な実施シナリオをベースとした大規模データセットTPRUを紹介する。
TPRUは3つの相補的なタスクを通じて時間的推論を育むために体系的に設計されている。
我々は,資源効率の向上を目的とした強化学習(RL)ファインチューニング手法を用いてTPRUを利用する。
- 参考スコア(独自算出の注目度): 16.203071396170284
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs), particularly smaller, deployable variants, exhibit a critical deficiency in understanding temporal and procedural visual data, a bottleneck hindering their application in real-world embodied AI. This gap is largely caused by a systemic failure in training paradigms, which lack large-scale, procedurally coherent data. To address this problem, we introduce TPRU, a large-scale dataset sourced from diverse embodied scenarios such as robotic manipulation and GUI navigation. TPRU is systematically designed to cultivate temporal reasoning through three complementary tasks: Temporal Reordering, Next-Frame Prediction, and Previous-Frame Review. A key feature is the inclusion of challenging negative samples, compelling models to transition from passive observation to active, cross-modal validation. We leverage TPRU with a reinforcement learning (RL) fine-tuning methodology, specifically targeting the enhancement of resource-efficient models. Experiments show our approach yields dramatic gains: on our manually curated TPRU-Test, the accuracy of TPRU-7B soars from 50.33\% to 75.70\%, a state-of-the-art result that significantly outperforms vastly larger baselines, including GPT-4o. Crucially, these capabilities generalize effectively, demonstrating substantial improvements on established benchmarks. The codebase is available at https://github.com/Stephen-gzk/TPRU/ .
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、特に小型でデプロイ可能な変種であり、時間的および手続き的視覚データを理解する上で重要な欠陥を示しており、現実のAIにおける彼らの応用を妨げるボトルネックとなっている。
このギャップは、大規模で手続き的に一貫性のあるデータが欠如している訓練パラダイムの体系的な失敗によって主に引き起こされる。
この問題に対処するために,ロボット操作やGUIナビゲーションといった多様な実施シナリオをベースとした大規模データセットTPRUを導入する。
TPRUは、時間的並べ替え、Next-Frame Prediction、Previous-Frame Reviewという3つの補完的なタスクを通じて時間的推論を育むために体系的に設計されている。
重要な特徴は、受動的観察からアクティブなクロスモーダルバリデーションに移行するための、挑戦的な負のサンプルの導入である。
我々は,資源効率の向上を目的とした強化学習(RL)ファインチューニング手法を用いてTPRUを利用する。
我々の手作業によるTPRU-Testでは、TPRU-7Bの精度が50.33\%から75.70\%に上昇し、GPT-4oを含む非常に大きなベースラインを著しく上回りました。
重要な点として、これらの機能は効果的に一般化され、確立されたベンチマークを大幅に改善した。
コードベースはhttps://github.com/Stephen-gzk/TPRU/で公開されている。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - Benchmarking Few-shot Transferability of Pre-trained Models with Improved Evaluation Protocols [123.73663884421272]
より強力な事前訓練モデルと改良された適応アルゴリズムによって、わずかなショット転送が革新されている。
FEWTRANSは10種類のデータセットを含む総合的なベンチマークである。
FEWTRANS をリリースすることにより,数発の転写学習研究において再現性の向上を合理化するための厳密な "ルーラー" の提供を目指す。
論文 参考訳(メタデータ) (2026-02-28T05:41:57Z) - Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision [11.159231524113764]
マルチモーダル大規模言語モデル(MLLM)の複雑な推論能力を高めるための重要なメカニズムとして強化学習(RL)が登場した。
本稿では,これらの構造的制約に対処する textbfGuided Verifier フレームワークを提案する。
我々は,マルチモーダル幻覚をターゲットとした特殊なデータ合成パイプラインを開発し,プロセスレベルの負の textbfCoRe データセットとtextbfCorrect-guide textbfReasoning トラジェクトリを構築し,ガイド付き検証器を訓練する。
論文 参考訳(メタデータ) (2026-02-04T07:38:42Z) - Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs [22.76757502541604]
鍵情報抽出のための並列推論パラダイムPIPについて紹介する。
提案手法は,すべての目標値のプレースホルダーとして "[mask]" トークンを用いることで問題を修正し,単一のフォワードパスで同時生成を可能にする。
実験の結果,従来の自己回帰ベースモデルと比較して,PIPモデルでは性能劣化が無視できる5-36倍の高速化を実現していることがわかった。
論文 参考訳(メタデータ) (2026-01-27T13:45:30Z) - Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs [78.09559830840595]
本稿では拡散に基づく言語モデルの定量化に関する最初の体系的研究について述べる。
異常に大きなアクティベーション値によって特徴付けられるアクティベーションアウトリーチの存在を同定する。
我々は最先端のPTQ手法を実装し、包括的な評価を行う。
論文 参考訳(メタデータ) (2025-08-20T17:59:51Z) - Perception-Aware Policy Optimization for Multimodal Reasoning [79.56070395437898]
現在のマルチモーダル推論における誤りの主な原因は、視覚入力の知覚にある。
提案するPAPOは,モデルが推論を学習しながら知覚を学習することを奨励する,新しいポリシー勾配アルゴリズムである。
知覚誤りの30.5%が有意に減少し,PAPOによる知覚能力の向上が示唆された。
論文 参考訳(メタデータ) (2025-07-08T23:22:34Z) - R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning [69.72249695674665]
視覚言語モデル(VLM)のためのロバストテスト時プロンプトチューニング(R-TPT)を提案する。
R-TPTは、推論段階における敵攻撃の影響を緩和する。
プラグアンドプレイの信頼性に基づく重み付きアンサンブル戦略を導入し,防御強化を図る。
論文 参考訳(メタデータ) (2025-04-15T13:49:31Z) - PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection [68.8373788348678]
ビジュアルインストラクションチューニングは、事前訓練されたマルチモーダル大言語モデルに人間の指示に従うように適応する。
PRISMは、効率的な視覚的命令選択のための最初のトレーニング不要のフレームワークである。
データ選択とモデルチューニングのエンドツーエンドの時間を従来のパイプラインの30%に短縮する。
論文 参考訳(メタデータ) (2025-02-17T18:43:41Z) - A Bayesian Approach to Data Point Selection [24.98069363998565]
データポイントの選択(DPS)は、ディープラーニングにおいて重要なトピックになりつつある。
既存のDPSへのアプローチは、主にバイレベル最適化(BLO)の定式化に基づいている。
DPSに対する新しいベイズ的アプローチを提案する。
論文 参考訳(メタデータ) (2024-11-06T09:04:13Z) - TimeSieve: Extracting Temporal Dynamics through Information Bottlenecks [31.10683149519954]
本稿では,時系列予測モデルTimeSieveを提案する。
提案手法では、ウェーブレット変換を用いて時系列データを前処理し、マルチスケールの特徴を効果的にキャプチャする。
本研究は,時系列予測における課題に対処するためのアプローチの有効性を検証した。
論文 参考訳(メタデータ) (2024-06-07T15:58:12Z) - Less Is More: Fast Multivariate Time Series Forecasting with Light
Sampling-oriented MLP Structures [18.592350352298553]
単純な構造をベースとした軽量ディープラーニングアーキテクチャであるLightTSを紹介した。
既存の最先端のメソッドと比較すると、LightTSは5つのメソッドでより良いパフォーマンスを示し、残りの5つで同等のパフォーマンスを示している。
LightTSは堅牢であり、長いシーケンス予測タスクにおける従来のSOTA法よりも精度のばらつきがはるかに小さい。
論文 参考訳(メタデータ) (2022-07-04T04:03:00Z) - Transformer Hawkes Process [79.16290557505211]
本稿では,長期的依存関係を捕捉する自己認識機構を利用したTransformer Hawkes Process (THP) モデルを提案する。
THPは、有意なマージンによる可能性と事象予測の精度の両方の観点から、既存のモデルより優れている。
本稿では、THPが関係情報を組み込む際に、複数の点過程を学習する際の予測性能の改善を実現する具体例を示す。
論文 参考訳(メタデータ) (2020-02-21T13:48:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。