論文の概要: From Priors to Perception: Grounding Video-LLMs in Physical Reality
- arxiv url: http://arxiv.org/abs/2605.04515v1
- Date: Wed, 06 May 2026 05:48:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.66084
- Title: From Priors to Perception: Grounding Video-LLMs in Physical Reality
- Title(参考訳): 先見から知覚へ:物理界におけるビデオLLMの接地
- Abstract要約: ビデオ大言語モデル (Video Large Language Models, Video-LLMs) は、微細な物理的推論において体系的な欠陥を示す。
統一帰属論(Unified Attribution Theory: この二重失敗は知覚障害ではなく、セマンティック優先支配(Semantic Prior Dominance)に由来する。
そこで我々は,PACC (Programmatic Adversarial Curriculum) を構築した。
PACCカリキュラムによる標準LoRA微調整は、最先端(SOTA)モデルにおける事前干渉を効果的に中和することを示す。
- 参考スコア(独自算出の注目度): 24.25547551306548
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Video Large Language Models (Video-LLMs) excel in general understanding, they exhibit systematic deficits in fine-grained physical reasoning. Existing interventions not only suffer from limited generalization but fundamentally conflate generative artifacts with genuine physical fallacies. Furthermore, we find that models fail systematically not only in anti-physics anomalies but also in counter-intuitive scenarios where visual facts contradict statistical expectations. Accordingly, we propose the Unified Attribution Theory: this dual failure stems not from perception deficiency, but from Semantic Prior Dominance -- the reasoning mechanism is deeply hijacked by internal narrative scripts. To address this, we construct the Programmatic Adversarial Curriculum (PACC), the first high-fidelity adversarial video dataset synthesized based on physical laws, thoroughly decoupling visual artifacts from logical errors. Concurrently, we design the Visual-Anchored Reasoning Chain (VARC) to force models to explicitly ground their judgments in low-level visual facts prior to logical adjudication. Experiments demonstrate that without invasive architectural modifications, standard LoRA fine-tuning with the PACC curriculum effectively neutralizes prior interference in state-of-the-art (SOTA) models, yielding a substantial leap in physical reasoning capabilities.
- Abstract(参考訳): ビデオ大言語モデル(Video Large Language Models, Video-LLMs)は一般に理解されているが, 微粒な物理的推論において, 体系的な欠陥を示す。
既存の介入は、限定的な一般化に苦しむだけでなく、生成的アーティファクトを真の物理的誤認で根本的に説明する。
さらに,抗物理学的異常だけでなく,視覚的事実が統計的予測と矛盾する直感的シナリオにおいても,モデルが体系的に失敗することを見出した。
したがって、我々は統一帰属論(Unified Attribution Theory)を提案する。この二重障害は知覚障害ではなく、セマンティック・プライド・ドミナンス(Semantic Prior Dominance)に由来する。
そこで本研究では,物理法則に基づいて合成された最初の高忠実度対人ビデオデータセットであるProgrammatic Adversarial Curriculum (PACC)を構築し,視覚的アーティファクトを論理的誤りから完全に分離する。
同時に,VARC(Visual-Anchored Reasoning Chain)を設計し,論理的偏見に先行する低レベルの視覚的事実に対して,モデルに判断を明示的に下すよう強制する。
実験により、侵襲的なアーキテクチャ修正がなければ、PACCのカリキュラムによる標準的なLoRA微調整は、最先端(SOTA)モデルの事前干渉を効果的に中和し、物理的推論能力を大幅に飛躍させることが示された。
関連論文リスト
- Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs [49.55219052565761]
CausalPhysは、知覚、予測、介入、目標指向という4つの領域にまたがる、ビデオと画像に基づく3000以上の慎重にキュレートされた質問のベンチマークである。
各質問は、専門家がアノテートした因果グラフがオブジェクト・属性・イベントの依存関係をキャプチャし、因果理解の解釈可能かつきめ細かい評価を可能にする。
これに基づいて、モデルの連鎖推論が正しい因果関係とどの程度うまく一致しているかを定量的に測定する因果グラフ基底計量を定式化する。
本稿では,CRFT(Causal Rationale-informed Fine-Tuning)を提案する。
論文 参考訳(メタデータ) (2026-06-04T10:07:05Z) - Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs [68.58207076756237]
本稿では,結果評価からメカニズム診断へ移行する摂動に基づく評価プロトコルProCauEvalを紹介する。
因果推論において,ビデオコンテンツは体系的に過小評価されている。
教師のネガティブなアライメントに基づく強化学習フレームワークであるADPOを提案する。
論文 参考訳(メタデータ) (2026-05-10T08:48:58Z) - Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning [14.700305370711973]
凍結したビジョンランゲージモデルにおける視覚的グラウンドの強化を目的とした,トレーニングフリーでデータ中心のフレームワークを提案する。
我々のフレームワークは、DataCV 2026 Challenge (Task I: Classic Illusion Understanding)で評価され、総合2位にランクインした。
我々の成功は、次世代のイリュージョンに耐性のある視覚言語システムを開発するための堅牢なパラダイムとして、構造化定性的接地の可能性を示している。
論文 参考訳(メタデータ) (2026-04-29T03:12:29Z) - Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer [47.76679214811589]
本研究では,現在最先端のAIモデルが抽象因果構造伝達のためのヒューマンライクなメカニズムを持っているかを検討する。
本研究は, 共通原因 (CC) と共通効果 (CE) 構造が根本的に遅延または欠落していることを示す。
これらの結果から、大規模統計学習は、人間の類推的推論を支える非文脈化された因果関係を創出しないことが明らかとなった。
論文 参考訳(メタデータ) (2026-04-27T05:37:53Z) - OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning [51.33849811496781]
大規模言語モデル (LLM) は例外的な論理的推論能力を示しているが、部分微分方程式 (PDE) による連続力学としばしば競合する。
OMNIFLOWは, 領域固有のパラメータ更新を必要とせず, 基本物理法則で凍結LDMを基底として設計したマルチモーダルシンボリックアーキテクチャである。
我々は, 微視的乱流, 理論的ナビエ・ストークス, マクロ的世界天気予報のベンチマークでこれを評価した。
論文 参考訳(メタデータ) (2026-03-16T18:29:01Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - Addressing Logical Fallacies In Scientific Reasoning From Large Language Models: Towards a Dual-Inference Training Framework [0.13854111346209866]
大規模言語モデル(LLM)は自然言語処理を変革し、科学、医療、意思決定の進歩への期待が高まっている。
本稿は,2つのコントリビューションを行う。まず,主要なプラットフォームから存在するLCMが,否定や反例,あるいは欠陥のある前提で科学的領域を推論する際に,体系的な弱点を示すことを示す。
第二に、肯定生成と構造化反事実否定を統合する二重推論トレーニングフレームワークを導入する。
論文 参考訳(メタデータ) (2025-12-03T19:50:39Z) - TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility [70.24211591214528]
ビデオ生成モデルは、浮動、テレポート、モーフィングのような直感的な物理法則に違反したシーケンスを生成する。
既存のビデオランゲージモデル(VLM)は、物理違反の特定に苦慮し、時間的および因果的推論における根本的な制限を明らかにしている。
我々は、バランスの取れたトレーニングデータセットと軌道認識型アテンションモジュールを組み合わせた微調整レシピTRAVLを導入し、モーションエンコーディングを改善する。
言語バイアスを除去し,視覚的時間的理解を分離する300本のビデオ(150本実写150本)のベンチマークであるImplausiBenchを提案する。
論文 参考訳(メタデータ) (2025-10-08T21:03:46Z) - A Comment On "The Illusion of Thinking": Reframing the Reasoning Cliff as an Agentic Gap [0.39073867995073247]
我々は、観測された失敗は基本的な認知境界の証拠ではなく、システムレベルの制約の予測可能な結果であると主張している。
当初、テキストのみの世代に限定してパズルを宣言することは不可能であると宣言されたモデルは、現在ではエージェントツールを使用して解決するだけでなく、それまで克服できなかった難易度をはるかに超える複雑さを習得している。
論文 参考訳(メタデータ) (2025-06-23T17:14:21Z) - Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT [24.085953089267772]
複雑な場面において,OpenAI o3 と GPT-4o が基本的な物理法則,空間的相互作用,因果的影響を把握できないことを示す。
我々は、視覚連鎖(CoT)レンズによる視覚的身体的推論を厳格に評価するベンチマークであるMVPBenchを紹介した。
最先端のMLLMでさえ、物理領域における視覚的推論精度の低下と画像テキストアライメントの弱さを示す。
論文 参考訳(メタデータ) (2025-05-30T03:48:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。