論文の概要: Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning
- arxiv url: http://arxiv.org/abs/2609.00658v1
- Date: Tue, 01 Sep 2026 03:36:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.271065
- Title: Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning
- Title(参考訳): 視覚・言語モデルを用いた尺度の学習 : 計量物理推論のためのラベル自由等分散学習
- Authors: Kaizhen Tan, Yang Feng, Heqing Du, Siru Tao, Xin Xu, Hanzhe Hong,
- Abstract要約: ビデオに関するメトリックな質問は、視覚計測を物理単位に変換するために視覚言語モデルを必要とする。
現在のモデルでは、このスケール情報を部分的にのみ使用しています。
8つの視覚言語モデルにまたがって、このアンダーレスポンスは4桁以上持続する。
メトリックアノテーションを必要とせずに、この正確なスケーリング関係を監視として使用します。
- 参考スコア(独自算出の注目度): 15.015602453377516
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Metric questions about video require vision-language models to use supplied real-world references to convert visual measurements into physical units. Yet we find that current models use this scale information only partially. When every world-space quantity in a prompt is rescaled by a common factor, the video remains equally valid and the correct answer changes by exactly that factor, but model predictions move only part of the way and accuracy remains concentrated near the familiar scale of the depicted objects. Across eight vision-language models, this under-response persists over four orders of magnitude. The same models recover the correct closed-form scaling laws when the identical physics is asked in a scale-free form, indicating that the main deficit lies in metric grounding rather than physical mechanism knowledge. We use this exact scaling relation as supervision without requiring metric annotations. Under a common rescaling of the supplied world-space quantities, the correct metric answer must change by the same factor. EquiSD exploits this constraint by projecting a model's own prediction onto the scale-equivariant family and fine-tuning the model on the resulting targets. It requires no ground-truth answers and only one model query per training video. On held-out simulated videos, EquiSD increases a 3B model's median response slope from 0.66 to 0.94 and improves mean relative accuracy by 9.2 points across scales. The learned relation generalizes to unseen world scales and transfers without adaptation to real QuantiPhy videos, where accuracy increases by 6.4 points. These results show that an exact physical symmetry can provide label-free supervision for improving metric grounding in vision-language models.
- Abstract(参考訳): ビデオに関するメトリックな質問は、視覚計測を物理単位に変換するために供給された実世界の参照を使用するために視覚言語モデルを必要とする。
しかし、現在のモデルでは、このスケールの情報は部分的にしか使われていない。
プロンプト内のすべての世界空間量が共通の因子によって再スケールされると、ビデオは相変わらず有効であり、正確にその因子によって正しい答えが変化する。
8つの視覚言語モデルにまたがって、このアンダーレスポンスは4桁以上持続する。
同じモデルは、同じ物理がスケールのない形で要求されるとき、正しい閉形式スケーリング法則を回復し、主な欠点は物理機構の知識ではなく計量基底にあることを示す。
メトリックアノテーションを必要とせずに、この正確なスケーリング関係を監視として使用します。
供給された世界空間量の共通再スケーリングの下では、正しい計量答えは同じ因子で変化しなければならない。
EquiSDはこの制約を利用して、モデル自身の予測をスケール平等なファミリーに投影し、結果のターゲットに対してモデルを微調整する。
基礎的な答えは不要で、トレーニングビデオごとに1つのモデルクエリしか必要ありません。
ホールドアウトシミュレーションビデオでは、EquiSDは3Bモデルの中央応答勾配を0.66から0.94に増加させ、平均相対精度をスケールで9.2ポイント向上させる。
学習された関係は、実際のQuantiPhyビデオに適応することなく、未知の世界スケールと転送に一般化され、精度は6.4ポイント向上する。
これらの結果は、正確な物理対称性は、視覚言語モデルにおけるメートル法基底を改善するためのラベルなしの監督を与えることができることを示している。
関連論文リスト
- RigidBench: Evaluating Rigid-Body Physics in Video Generation Models [16.53417077740312]
そこで本研究では,生成した継続と参照ロールアウトを同一の初期フレームと動作記述から比較したシミュレータグラウンドベンチマークを提案する。
同じ100の例で8つのモデルを評価し、これらの側面を分離する10の計測を行った。
完全な微調整により3次元軌道誤差は約20%減少し、SSIMはほとんど変化しない。
論文 参考訳(メタデータ) (2026-08-16T06:05:20Z) - WorldModelBench: Judging Video Generation Models As World Models [57.776769550453594]
ビデオ生成モデルは急速に進歩し、ロボット工学や自動運転といった意思決定アプリケーションをサポートするビデオワールドモデルとしての地位を確立している。
現在のベンチマークでは、これらの主張を厳格に評価することができず、一般的なビデオ品質にのみ焦点が当てられている。
アプリケーション駆動ドメインにおけるビデオ生成モデルのワールドモデリング能力を評価するためのベンチマークであるWorldModelBenchを提案する。
論文 参考訳(メタデータ) (2025-02-28T03:58:23Z) - What Do Learning Dynamics Reveal About Generalization in LLM Reasoning? [83.83230167222852]
モデルの一般化動作は,事前記憶列車の精度と呼ばれるトレーニング指標によって効果的に特徴づけられることがわかった。
モデルの学習行動と一般化を結びつけることで、トレーニング戦略に目標とする改善を導くことができる。
論文 参考訳(メタデータ) (2024-11-12T09:52:40Z) - How Far is Video Generation from World Model: A Physical Law Perspective [101.24278831609249]
OpenAIのSoraは、物理法則に準拠した世界モデルを開発するためのビデオ生成の可能性を強調している。
しかし、ビデオ生成モデルが人間の先行しない視覚データから純粋にそのような法則を発見する能力に疑問を投げかけることができる。
本研究は,3つの主要なシナリオ – 分布内,分布外,一般化 – について評価する。
論文 参考訳(メタデータ) (2024-11-04T18:53:05Z) - A Hitchhiker's Guide to Scaling Law Estimation [56.06982415792523]
スケーリング法則は、より少ないパラメータやより少ないトレーニングセットで訓練が容易なモデルから外挿することで、ターゲットとなる機械学習モデルの損失を予測する。
我々は1000以上のスケーリング法則を推定し、新しいモデルファミリーにおけるスケーリング法則を推定するためのベストプラクティスを導出する。
論文 参考訳(メタデータ) (2024-10-15T17:59:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。