論文の概要: Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures
- arxiv url: http://arxiv.org/abs/2609.00663v1
- Date: Tue, 01 Sep 2026 03:42:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.273028
- Title: Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures
- Title(参考訳): 視覚言語モデルにおける推論からの分離知覚--結晶構造のためのモデルフリーレンダリング天井
- Authors: Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban,
- Abstract要約: マルチモーダル評価は、視覚言語モデルが画像を読み間違えたか、それを誤読したかは定かではない。
我々は、既知のオブジェクトをレンダリングすることによって構築されたベンチマークのためのモデルなし参照であるレンダリング天井を紹介する。
我々は、天井が2,160個の結晶構造上に空になっていることを証明し、射影偶然の計算可能なセットを通してのみ失敗することを証明した。
- 参考スコア(独自算出の注目度): 2.3982445219832678
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal evaluations cannot say whether a vision-language model misread an image or misreasoned about it, because every existing method for separating the two places a second model in the loop. We introduce the render ceiling, a model-free reference for benchmarks built by rendering known objects: inverting the frozen cameras and re-solving cross-view correspondence recovers exactly the answer the images support. We prove the ceiling fails only through an enumerable set of projection coincidences and certify that set empty on 2,160 rendered crystal structures, so every point of a model's deficit belongs to the model. Across fourteen vision-language models, supplying exact geometry as text lifts every model yet closes under half the gap for thirteen, while a supervised vision model with no language component reads the same images at 0.8952, above every vision-language model. The instrument exposes extraction-stage fabrication that downstream accuracy would misattribute to reasoning, yields camera-placement rules for benchmark builders, and transfers to any benchmark with an invertible forward rendering.
- Abstract(参考訳): マルチモーダル評価では、視覚言語モデルが画像を読み間違えたのか、あるいは誤読したのかは定かでない。
我々は、既知のオブジェクトをレンダリングすることによって構築されたベンチマークのモデルフリー参照であるレンダリング天井を導入し、凍結したカメラを反転させ、クロスビュー対応を再解決することで、画像がサポートする答えを正確に回復する。
我々は、天井が射影偶然の計算可能なセットによってのみ失敗することを証明し、2,160個の結晶構造に空に設定されたことを証明し、モデル欠陥のすべての点がモデルに属することを証明した。
14の視覚言語モデルで、テキストがすべてのモデルを持ち上げるときに正確な幾何学を提供するが、言語コンポーネントを持たない教師付き視覚モデルは、すべての視覚言語モデルよりも0.8952で同じ画像を読み取る。
この装置は、下流の精度が推論に悪影響を及ぼし、ベンチマークビルダーのカメラ配置ルールが得られ、非可逆な前方レンダリングを持つ任意のベンチマークに転送される、抽出段階の製作を露呈する。
関連論文リスト
- Guess the Unified Model: How Much Can We Recover from Generated Images? [3.248768581088291]
7つの統一モデルにより生成された画像を用いて、汚職、ドメイン、プロンプト言語間の分離性を検討する。
モデル属性は,モデル毎の約20K画像でほぼ完全な精度を実現するため,極めて実現可能であることを示す。
論文 参考訳(メタデータ) (2026-05-24T20:59:08Z) - Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions [2.9521041993295607]
視覚言語モデル(VLM)は、古典的な光学錯視に直面した場合、体系的なバイアスを示す。
モデルトレーニングなしでこの障害モードに対処するツール誘導推論フレームワークを提案する。
我々は3つの経験的観察を報告し、さらなる調査を保証していると信じている。
論文 参考訳(メタデータ) (2026-03-31T08:35:10Z) - RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose Estimation [57.182509595660946]
テンプレートベースのオブジェクトポーズ推定をレイアライメント問題として再構成する。
拡散型カメラポーズ推定の最近の進歩に触発されて,この定式化を拡散変圧器アーキテクチャに組み込む。
狭められたテンプレートサンプリングに基づく粗大なトレーニング戦略は、ネットワークアーキテクチャを変更することなく性能を向上させる。
論文 参考訳(メタデータ) (2025-10-21T11:01:20Z) - DeOcc-1-to-3: 3D De-Occlusion from a Single Image via Self-Supervised Multi-View Diffusion [50.90541069907167]
閉塞型マルチビュー生成のためのエンドツーエンドフレームワークであるDeOcc-1-to-3を提案する。
私たちの自己教師型トレーニングパイプラインは、隠蔽されたイメージペアと擬似地上構造ビューを活用して、モデル構造を意識した補完とビュー整合性を教える。
論文 参考訳(メタデータ) (2025-06-26T17:58:26Z) - DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features [65.8738034806085]
DistillNeRFは、自動運転シーンにおける3D環境を理解するための自己教師型学習フレームワークである。
本手法は,スパースで単一フレームのマルチビューカメラ入力からリッチなニューラルシーン表現を予測する一般化可能なフィードフォワードモデルである。
論文 参考訳(メタデータ) (2024-06-17T21:15:13Z) - Towards Robust and Expressive Whole-body Human Pose and Shape Estimation [51.457517178632756]
全体のポーズと形状の推定は、単眼画像から人体全体の異なる振る舞いを共同で予測することを目的としている。
既存の手法では、既存のシナリオの複雑さの下で、しばしば劣化したパフォーマンスを示す。
全身のポーズと形状推定の堅牢性を高める新しい枠組みを提案する。
論文 参考訳(メタデータ) (2023-12-14T08:17:42Z) - Composing Ensembles of Pre-trained Models via Iterative Consensus [95.10641301155232]
本稿では,異なる事前学習モデルのアンサンブルを構成するための統一的なフレームワークを提案する。
事前学習したモデルを「ジェネレータ」あるいは「スコーラ」として使用し、クローズドループ反復コンセンサス最適化により構成する。
スコアラーのアンサンブルによって達成されたコンセンサスは、シングルスコアラーのフィードバックよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-10-20T18:46:31Z) - The Best of Both Worlds: Combining Model-based and Nonparametric
Approaches for 3D Human Body Estimation [20.797162096899154]
本稿では,グローバル画像特徴量からモデルパラメータを推定するフレームワークを提案する。
密度マップ予測モジュールは、画像証拠と身体モデルの各部分との間の密度UV対応を明確に確立する。
逆キネマティクスモジュールはキーポイント予測を洗練し、テンプレートメッシュを生成する。
紫外線塗布モジュールは、対応する特徴、予測、提案されたテンプレートに依存し、閉塞した身体形状の予測を完了させる。
論文 参考訳(メタデータ) (2022-05-01T16:39:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。