論文の概要: Prior Bias in Vision Language Models on UML Diagram Interpretation
- arxiv url: http://arxiv.org/abs/2607.02853v1
- Date: Fri, 03 Jul 2026 01:29:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.434555
- Title: Prior Bias in Vision Language Models on UML Diagram Interpretation
- Title(参考訳): UMLダイアグラム解釈に基づく視覚言語モデルの事前バイアス
- Abstract要約: 先行コンフォーミングダイアグラムと先行コンプリケーションダイアグラムがペアリングされる制御されたベンチマークを導入する。
InternVL3.5 と Qwen3 という2つのモデルファミリと,GPT-5.4 と GPT-5.4 Mini の2つのクローズドソースフロンティアモデルから8つのオープンソースビジョン言語モデルを評価する。
- 参考スコア(独自算出の注目度): 5.453745629140304
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Language Models (VLMs) are increasingly applied to software engineering artifacts, especially UML class diagrams whose meaning depends on visual notation. Yet, it is unclear whether VLMs actually read such diagrams or instead answer from pretrained priors about how classes typically relate. We introduce a controlled UML benchmark in which each prior-conforming diagram is paired with its prior-conflicting counterpart that (1) preserves the same class names and layout while (2) reverses only the relation arrow. We evaluate eight open-source VLMs from two model families, InternVL3.5 and Qwen3, alongside two closed-source frontier models GPT-5.4 and GPT-5.4 Mini. Across the eight open-source models, reversing the arrow reduces relation-direction accuracy by 33.48% on average, while GPT-5.4 Mini retains a 10% gap. In the harder three-class condition, accuracy drops sharply by 45.28% for open-source models, and even 18.62% for the GPT-5.4 family on average. Scaling provides only limited improvements and is family-dependent. Our benchmark presents a diagnostic prior-driven failure in diagram-grounded software understanding. Our artifact is available at https://anonymous.4open.science/r/UMLKnowledgeConflict-8461.
- Abstract(参考訳): 視覚言語モデル(VLM)は、ソフトウェア工学の成果物、特に視覚的な表記に依存するUMLクラス図にますます適用されています。
しかし、VLMが実際にそのようなダイアグラムを読んだのか、それともクラスがどのように関係しているか、事前訓練された事前の回答なのかは不明だ。
我々は,(1)同じクラス名とレイアウトを保持し,(2)は関係矢印のみを反転させる前処理ダイアグラムと,前処理ダイアグラムをペアリングする制御されたUMLベンチマークを導入する。
我々は,2つのモデルファミリーであるInternVL3.5とQwen3の8つのオープンソースVLMと,2つのクローズドソースフロンティアモデルであるGPT-5.4とGPT-5.4 Miniを評価した。
8つのオープンソースモデル全体で、矢印を反転させることで関係方向の精度は平均33.48%減少し、GPT-5.4 Miniは10%の差を保っている。
より厳しい3クラス条件では、オープンソースモデルでは45.28%、GPT-5.4ファミリーでは18.62%の精度が急激に低下する。
スケーリングは限定的な改善のみを提供し、家族に依存している。
筆者らのベンチマークでは, ダイアグラムに基づくソフトウェア理解において, 診断に先導した障害を提示する。
私たちのアーティファクトはhttps://anonymous.4open.science/r/UMLKnowledgeConflict-8461で公開されています。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness [0.0]
少数のインプット・アウトプット・デモペアをクエリにプリプロンプトして大きな言語モデルに提示する手法であるFew-shot promptingは、NLPで広く採用されている。
しかし、分類性能において、ショットカウントがモデルスケール、アーキテクチャ、出力フォーマットのコンプライアンスとどのように相互作用するかについて、体系的な研究はほとんど行われていない。
論文 参考訳(メタデータ) (2026-07-25T00:31:40Z) - Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams [8.001015579487921]
Enginuityは、エンジニアリング図上でビジュアル言語モデルを評価するための、最初のオープンデータセットとベンチマークである。
我々は、米軍部隊のコーパス上の2つのタスクを定義し、構造化された部品テーブル抽出と自由形視覚図質問応答というマニュアルを修復する。
ゼロショットおよびチェーン・オブ・フォアプロンプトによる4つのフロンティアVLMの評価を行った。
論文 参考訳(メタデータ) (2026-06-02T09:54:03Z) - Don't Make the LLM Read the Graph: Make the Graph Think [13.277447097714395]
協調型マルチエージェントカードゲーム「はなび」において,明示的な信念グラフがLLM性能を向上させるか否かを検討する。
3000以上の対照試験により,4つの結果が得られた。
論文 参考訳(メタデータ) (2026-04-24T22:56:19Z) - GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning [116.80874591718323]
視覚言語モデル(VLM)のファミリーであるGLM-4.1VシンキングとGLM-4.5Vを提案する。
GLM-4.5Vは、ほぼ全てのタスクにおいて、同じ大きさのオープンソースモデル間で最先端のパフォーマンスを達成する。
より小型のGLM-4.1V-9Bシンキングは29のベンチマークでより大型のQwen2.5-VL-72Bよりも競争力に優れていた。
論文 参考訳(メタデータ) (2025-07-01T17:55:04Z) - S*: Test Time Scaling for Code Generation [55.11863577956177]
コード生成のための最初のハイブリッドテストタイムスケーリングフレームワークであるS*を提案する。
S*は生成されたコードのカバレッジと選択精度を大幅に改善する。
論文 参考訳(メタデータ) (2025-02-20T09:18:53Z) - ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates [51.633266497799745]
思考テンプレートのスケーリングによる階層的LLM推論は、推論検索空間を効果的に最適化することができる。
i)類似または関連する推論問題に一般化可能な500ほどの高レベルな思考テンプレートを含む構造化・汎用的な思考テンプレートライブラリ,(ii)長いCoTではなく一連の思考テンプレート上で階層的な強化学習を行う,(iii)全く新しい推論スケーリングシステム,の3つの革新を紹介した。
論文 参考訳(メタデータ) (2025-02-10T18:51:47Z) - RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness [88.82621231987815]
RLAIF-Vは,MLLMを完全なオープンソースパラダイムで整列させる新しいフレームワークである。
RLAIF-Vは、高品質なフィードバックデータ生成を含む2つの観点から、オープンソースのMLLMを最大限に探求する。
RLAIF-Vは、自動評価と人的評価の両方で6つのベンチマーク実験を行い、モデルの信頼性を大幅に向上させることを示した。
論文 参考訳(メタデータ) (2024-05-27T14:37:01Z) - Assessing GPT-4-Vision's Capabilities in UML-Based Code Generation [0.5789654849162464]
GPT-4-Visionは最先端のディープラーニングモデルである。
UML(Unified Modeling Language)クラスダイアグラムを完全なJavaクラスファイルに変換することができる。
論文 参考訳(メタデータ) (2024-04-22T17:21:24Z) - The All-Seeing Project V2: Towards General Relation Comprehension of the Open World [58.40101895719467]
本稿では,画像のオブジェクト関係を理解するために設計された新しいモデルとデータセットであるAll-Seeing Project V2を紹介する。
本稿では,テキスト生成,オブジェクトローカライゼーション,関係理解の定式化を関係会話タスクに統合するAll-Seeing Model V2を提案する。
我々のモデルは、画像内の全ての物体を知覚・認識するだけでなく、それらの間の複雑な関係グラフの把握にも優れている。
論文 参考訳(メタデータ) (2024-02-29T18:59:17Z) - Evaluating Large Language Models on Graphs: Performance Insights and
Comparative Analysis [7.099257763803159]
グラフデータを用いた解析問題に対処する4つの大規模言語モデル(LLM)の性能評価を行った。
私たちは、正確性、忠実性、そして正当性という、4つの異なる評価指標を採用しています。
GPTモデルは論理的およびコヒーレントな結果を生成し、正確性において代替よりも優れる。
論文 参考訳(メタデータ) (2023-08-22T06:32:07Z) - IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models [80.4460931172274]
大規模言語モデル(LLM)を用いた視覚・言語推論(VL)を分解するフレームワークを開発する。
特に、IdealGPTは、VCRでは10%、SNLI-VEでは15%、既存のGPT-4のようなモデルよりも優れています。
論文 参考訳(メタデータ) (2023-05-24T10:19:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。