論文の概要: Evaluating the Semantic-to-Geometric Gap in Adversarial Defenses Against Vision-Language Model-Based Plagiarism
- arxiv url: http://arxiv.org/abs/2609.26733v1
- Date: Tue, 22 Sep 2026 17:23:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.767701
- Title: Evaluating the Semantic-to-Geometric Gap in Adversarial Defenses Against Vision-Language Model-Based Plagiarism
- Title(参考訳): 視覚言語モデルに基づくプラギアリズムに対する対人防御における意味的-幾何学的ギャップの評価
- Abstract要約: 視覚言語モデル(VLM)により、学生はグラフィカルな問題を単体画像として捉えて提出することで、意味のあるエンゲージメントを回避できる。
VLMの限界に関する実用的なデータを持つ教育者に対し、モデル性能の劣化を図った逆画像の有効性について検討する。
高い能力を持つVLMは高いロバスト性を示すが、全てのモデルは敵の摂動に弱い。
- 参考スコア(独自算出の注目度): 0.09332987715848716
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapidly advancing capabilities of vision-language models (VLMs) present a systemic challenge to academic integrity. VLMs now allow students to bypass meaningful engagement by capturing and submitting graphical problems as singular images, a practice we define as trivial plagiarism. To provide educators with actionable data on VLM limitations, we investigate the efficacy of heuristic adversarial image transformations designed to degrade model performance while remaining human-interpretable. Through a two-phase evaluation of introductory assessments, we manually assess baseline VLM performance on circuit diagrams, followed by an automated large-scale evaluation of topological structures (logic gates) and coordinate geometry (Karnaugh maps). We find that while highly capable VLMs can exhibit appreciable robustness, all models suffer vulnerability to adversarial perturbations. We conclude that while visual perturbations act as a viable near-term stopgap, long-term assessment security requires educators to reapproach assessment design given continually increasing VLM performance.
- Abstract(参考訳): 視覚言語モデル(VLM)の急速に進歩する能力は、学術的完全性に対する体系的な挑戦である。
VLMでは,グラフィカルな問題を単体画像として捉えて提出することで,学生が有意義なエンゲージメントを回避できるようになった。
VLMの限界に関する実用的なデータを持つ教育者に対し、人間の解釈可能なままモデル性能を劣化させるように設計されたヒューリスティックな逆画像変換の有効性について検討する。
導入評価の2段階評価を通じて,回路図上でのベースラインVLM性能を手作業で評価し,次いでトポロジ構造(論理ゲート)と座標幾何学(カルノーマップ)の大規模自動評価を行った。
高い能力を持つVLMは高いロバスト性を示すが、全てのモデルは敵の摂動に弱い。
視覚的摂動は短期的な停止ギャップとして機能するが, 長期評価セキュリティでは, VLMの性能を継続的に向上させることで, 教育者が評価設計を再適用する必要があると結論付けた。
関連論文リスト
- Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis [63.49939245944781]
我々は1100万の質問と0.28万の画像を含む総合的なきめ細かい評価ベンチマークであるFG-BMKを紹介する。
現在のLVLMは、視覚的表現、セマンティックグラウンドディング、モダリティアライメント、カテゴリーレベルの知識において、相互に絡み合ったボトルネックから生じる障害を伴って、微粒化認識器が不十分なままである。
論文 参考訳(メタデータ) (2026-06-17T13:23:26Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks [11.064940886724257]
本稿では,視覚言語モデル(VLM)の自然なシナリオ下での体系的評価フレームワークを提案する。
ゼロショット画像分類,セマンティックセグメンテーション,視覚的質問応答において,選択したVLMの自然な対向性能を測定した。
解析の結果,頑健なCLIPモデルでは自然の敵対的脆弱性が増幅され,CLIPモデルでは自然言語による敵対的事例のパフォーマンスが著しく低下することが判明した。
論文 参考訳(メタデータ) (2026-04-06T06:48:32Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Revisiting CroPA: A Reproducibility Study and Enhancements for Cross-Prompt Adversarial Transferability in Vision-Language Models [0.0]
VLM(Large Vision-Language Models)はコンピュータビジョンに革命をもたらし、画像分類、キャプション、視覚質問応答などのタスクを可能にする。
特に視覚とテキストの両方のモダリティを操作できるシナリオでは、敵攻撃に対して非常に脆弱なままである。
我々は,「イメージは1000の嘘である:視覚・言語モデルにおける逆転可能性」の総合的研究を行う。
論文 参考訳(メタデータ) (2025-06-28T19:01:41Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset [92.99416966226724]
我々は、未学習アルゴリズムの有効性を頑健に評価するために設計された新しいVLMアンラーニングベンチマークであるFacial Identity Unlearning Benchmark (FIUBench)を紹介する。
情報ソースとその露出レベルを正確に制御する2段階評価パイプラインを適用した。
FIUBench 内の 4 つのベースライン VLM アンラーニングアルゴリズムの評価により,すべての手法がアンラーニング性能に制限されていることが明らかとなった。
論文 参考訳(メタデータ) (2024-11-05T23:26:10Z) - Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding [6.798129852396113]
視覚言語モデル(VLM)における合成推論を改善するためのシンプルで効果的な手法を提案する。
本手法は,標準画像テキストコントラスト学習フレームワークを改良・拡張することで,利用可能なデータセットをより活用する。
CLIPと統合すると、最先端のベースラインよりも顕著な改善が得られます。
論文 参考訳(メタデータ) (2023-06-15T03:26:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。