論文の概要: MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.04859v2
- Date: Mon, 07 Sep 2026 13:28:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:42.027617
- Title: MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models
- Title(参考訳): MM-IFEval-Pro:視覚・言語モデルにおける指示追従のための多言語・攻撃耐性ベンチマーク
- Authors: Changming Xiao, Zhenliang Ni, Jinhui He, Han Shu, Jie Hu,
- Abstract要約: MM-IFEval-Proは中国語と英語のタスクと多様な命令ハイジャックケースをカバーするマルチモーダル・インストラクション・フォロー・ベンチマークである。
MM-IFEval-Proは4つの主要なタスクカテゴリと24のサブカテゴリと52のサブカテゴリを持つ8の命令カテゴリを含む。
MM-IFEval-Pro 上でのモデル性能を大幅に向上させるため,中国語と逆行命令に富んだ強化学習セットを構築した。
- 参考スコア(独自算出の注目度): 12.276375811378301
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As vision-language models (VLMs) rapidly advance in image understanding, cross-modal reasoning, and complex instruction execution, instruction-following capability has become a key indicator of their reliability and practicality. However, existing multimodal instruction-following benchmarks still suffer from limited language coverage and insufficient adversarial safety scenarios, making them inadequate for evaluating real-world multilingual and safety-sensitive settings. To address these gaps, we present MM-IFEval-Pro, a multimodal instruction-following benchmark covering Chinese and English tasks as well as diverse instruction hijacking cases. MM-IFEval-Pro includes 4 major task categories and 24 subcategories and 8 instruction categories with 52 subcategories, with each sample containing an average of 3.0 constraints to realistically simulate complex instruction scenarios. We further construct a reinforcement-learning training set enriched with Chinese and adversarial instructions, which significantly improves model performance on MM-IFEval-Pro and transfers effectively to other mainstream multimodal benchmarks, demonstrating strong cross-task and cross-language generalization.
- Abstract(参考訳): 視覚言語モデル(VLM)は、画像理解、クロスモーダル推論、複雑な命令実行において急速に進歩し、命令追従能力はその信頼性と実用性の重要な指標となっている。
しかし、既存のマルチモーダル命令追従ベンチマークは、言語カバレッジの制限と敵の安全シナリオの不足に悩まされており、現実世界のマルチランガルおよび安全に敏感な設定を評価するには不十分である。
MM-IFEval-Proは中国語と英語のタスクと多様な命令ハイジャックケースをカバーするマルチモーダル・インストラクション・フォロー・ベンチマークである。
MM-IFEval-Proは4つの主要なタスクカテゴリと24のサブカテゴリと52のサブカテゴリを持つ8の命令カテゴリを含む。
さらに、MM-IFEval-Proのモデル性能を大幅に向上させ、他の主流マルチモーダルベンチマークに効果的に移行し、強力なクロスタスクとクロスランゲージの一般化を示す。
関連論文リスト
- Multilingual Refusal Alignment for Safer Large Language Models [53.64286756804503]
単言語アライメントが言語横断的に伝達されるか,トレーニング中に言語一貫性が保たれるか,一般的な知識能力とのトレードオフが生じるかを検討する。
RefusEUは、12のヨーロッパ言語をカバーする新しい拒絶アライメントデータセットであり、現在の最先端モデルを評価するための専用のテストセットを含む。
制御された直接選好最適化(DPO)実験は、2つの重要な洞察を提供する: 英語でのみモデルを整列することは、同じハーネスカテゴリであっても、言語間安全を保証するには不十分である。
論文 参考訳(メタデータ) (2026-04-24T09:29:14Z) - MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks [37.069856351074385]
MCIF (Multimodal Crosslingual Instruction following) は、科学的な議論に基づく最初の多言語人手によるベンチマークである。
ショートフォームとロングフォームの両方の入力に対して、クロスランガルでマルチモーダルな設定で命令追従を評価するように設計されている。
言語、視覚、テキストの3つの中核的なモダリティと4つの多言語(英語、ドイツ語、イタリア語、中国語)にまたがる。
論文 参考訳(メタデータ) (2025-07-25T19:00:51Z) - MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation [86.7047714187813]
MMLU-ProXは29の言語をカバーするベンチマークであり、英語のベンチマーク上に構築されている。
それぞれの言語バージョンは11,829の同一の質問で構成されており、直接言語間比較を可能にする。
効率的な評価ニーズを満たすため,言語毎の質問数は658件である。
論文 参考訳(メタデータ) (2025-03-13T15:59:20Z) - XIFBench: Evaluating Large Language Models on Multilingual Instruction Following [59.549015333755186]
大規模言語モデル(LLM)は、様々なアプリケーションにまたがる優れた命令追従機能を示している。
既存の評価には、様々な言語的文脈におけるきめ細かい制約分析が欠如している。
我々は,LLMの多言語命令追従能力を評価するための総合ベンチマークであるXIFBenchを紹介する。
論文 参考訳(メタデータ) (2025-03-10T17:07:52Z) - Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following [51.18383180774354]
Multi-IFは,大規模言語モデルの習熟度を多元的および多言語的指示に従って評価するための新しいベンチマークである。
Multi-IF 上での14の最先端 LLM の評価結果から,既存のベンチマークよりもはるかに難しい課題であることが判明した。
非ラテン文字(ヒンディー語、ロシア語、中国語)を持つ言語は一般的に高いエラー率を示し、モデルの多言語能力の潜在的な制限を示唆している。
論文 参考訳(メタデータ) (2024-10-21T00:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。