論文の概要: MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.04859v1
- Date: Fri, 04 Sep 2026 08:18:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.969973
- Title: MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models
- Title(参考訳): MM-IFEval-Pro:視覚・言語モデルにおける指示追従のための多言語・攻撃耐性ベンチマーク
- Abstract要約: MM-IFEval-Proは中国語と英語のタスクと多様な命令ハイジャックケースをカバーするマルチモーダル・インストラクション・フォロー・ベンチマークである。
MM-IFEval-Proは4つの主要なタスクカテゴリと24のサブカテゴリと52のサブカテゴリを持つ8の命令カテゴリを含む。
MM-IFEval-Pro 上でのモデル性能を大幅に向上させるため,中国語と逆行命令に富んだ強化学習セットを構築した。
- 参考スコア(独自算出の注目度): 12.276375811378301
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As vision-language models (VLMs) rapidly advance in image understanding, cross-modal reasoning, and complex instruction execution, instruction-following capability has become a key indicator of their reliability and practicality. However, existing multimodal instruction-following benchmarks still suffer from limited language coverage and insufficient adversarial safety scenarios, making them inadequate for evaluating real-world multilingual and safety-sensitive settings. To address these gaps, we present MM-IFEval-Pro, a multimodal instruction-following benchmark covering Chinese and English tasks as well as diverse instruction hijacking cases. MM-IFEval-Pro includes 4 major task categories and 24 subcategories and 8 instruction categories with 52 subcategories, with each sample containing an average of 3.0 constraints to realistically simulate complex instruction scenarios. We further construct a reinforcement-learning training set enriched with Chinese and adversarial instructions, which significantly improves model performance on MM-IFEval-Pro and transfers effectively to other mainstream multimodal benchmarks, demonstrating strong cross-task and cross-language generalization.
- Abstract(参考訳): 視覚言語モデル(VLM)は、画像理解、クロスモーダル推論、複雑な命令実行において急速に進歩し、命令追従能力はその信頼性と実用性の重要な指標となっている。
しかし、既存のマルチモーダル命令追従ベンチマークは、言語カバレッジの制限と敵の安全シナリオの不足に悩まされており、現実世界のマルチランガルおよび安全に敏感な設定を評価するには不十分である。
MM-IFEval-Proは中国語と英語のタスクと多様な命令ハイジャックケースをカバーするマルチモーダル・インストラクション・フォロー・ベンチマークである。
MM-IFEval-Proは4つの主要なタスクカテゴリと24のサブカテゴリと52のサブカテゴリを持つ8の命令カテゴリを含む。
さらに、MM-IFEval-Proのモデル性能を大幅に向上させ、他の主流マルチモーダルベンチマークに効果的に移行し、強力なクロスタスクとクロスランゲージの一般化を示す。
関連論文リスト
- Multilingual Refusal Alignment for Safer Large Language Models [53.64286756804503]
単言語アライメントが言語横断的に伝達されるか,トレーニング中に言語一貫性が保たれるか,一般的な知識能力とのトレードオフが生じるかを検討する。
RefusEUは、12のヨーロッパ言語をカバーする新しい拒絶アライメントデータセットであり、現在の最先端モデルを評価するための専用のテストセットを含む。
制御された直接選好最適化(DPO)実験は、2つの重要な洞察を提供する: 英語でのみモデルを整列することは、同じハーネスカテゴリであっても、言語間安全を保証するには不十分である。
論文 参考訳(メタデータ) (2026-04-24T09:29:14Z) - MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks [37.069856351074385]
MCIF (Multimodal Crosslingual Instruction following) は、科学的な議論に基づく最初の多言語人手によるベンチマークである。
ショートフォームとロングフォームの両方の入力に対して、クロスランガルでマルチモーダルな設定で命令追従を評価するように設計されている。
言語、視覚、テキストの3つの中核的なモダリティと4つの多言語(英語、ドイツ語、イタリア語、中国語)にまたがる。
論文 参考訳(メタデータ) (2025-07-25T19:00:51Z) - SOI Matters: Analyzing Multi-Setting Training Dynamics in Pretrained Language Models via Subsets of Interest [5.882817862856554]
本研究では,マルチタスク,マルチ言語,マルチソースの学習アプローチが,事前学習した言語モデルの堅牢性と性能に与える影響について検討する。
興味のサブセット(SOI)は、忘れられない例、未学習例、常に正しい例を含む、トレーニング中の6つの異なる学習行動パターンを特定する。
その結果,マルチタスク学習は相似したタスクの組み合わせにおいて,相似した結果と相似した結果を示す一方,マルチタスク学習は分配性能を最大7%向上させることがわかった。
論文 参考訳(メタデータ) (2025-07-21T04:43:21Z) - Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models [26.91963265869296]
本研究は,インターネットミームにおける物語的役割の特定という課題について考察する。
元々は'他'クラスにスキューされたアノテーション付きデータセットの上に構築される。
包括的語彙および構造解析は、実際のミームで使われるニュアンス、文化特化、文脈に富んだ言語を強調している。
論文 参考訳(メタデータ) (2025-06-29T07:12:11Z) - MaXIFE: Multilingual and Cross-lingual Instruction Following Evaluation [7.343467302769559]
MaXIFEは、23言語にわたる命令追従能力を評価するために設計された総合的な評価ベンチマークである。
多言語命令追従評価のための標準化されたツールを提供することで、MaXIFEは自然言語処理の研究と開発を進めることを目指している。
論文 参考訳(メタデータ) (2025-06-02T15:20:20Z) - MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation [86.7047714187813]
MMLU-ProXは29の言語をカバーするベンチマークであり、英語のベンチマーク上に構築されている。
それぞれの言語バージョンは11,829の同一の質問で構成されており、直接言語間比較を可能にする。
効率的な評価ニーズを満たすため,言語毎の質問数は658件である。
論文 参考訳(メタデータ) (2025-03-13T15:59:20Z) - XIFBench: Evaluating Large Language Models on Multilingual Instruction Following [59.549015333755186]
大規模言語モデル(LLM)は、様々なアプリケーションにまたがる優れた命令追従機能を示している。
既存の評価には、様々な言語的文脈におけるきめ細かい制約分析が欠如している。
我々は,LLMの多言語命令追従能力を評価するための総合ベンチマークであるXIFBenchを紹介する。
論文 参考訳(メタデータ) (2025-03-10T17:07:52Z) - Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following [51.18383180774354]
Multi-IFは,大規模言語モデルの習熟度を多元的および多言語的指示に従って評価するための新しいベンチマークである。
Multi-IF 上での14の最先端 LLM の評価結果から,既存のベンチマークよりもはるかに難しい課題であることが判明した。
非ラテン文字(ヒンディー語、ロシア語、中国語)を持つ言語は一般的に高いエラー率を示し、モデルの多言語能力の潜在的な制限を示唆している。
論文 参考訳(メタデータ) (2024-10-21T00:59:47Z) - Meta-Task Prompting Elicits Embeddings from Large Language Models [54.757445048329735]
本稿では,新しい教師なしテキスト埋め込み手法であるMeta-Task Prompting with Explicit One-Word Limitationを紹介する。
モデル微調整を必要とせずに,大規模言語モデルから高品質な文埋め込みを生成する。
提案法は,多種多様なシナリオにまたがって生成を組み込む汎用的で資源効率のよい手法を提供する。
論文 参考訳(メタデータ) (2024-02-28T16:35:52Z) - XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating
Cross-lingual Generalization [128.37244072182506]
言語間TRansfer Evaluation of Multilinguals XTREMEは、40言語および9タスクにわたる多言語表現の言語間一般化能力を評価するためのベンチマークである。
我々は、英語でテストされたモデルは、多くのタスクにおいて人間のパフォーマンスに達するが、言語間変換されたモデルの性能にはまだ大きなギャップがあることを示した。
論文 参考訳(メタデータ) (2020-03-24T19:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。