論文の概要: PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
- arxiv url: http://arxiv.org/abs/2608.05249v2
- Date: Fri, 07 Aug 2026 01:16:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.087731
- Title: PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
- Title(参考訳): PRISM:構造化マルチモーダルデータ合成による優先性を考慮したルブリック内部化
- Abstract要約: PRISMは4段階のデータ合成フレームワークで、ペルソナ-タスクペア、プレフィックス誘導ルールセット、品質フィルタリングルーリック、構造化検証トレースを生成する。
PRISM-Evalは固定ラベルに対する決定論的マッチングを使用するため、推論時判断モデルを必要としない。
10Kの合成サンプルだけで、PRISMはQwen3-VL-4Bを9.5%から30.1%の精度でPRISM-Evalで持ち上げ、一般的なベンチマークでは平均性能を保っている。
- 参考スコア(独自算出の注目度): 7.143155129750046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world multimodal instructions often bundle multiple requirements with unequal importance, yet most multimodal training data still reduce instruction following to answering one self-contained question. We study this gap through rubric comprehension, which casts the model not as a generator measured against rubrics but as an executor that follows them: given an image and a typed, prioritized rubric, the model must verify each rule before producing an overall judgment. To support this setting, we propose PRISM, a four-stage data synthesis framework that produces persona--task pairs, prefix-guided rule sets, quality-filtered rubrics, and structured verification traces. We further introduce PRISM-Eval, whose Loose and Strict metrics use deterministic matching against fixed labels and therefore require no inference-time judge model. With only 10K synthesized samples, PRISM lifts Qwen3-VL-4B from 9.5% to 30.1% Strict accuracy on PRISM-Eval while preserving average performance on general benchmarks, and the gains transfer to four additional open-source MLLMs across dense and MoE architectures, suggesting that structured rubric supervision is a scalable path toward multi-rule, priority-aware multimodal instruction following.
- Abstract(参考訳): 実世界のマルチモーダル命令は、しばしば不平等な重要度で複数の要件をバンドルするが、ほとんどのマルチモーダルトレーニングデータは、1つの自己完結した質問に答えた後に命令を減らす。
我々は,このギャップを,ルーリックに対して測定された生成物としてではなく,それらに従う実行子として表現するルーリック理解を通して研究する:画像と型付けされた優先されたルーリックを与えられたモデルが,全体判定を生成する前に各ルールを検証する必要がある。
この設定をサポートするために、PRISMは、ペルソナ-タスクペア、プレフィックス誘導ルールセット、品質フィルタリングルーリック、構造化された検証トレースを生成する4段階のデータ合成フレームワークである。
さらにPRISM-Evalを導入し、LooseとStrictのメトリクスは固定ラベルに対する決定論的マッチングを使用するため、推論時判定モデルを必要としない。
10Kしか合成されていないサンプルで、PRISMはQwen3-VL-4Bを9.5%から30.1%に引き上げ、PRISM-Evalの精度を向上し、高密度およびMoEアーキテクチャで4つの追加のオープンソースMLLMに転送した。
関連論文リスト
- CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval [7.07006462273528]
CAMI(Cost-Aware Multi-Indexing)は、マルチインデックス構築を予算付き多目的ポートフォリオ選択問題として形式化するフレームワークである。
その結果,厳格な予算制約の下で,ハイリコールポートフォリオを系統的に分離することが判明した。
CAMIは、これらのハイリコールポートフォリオを、ランダムな検索ベースラインに比べて最大5倍の予算で体系的に識別することができる。
論文 参考訳(メタデータ) (2026-06-14T16:59:18Z) - PRIMA: Operational Patterns for Resilient Multi-Agent Research with Verifiable Identity and Convergent Feedback [0.0]
PRIMAは、複数時間にわたる協調型マルチエージェント研究システムとして運用されている。
主なコントリビューションは、生存可能な障害モードのための3つの運用パターンである。
グラフ同型ケーススタディは、生成されたアーティファクトのアーキテクチャ的クレームを根拠にしている。
論文 参考訳(メタデータ) (2026-05-23T23:27:46Z) - From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding [15.376371030121094]
ReceiptBenchは10万の多様なレシートからなる、大規模で人間による注釈付きベンチマークである。
ReceiptBenchは10万の多様なレシートからなる大規模で人手による注釈付きベンチマークである。
論文 参考訳(メタデータ) (2026-05-21T12:37:03Z) - TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models [76.92890872338235]
大規模事前学習型ビジョンランゲージモデル(VLM)は、強いゼロショット一般化を示すが、知覚不能な逆方向の摂動に対して非常に脆弱である。
ダウンストリームタスク固有のリトレーニングを必要とせずに堅牢性を高めるため,新しいテストタイムディフェンスであるTAMEを提案する。
論文 参考訳(メタデータ) (2026-05-17T18:07:08Z) - Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning [14.508049757681862]
LLMベースのコーディングエージェントは、トークンの予算の大部分をリポジトリファイルを読むのに費やしている。
この定式化がモデリングのボトルネックを生み出すことを示す。
コード関連性を2つの解釈可能な品質次元に分解する構造化プルーニングフレームワークであるLaMRを提案する。
論文 参考訳(メタデータ) (2026-05-14T18:30:10Z) - UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval [87.12447641908143]
組込みゼロショット合成ビジュアル検索フレームワークUniCVRを提案する。
UniCVRは、タスク固有の人間アノテーションのない3つのタスクすべてに共同で対処する。
ステージIでは,約3.5Mサンプルのキュレートされたデータセットに対して,コントラスト学習によりMLLMを合成クエリ埋め込み器として訓練する。
ステージIIでは,少数の上位候補に対して適応的予算付サブセットスコアを付与するMLLM誘導二重レベル再ランク機構を導入する。
論文 参考訳(メタデータ) (2026-04-22T08:16:50Z) - REALM: Reliable Expertise-Aware Language Model Fine-Tuning from Noisy Annotations [13.49289449502791]
本稿では,各アノテータに対して,モデルパラメータとスカラーの専門知識値を相互に学習するREALMを提案する。
我々は,Flan-T5の3つのサイズをシミュレートされたノイズアノテーションの下で微調整した5つの質問応答ベンチマークを評価した。
提案アルゴリズムは、単一タスクとマルチタスク設定の大部分において、ノイズの多いSFTを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-19T07:06:35Z) - DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning [64.33887406863899]
マルチモーダル偽装検出は、法医学とセキュリティのための聴覚的手がかりを解析することにより、偽装行動を特定することを目的としている。
既存のベンチマークでは、中間的な推論手段を使わずにバイナリラベルのみを提供する。
構造的キューレベルの記述と推論チェーンを用いた推論データセットを構築した。
1695年のサンプルでは、非実験的偽装検出データセットとしては最大である。
論文 参考訳(メタデータ) (2026-03-25T04:06:36Z) - VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents [1.06378109904813]
VAREXは政府形態からの構造化データ抽出を評価するためのベンチマークである。
ベンチマークは、1,777の文書と1,771のユニークな文書から成っており、3相品質保証を通じて真理を検証している。
結果は、4Bパラメータ以下では、コンプライアンス出力 -- 抽出能力ではなく -- が主要なボトルネックであることを示している。
論文 参考訳(メタデータ) (2026-03-16T11:15:56Z) - BTZSC: A Benchmark for Zero-Shot Text Classification Across Cross-Encoders, Embedding Models, Rerankers and LLMs [0.0]
ゼロショットテキスト分類(ZSC)は、コストのかかるタスク固有のアノテーションを排除することを約束する。
テキスト埋め込みモデル、リランカ、命令調整型大規模言語モデル(LLM)の最近の進歩は、NLIベースのアーキテクチャの優位性に挑戦している。
我々は、感情、トピック、意図、感情の分類にまたがる22の公開データセットの総合ベンチマークであるBTZSCを紹介する。
論文 参考訳(メタデータ) (2026-03-12T14:43:20Z) - MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks [56.350173737493215]
環境・社会・ガバナンス(ESG)報告は、持続可能性の実践の評価、規制コンプライアンスの確保、財務透明性の促進に不可欠である。
MMESGBenchは、マルチモーダル理解と複雑な推論を、構造的に多種多様なマルチソースESG文書間で評価するための、最初のベンチマークデータセットである。
MMESGBenchは、45のESG文書から得られた933の検証済みQAペアで構成され、7つの異なるドキュメントタイプと3つの主要なESGソースカテゴリにまたがる。
論文 参考訳(メタデータ) (2025-07-25T03:58:07Z) - Multi-Level Aware Preference Learning: Enhancing RLHF for Complex Multi-Instruction Tasks [81.44256822500257]
RLHFは、人工知能システムと人間の好みを結びつける主要なアプローチとして登場した。
RLHFは、複雑なマルチインストラクションタスクに直面すると、不十分なコンプライアンス機能を示す。
本稿では,マルチインストラクション能力を向上させる新しいMAPL(Multi-level Aware Preference Learning)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T08:33:11Z) - MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale [66.73529246309033]
MLLM(Multimodal large language model)は、多モーダルタスクにおいて大きな可能性を秘めている。
既存の命令チューニングデータセットは、中間的合理性のないフレーズレベルの答えのみを提供する。
そこで本研究では,大規模マルチモーダル・インストラクション・チューニング・データセットを構築するためのスケーラブルで費用対効果の高い手法を提案する。
論文 参考訳(メタデータ) (2024-12-06T18:14:24Z) - SoFA: Shielded On-the-fly Alignment via Priority Rule Following [90.32819418613407]
本稿では,各ダイアログにおけるルールを主制御機構として定義する,新たなアライメントパラダイムである優先ルールを提案する。
そこで本研究では,厳密な規則統合と固着性を確保するために,シミュレーションから優先信号に従う半自動蒸留手法であるプライオリティディスティルを提案する。
論文 参考訳(メタデータ) (2024-02-27T09:52:27Z) - Self-regulating Prompts: Foundational Model Adaptation without
Forgetting [112.66832145320434]
本稿では,PromptSRCと呼ばれる自己正規化フレームワークを提案する。
PromptSRCはタスク固有の汎用表現とタスクに依存しない汎用表現の両方に最適化するプロンプトを導く。
論文 参考訳(メタデータ) (2023-07-13T17:59:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。