論文の概要: Ranking Image Fusion the Way Humans Do: A Learned Pairwise Preference Metric for Infrared-Visible Fusion Assessment
- arxiv url: http://arxiv.org/abs/2608.01301v2
- Date: Tue, 04 Aug 2026 07:43:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.423915
- Title: Ranking Image Fusion the Way Humans Do: A Learned Pairwise Preference Metric for Infrared-Visible Fusion Assessment
- Title(参考訳): 人間の仕方による画像融合のランク付け:赤外線可視核融合評価のための学習されたペアワイズ選好指標
- Abstract要約: 本稿では,人間のA/B/Tie比較プロトコルをスケーラブルなサロゲートとして運用するソース条件付きモデルであるLearted Perceptual Image Fusion Measure(LPIFM)を提案する。
LPIFMは、赤外線源、可視光源、および2つの融合した候補を共同で観測し、A候補が良いか、B候補が良いか、または両者が知覚的に等価かを予測する。
LPIFMモデルの重み付け、ソースコード、評価コードとともにアノテーション付き選好データセットをリリースし、選好整合IVIF評価をサポートする。
- 参考スコア(独自算出の注目度): 11.746369329950227
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Infrared-visible image fusion (IVIF) has no ideal fused reference, so fusion algorithms are routinely ranked by scalar objective metrics that formalize different proxies for information transfer, structure, or source similarity. These proxies often disagree with the judgment that ultimately matters: given the same sources, which of two fused results does a human prefer? Direct pairwise comparison is an established reference protocol for relative subjective assessment, but its cost grows quadratically with the number of algorithms, which prevents routine use. We present the Learned Perceptual Image Fusion Measure (LPIFM), a source-conditioned model that operationalizes the human A/B/Tie comparison protocol as a repeatable, scalable surrogate. LPIFM jointly observes the infrared source, the visible source, and two fused candidates, and predicts whether candidate A is better, candidate B is better, or the two are perceptually equivalent. Supervision comes from a new dense preference corpus that covers every unordered comparison among a broad pool of fusion methods on the scenes of a public benchmark, labeled under a blinded, randomized, two-stage protocol with expert adjudication. Across scene- and method-generalization settings, LPIFM tracks human pairwise decisions closely and reproduces the tie-aware Bradley-Terry rankings derived from human labels; on full method pools it surpasses the strongest conventional metric by a wide margin in both pairwise accuracy and ranking correlation. We release the annotated preference dataset, together with the LPIFM model weights, source code, and evaluation code, to support preference-aligned IVIF assessment. LPIFM offers a practical instrument for human-aligned method comparison and ranking at scale.
- Abstract(参考訳): 赤外線可視画像融合(IVIF)は理想的な融合参照を持たないため、融合アルゴリズムは情報伝達、構造、ソース類似性の異なるプロキシを形式化するスカラー客観的指標によって定期的にランク付けされる。
これらのプロキシはしばしば、究極的には重要な判断に異を唱える:同じ情報源が与えられた場合、2つの融合した結果のうちどれが人間に好まれるのか?
直接対比較は、相対的な主観的評価のための確立された基準プロトコルであるが、そのコストは、通常の使用を防ぐためのアルゴリズムの数と2倍に増加する。
本稿では,人間のA/B/Tie比較プロトコルを反復的かつスケーラブルなサロゲートとして運用するソース条件付きモデルであるLearted Perceptual Image Fusion Measure(LPIFM)を提案する。
LPIFMは、赤外線源、可視光源、および2つの融合した候補を共同で観測し、A候補が良いか、B候補が良いか、または両者が知覚的に等価かを予測する。
Supervisionは、新しい密集した選好コーパスから生まれたもので、公開ベンチマークのシーンで、専門家の偏見を伴う盲目でランダムな2段階のプロトコルでラベル付けされた、幅広いフュージョンメソッドのプール間の、順序のないすべての比較をカバーしている。
LPIFMは、シーンとメソッドの一般化設定全体にわたって、人間同士の意思決定を綿密に追跡し、人間のラベルから得られるネクタイを意識したBradley-Terryランキングを再現する。
LPIFMモデルの重み付け、ソースコード、評価コードとともにアノテーション付き選好データセットをリリースし、選好整合IVIF評価をサポートする。
LPIFMは、人力による手法比較と大規模ランキングのための実用的な手段を提供する。
関連論文リスト
- Hub-Spectral Activation of Latent Multimodal Knowledge [48.72626098917089]
Hub-Spectral Activation (HSA) は、凍結表現における潜在マルチモーダル知識のハブ可読成分の回復と活性化のための閉形式法である。
HSAは、ハブエッジ統計データを合成し、標準化し、ペア化されたスペクトル方向を抽出し、信頼性に富んだ一致した証拠とソースゲートの候補分解を結合する。
論文 参考訳(メタデータ) (2026-09-15T12:27:42Z) - VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection [0.04736448323490553]
VendorBench-100は、ディープフェイク画像検出のためのクロスパラダイムなベンチマークである。
単一対角100画像コーパス,統一出力スキーマ,共通評価フレームワークを用いて36種類の代表モデルを評価する。
評価の結果,商用APIが最も高い性能を達成し,次いでビジョンLLMとオープンソース検出器が続いた。
論文 参考訳(メタデータ) (2026-07-07T13:22:00Z) - MMAO-Cls: Metabolic Multi-Agent Optimization for Joint Feature Selection and Classifier Tuning [0.5156484100374058]
MMAO(Multi-Agent Metabolic)は、分類モデル選択のための信頼性の高い外ループとして機能する。
本稿では,MMAO-Clsを提案する。MMAO-Clsは,各エージェントが2次元特徴マスクとハイパーパラメータを共に符号化する混合空間実現法である。
MMAO-Clsを7種類の標準ベンチマークで評価し,RandomSearch,GA-lite,PSO-lite,内因性no-sharing ablationと比較した。
論文 参考訳(メタデータ) (2026-07-01T23:40:27Z) - Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment [48.882448108261826]
赤外線可視画像融合(IVIF)は、熱情報と詳細な空間構造を単一の融合画像に統合し、知覚を高めることを目的としている。
近年のIVIF報酬モデリングの取り組みは人間の評価から学ぶが、集計されたスコアにスカラー回帰を用いる。
本稿では,MLLMを用いて人間の視覚知覚を再現し,連続的な品質スコアを生成するFuScoreを紹介する。
論文 参考訳(メタデータ) (2026-05-07T21:38:09Z) - EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment [63.853717062482815]
画像融合研究において評価は不可欠であるが、既存の指標のほとんどは、適切な適応なしに他の視覚タスクから直接借用されている。
画像融合に適した統合評価フレームワークを提案する。
我々の学習に基づく評価パラダイムは、様々な標準画像融合ベンチマークにおいて、優れた効率(最大1000倍高速)とより優れた一貫性を提供する。
論文 参考訳(メタデータ) (2026-04-03T09:12:16Z) - DoubleTake: Contrastive Reasoning for Faithful Decision-Making in Medical Imaging [0.0]
類似性ではなく、識別に最適化されたコンパクトなエビデンスセットを構成する、コントラストのある文書対応参照選択フレームワークを導入する。
本稿では,一対の視覚的比較を構造化し,根拠を忠実な棄却を伴うマージンに基づく決定規則を用いて集約する,信頼度に配慮した推論フレームワークであるCounterfactual-Contrastive Inferenceを提案する。
メドコンフュージョンのベンチマークでは,従来の手法と比較して設定レベルの精度が15%近く向上し,混乱を低減し,個々の精度が向上する。
論文 参考訳(メタデータ) (2026-02-02T23:00:39Z) - Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics [25.374192139098284]
マルチモーダル評価において,システム障害モードとしての原形質バイアスについて検討する。
我々は、動物、オブジェクト、デモグラフィー画像にまたがる対照ベンチマークProtoBiasを導入する。
以上の結果から,CLIPScore,PickScore,VQAベースのスコアなど,広く使用されているメトリクスが,これらのペアを誤用していることが判明した。
本稿では, 故障率を大幅に低減し, 誤判定を抑える, 頑健な7BパラメータであるProtoScoreを提案する。
論文 参考訳(メタデータ) (2026-01-08T13:49:14Z) - Calibrated Multi-Preference Optimization for Aligning Diffusion Models [90.15024547673785]
Calibrated Preference Optimization (CaPO) は、テキスト・ツー・イメージ(T2I)拡散モデルを調整する新しい手法である。
CaPOは、人間の注釈のない複数の報酬モデルからの一般的な好みを取り入れている。
実験結果から, CaPOは従来法よりも常に優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-02-04T18:59:23Z) - Model Inversion Attacks Through Target-Specific Conditional Diffusion Models [54.69008212790426]
モデル反転攻撃(MIA)は、ターゲット分類器のトレーニングセットからプライベートイメージを再構築することを目的としており、それによってAIアプリケーションにおけるプライバシー上の懸念が高まる。
従来のGANベースのMIAは、GANの固有の欠陥と潜伏空間における最適化の偏りにより、劣った遺伝子的忠実度に悩まされる傾向にある。
これらの問題を緩和するために拡散モデル反転(Diff-MI)攻撃を提案する。
論文 参考訳(メタデータ) (2024-07-16T06:38:49Z) - Diffusion-RPO: Aligning Diffusion Models through Relative Preference Optimization [68.69203905664524]
拡散に基づくT2Iモデルと人間の嗜好をより効率的に整合させる新しい手法であるDiffusion-RPOを紹介する。
我々は,高いコストと低い解釈可能性の課題を克服することを目的とした,新しい評価基準であるスタイルアライメントを開発した。
その結果,拡散-RPO は安定拡散バージョン1.5 と XL-1.0 の調整において超微調整や拡散-DPO などの確立された手法よりも優れていた。
論文 参考訳(メタデータ) (2024-06-10T15:42:03Z) - Evaluating Perceptual Distance Models by Fitting Binomial Distributions to Two-Alternative Forced Choice Data [43.714290271351466]
本稿では,二項決定モデルに最大推定値を適用し,より頑健な距離モデル評価手法を提案する。
提案手法は2つの2AFC PFデータセット上での様々な視覚距離モデルの評価から, 簡便さ, 可視性, 柔軟性, 計算効率が優れていることを示す。
論文 参考訳(メタデータ) (2024-03-15T15:21:04Z) - A Bayesian Active Learning Approach to Comparative Judgement [3.0098452499209705]
伝統的なマーキングは、不整合と無意識のバイアスの源であり、評価者に高い認知的負荷を課す。
CJでは、評価者には2つのアイテムが提示され、より良いものを選択するように求められます。
CJはマーキングの信頼できる方法と考えられているが、透明性に関する懸念がある。
比較項目のランクを決定するために,CJ (BCJ) に対する新しいベイズ的アプローチを提案する。
論文 参考訳(メタデータ) (2023-08-25T10:33:44Z) - Progressive Bilateral-Context Driven Model for Post-Processing Person
Re-Identification [20.143803695488106]
本稿では, サンプルと相手のコンテキストの関係から, ペアの測度を決定する軽量な後処理者再識別手法を提案する。
4つの大規模人物再識別ベンチマークデータセットの実験から,提案手法が常に高い精度を達成可能であることが示唆された。
論文 参考訳(メタデータ) (2020-09-07T13:35:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。