論文の概要: MLLM-based Textual Explanations for Face Comparison
- arxiv url: http://arxiv.org/abs/2603.16629v2
- Date: Wed, 18 Mar 2026 19:45:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 12:39:48.231263
- Title: MLLM-based Textual Explanations for Face Comparison
- Title(参考訳): MLLMによる顔比較のためのテキスト記述法
- Abstract要約: 本研究では,MLLMが生成した顔認証タスクに関する説明を系統的に分析する。
以上の結果から,MLLMが正しい検証判断を下しても,伴う説明は検証不能あるいは幻覚的顔面属性に依存することが多いことが示唆された。
- 参考スコア(独自算出の注目度): 9.423763930383755
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) have recently been proposed as a means to generate natural-language explanations for face recognition decisions. While such explanations facilitate human interpretability, their reliability on unconstrained face images remains underexplored. In this work, we systematically analyze MLLM-generated explanations for the unconstrained face verification task on the challenging IJB-S dataset, with a particular focus on extreme pose variation and surveillance imagery. Our results show that even when MLLMs produce correct verification decisions, the accompanying explanations frequently rely on non-verifiable or hallucinated facial attributes that are not supported by visual evidence. We further study the effect of incorporating information from traditional face recognition systems, viz., scores and decisions, alongside the input images. Although such information improves categorical verification performance, it does not consistently lead to faithful explanations. To evaluate the explanations beyond decision accuracy, we introduce a likelihood-ratio-based framework that measures the evidential strength of textual explanations. Our findings highlight fundamental limitations of current MLLMs for explainable face recognition and underscore the need for a principled evaluation of reliable and trustworthy explanations in biometric applications. Code is available at https://github.com/redwankarimsony/LR-MLLMFR-Explainability.
- Abstract(参考訳): マルチモーダル大規模言語モデル(MLLM)は、顔認識決定のための自然言語説明を生成する手段として最近提案されている。
このような説明は人間の解釈可能性を促進するが、制約のない顔画像に対する信頼性は未解明のままである。
本研究では,難易度の高いIJB-Sデータセット上で,MLLMが生成した顔認証タスクに関する説明を系統的に分析し,極端なポーズの変動と監視画像に焦点を当てた。
以上の結果から,MLLMが正しい検証判断を下す場合でも,視覚的証拠に支えられていない非検証的・幻覚的顔面特性にしばしば依存することが示唆された。
さらに、入力画像とともに、従来の顔認識システムからの情報、ビズ、スコア、決定を組み込むことの効果について検討する。
このような情報は分類的検証性能を向上させるが、一貫して忠実な説明につながるわけではない。
判定精度以上の説明を評価するために,テキスト説明の明らかな強度を測定する可能性比に基づくフレームワークを提案する。
本研究は,現在のMLLMの基本的限界を浮き彫りにし,バイオメトリックス応用における信頼性・信頼性評価の必要性を浮き彫りにした。
コードはhttps://github.com/redwankarimsony/LR-MLLMFR-Explainabilityで公開されている。
関連論文リスト
- Vision Language Model Fusion for Explainable Face Recognition [8.078681487621667]
視覚言語モデル(VLM)は、説明可能な顔認識のための有望な基盤を提供する。
本研究は、複数のVLMを組み合わせて認識精度を向上させることができるかどうかを検討する。
論文 参考訳(メタデータ) (2026-08-25T11:44:31Z) - Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance [57.17102098930037]
大規模言語モデル(LLM)は高い性能を達成し、NLPに革命をもたらした。
説明責任の欠如はブラックボックスとして扱われ、透明性と信頼を求めるドメインでの使用を制限する。
本研究では,注意レベルの介入を通じて説明生成を導くことにより,信頼感を高める訓練自由手法を提案する。
論文 参考訳(メタデータ) (2026-04-15T18:32:32Z) - VerLM: Explaining Face Verification Using Natural Language [50.56081916981731]
顔認証のための革新的視覚言語モデル(VLM)を提案する。
我々のモデルは2つの補完的な説明スタイルを用いて一意に訓練されている。
提案するVLMは,高度な特徴抽出技術と高度な推論機能を統合し,検証プロセスの明瞭な記述を可能にする。
論文 参考訳(メタデータ) (2026-01-05T05:16:07Z) - Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection [58.82268659497348]
この失敗の根源は、根本的なミスマッチにある、と私たちは主張する。
本稿では,偽画像検出のための汎用的で説明可能な,会話型アシスタントであるForensic-Chatを提案する。
論文 参考訳(メタデータ) (2025-09-29T20:59:19Z) - ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models [82.04858317800097]
ForenXは画像の真正性を識別するだけでなく、人間の思考に共鳴する説明を提供する新しい手法である。
ForenXは、強力なマルチモーダル大言語モデル(MLLM)を使用して、法医学的な手がかりを分析し、解釈する。
本稿では,AI生成画像における偽証拠の記述専用のデータセットであるForgReasonを紹介する。
論文 参考訳(メタデータ) (2025-08-02T15:21:26Z) - FaceInsight: A Multimodal Large Language Model for Face Perception [69.06084304620026]
本研究では,顔の詳細な情報を提供する多目的顔認識大言語モデル (MLLM) を提案する。
本手法では, 顔情報間の不確かさと決定論的関係の両方をモデル化するために, 顔知識の視覚的・テキスト的アライメントを導入する。
3つの顔認識タスクに対する総合的な実験と分析により、FaceInsightはMLLMと比較した9つの性能を一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2025-04-22T06:31:57Z) - VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity [34.29409506366145]
VERIFYは最先端MLLMの視覚的推論能力を分離し、厳格に評価するために設計されたベンチマークである。
それぞれの問題には人手による推論パスが伴い、モデル決定プロセスの詳細な評価を初めて提供する。
本稿では,従来のモデル推論パターンにおける重要な不均衡を浮き彫りにして,単なる精度を超える視覚的推論の忠実さを評価する新しい指標を提案する。
論文 参考訳(メタデータ) (2025-03-14T16:26:11Z) - Can LLMs Produce Faithful Explanations For Fact-checking? Towards
Faithful Explainable Fact-Checking via Multi-Agent Debate [75.10515686215177]
大規模言語モデル(LLM)はテキスト生成に優れるが、事実チェックにおいて忠実な説明を生成する能力は依然として過小評価されている。
多様な役割を持つエージェントとして複数のLSMを利用するマルチエージェント・デベート・リファインメント(MADR)フレームワークを提案する。
MADRは、最終的な説明が厳密な検証を行い、不誠実な要素の可能性を著しく低減し、提示された証拠と密接に一致させることを保証する。
論文 参考訳(メタデータ) (2024-02-12T04:32:33Z) - FaithLM: Towards Faithful Explanations for Large Language Models [60.45183469474916]
大規模言語モデルの忠実度を評価し改善するモデルに依存しないフレームワークであるFaithLMを紹介した。
FaithLMは一貫して忠実度を高め、強い自己説明ベースラインよりも人間の合理性に整合した説明を生成する。
論文 参考訳(メタデータ) (2024-02-07T09:09:14Z) - From Understanding to Utilization: A Survey on Explainability for Large
Language Models [27.295767173801426]
この調査は、Large Language Models (LLMs) における説明可能性の向上を示唆している。
主に、トレーニング済みの Transformer ベースの LLM に重点を置いています。
説明可能性の活用を考える際に、モデル編集、制御生成、モデル拡張に集中するいくつかの魅力的な方法を検討する。
論文 参考訳(メタデータ) (2024-01-23T16:09:53Z) - Quantifying Uncertainty in Natural Language Explanations of Large
Language Models [29.34960984639281]
大規模言語モデル (LLM) は、高スループット自然言語処理 (NLP) アプリケーションのための強力なツールとして、ますます使われている。
生成された説明の不確かさを定量化するために、$textitVerbalized Uncertainty$と$textitProbing Uncertainty$という2つの新しいメトリクスを提案します。
ベンチマークデータセットの実証分析により、言語化された不確実性は説明の信頼性の信頼できる見積りではないことが判明した。
論文 参考訳(メタデータ) (2023-11-06T21:14:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。