論文の概要: Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis
- arxiv url: http://arxiv.org/abs/2607.24539v1
- Date: Mon, 27 Jul 2026 15:17:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.475377
- Title: Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis
- Title(参考訳): グリッド診断のためのマルチモーダルLLMのタスク・コンディショナル・フェースフルネス監査
- Abstract要約: マルチモーダル大言語モデル(LLM)は、トポロジー、測定、インシデントテキストを組み合わせてグリッド診断を行うことができる。
本稿では,タスク条件の忠実度監査を行うための一般的な枠組みを提案する。
- 参考スコア(独自算出の注目度): 5.427346259545067
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (LLMs) can combine topology, measurements, and incident text for grid diagnosis, yet answer accuracy does not establish that task-appropriate evidence was used. This letter proposes a general framework in order to conduct task-conditional faithfulness audit. It compares self-reported reliance, intervention-derived behavioral reliance, and preregistered engineering importance. The framework first registers task-specific evidence requirements and compares them with self-reported reliance and behavioral changes under controlled modality ablations. To resolve detected discrepancies, we design an evidence-gated correction and re-audit mechanism that regenerates failed responses under evidence constraints and independently re-ablates them to verify improved grounding without performance loss. Case studies evaluate three differently scaled LLMs on IEEE 39- and 118-bus scenarios. These results validate the framework ability to detect, diagnose, and correct task-conditional faithfulness failures.
- Abstract(参考訳): マルチモーダル大規模言語モデル(LLM)は、トポロジ、測定、インシデントテキストを組み合わせてグリッド診断を行うことができるが、解答精度は、タスク不適切な証拠が使われたことを証明していない。
本稿では,タスク条件の忠実度監査を行うための一般的な枠組みを提案する。
自己申告された信頼、介入に基づく行動依存、および事前登録された工学的重要性を比較する。
このフレームワークは、まずタスク固有のエビデンス要件を登録し、制御されたモダリティ改善の下で、自己報告された信頼と行動の変化と比較する。
検出された不一致を解決するため,エビデンス付き修正・再監査機構を設計し,エビデンス制約下で失敗した応答を再生し,独立に再検証し,性能損失を伴わずに改良されたグラウンドの検証を行う。
ケーススタディでは、IEEE 39-と118-busのシナリオで3つの異なるスケールのLCMを評価する。
これらの結果は、タスク条件の忠実度障害を検出し、診断し、修正するフレームワーク能力を検証する。
関連論文リスト
- The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics [0.9668407688201359]
チェーン・オブ・思想(CoT)推論は、大きな言語モデル(LLM)のパフォーマンスを改善する。
言語化されたCoTを利用して推論の正しさをモニタリングする既存のアプローチは、個々の中間ステップの意味的正しさまたは整合性を大きく評価する。
機能障害は、可視的推論の構造において、タスク依存の分散変化として表れることを示す。
論文 参考訳(メタデータ) (2026-08-04T08:04:36Z) - AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows [0.0]
AuditWeaveは、AIアシストとデータ変換のステップを1つのハッシュチェーンの台帳に記録する軽量Pythonライブラリである。
本稿では,参照実装におけるオーバヘッド,拡張性,タンパー検出の正確さを設計し,評価する。
論文 参考訳(メタデータ) (2026-06-14T21:46:04Z) - Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking [14.164769475625391]
RAGベースのファクトチェックでは、LLMは、検索された証拠に対して与えられたクレームをチェックするための検証器として、ますます使われている。
我々は,LSM検証を4つのてんかん状態に階層化する診断テストベッドであるtextscPAVE(emphPrior-Aware Verifier Evaluation)を紹介する。
実験により、現実のRAGベースのファクトチェックアプリケーションにおいて、検証者選択の重要性が浮かび上がっている。
論文 参考訳(メタデータ) (2026-05-31T09:37:56Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Stress-Testing Neural Network Verifiers with Provably Robust Instances [10.017475431603389]
我々は,地中構造ラベルを用いた検証インスタンス生成のための再利用可能なフレームワークを提案する。
また、インスタンスの硬さの異なるソースを推定可能な量の集合であるDifficulty Profileについても紹介する。
我々のフレームワークとこれらのプロファイルを用いて、5つの最先端検証ツールを評価し、異なるインスタンスが検証パイプラインの異なる側面を強調していることを示す。
論文 参考訳(メタデータ) (2026-05-16T20:56:52Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models [53.279391576560755]
大規模言語モデル(LLM)は、広範囲のNLPタスクにおいて顕著な流速と汎用性を示してきたが、実際的な不正確さと制限が伴う傾向にある。
これは、信頼と妥当性が最優先される医療、法律、科学コミュニケーションといった、高リスク領域に重大なリスクをもたらす。
LLM出力の事実的信頼性と解釈可能性を高めるために設計されたDAVinCI - Dual Attribution and Verificationフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-04-23T01:37:50Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers [11.937771430269201]
本稿では,37大言語モデル(LLM)の体系的研究について述べる。
自己検証と同一家族内および異なる家族間での検証を比較した。
検証者ゲインや偽陽性率尺度などのメトリクスをモデルサイズと後トレーニングで分析し,データセットの妥当性の違いを特徴付ける。
論文 参考訳(メタデータ) (2025-12-02T00:51:14Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。