論文の概要: Accountable AI with Grounded, Faithful, Consistent, Actionable Rationales: A Case Study in Clinical Trial Matching with VERDICT
- arxiv url: http://arxiv.org/abs/2609.03366v1
- Date: Thu, 03 Sep 2026 04:49:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.927636
- Title: Accountable AI with Grounded, Faithful, Consistent, Actionable Rationales: A Case Study in Clinical Trial Matching with VERDICT
- Title(参考訳): 根拠的, 忠実で, 一貫性があり, 行動的合理的なAI: VERDICTとの臨床トライアルマッチングを事例として
- Abstract要約: VERDICTは意思決定タスクとその制約とそのポリシーをSatisfiability Modulo Theories (SMT)に翻訳する
VERDICTはLDMのみのベースラインとニューロシンボリックベースラインで最強の決定精度を達成している。
明示的な仮定と中心的な条件に基礎を置き、臨床が優先する理性を生み出す。
- 参考スコア(独自算出の注目度): 9.60108995901904
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accountability means a decision can be examined, justified, and contested. LLMs make this hard: fluent output may be ungrounded, incomplete, or unfaithful to the decision process. Achieving accountability requires verified rationales (how was the decision reached), assumptions (what was assumed rather than known), policy consistency (the same treatment for the same facts), and pivotal conditions (what would change the outcome). We introduce self-faithfulness as an automatic test of accountability: changing the pivotal conditions should change the decision. We examine accountable AI through clinical trial matching, a high-stakes task central to evidence-based medicine. Although LLM-based matchers match patients to trials reasonably accurately, they apply decision policies inconsistently and produce rationales that are unfaithful to their own decisions. We introduce VERDICT, an LLM-based agent that translates a decision task, its constraints, and its policy into Satisfiability Modulo Theories (SMT), then derives the decision with SMT and MaxSMT solvers -- so policies are applied consistently and decisions are accountable by construction. Across a SIGIR 2016-derived dataset and TREC 2021, VERDICT achieves the strongest decision accuracy among LLM-only and neurosymbolic baselines, applies policies with perfect consistency, and produces clinician-preferred rationales grounded in explicit assumptions and pivotal conditions, with improved counterfactual self-faithfulness.
- Abstract(参考訳): 説明責任とは、意思決定を検査し、正当化し、議論することができることを意味する。
LLMは、このことを難しくする: 流動的なアウトプットは、決定プロセスに対して根拠がなく、不完全で、あるいは不誠実である。
説明責任を得るには、妥当な合理性(どのようにして決定に達したのか)、仮定(既知のものではなく仮定されたもの)、政策の整合性(同じ事実に対する同じ扱い)、重要な条件(結果を変えるもの)が必要である。
我々は、自己信条を説明責任の自動テストとして導入する。
我々は,エビデンスベースの医療を中心としたハイテイクタスクである臨床治験マッチングを通じて,説明可能なAIについて検討する。
LLMベースのマーケッターは、患者を合理的に正確に一致させるが、決定ポリシーを矛盾なく適用し、自身の決定に不誠実な合理性を生み出す。
我々は、意思決定タスクとその制約、およびポリシーをSMT(Satifiability Modulo Theories)に変換するLLMベースのエージェントであるVERDICTを導入し、SMTおよびMaxSMTソルバによる決定を導出する。
SIGIR 2016 と TREC 2021 のデータセット全体で、VERDICT は LLM のみのベースラインとニューロシンボリックベースラインの間で最強の決定精度を達成し、完全整合性を持つポリシーを適用し、明確な仮定と重要な条件に根ざした臨床医が推奨する有理性を生成する。
関連論文リスト
- Rare Diseases, Common Dilemmas: LLMs Prioritize Equal Resource Distribution over Patient Benefit in Decision-Making [6.669841955172372]
臨床的意思決定は、しばしば患者の自律性や正義を尊重する、善意、非正当性などの倫理的価値の優先順位付けを伴う。
最近の研究は、大規模言語モデル(LLM)がそのような主観的で価値の高い臨床判断をいかに行うかを評価し始めている。
本報告では,208種類の臨床症状を呈し,それぞれが真に高いコンフリクトを呈する稀な疾患ヴィニグレットについて検討した。
論文 参考訳(メタデータ) (2026-08-25T23:54:22Z) - Can Revealed Preferences Clarify LLM Alignment and Steering? [23.175180848107093]
LLMの観測した選択が最適化するインプリート嗜好を推定するための経験的パイプラインを提案する。
提案手法は,モデルが一貫したゴール指向の振る舞いをするかどうかの厳密な評価を可能にすることを示す。
論文 参考訳(メタデータ) (2026-05-08T23:26:35Z) - Separating Diagnosis from Control: Auditable Policy Adaptation in Agent-Based Simulations with LLM-Based Diagnostics [10.25117941762109]
高齢者の孤独を緩和するには、適応性と監査性の両方を達成するための政策介入が必要である。
本研究は,両特性を同時に達成するために,診断を制御から分離する3層フレームワークを提案する。
その結果、明示的な制御規則は、完全な監査性を維持しながら、エンドツーエンドのLCMアプローチを11.7%上回る結果となった。
論文 参考訳(メタデータ) (2026-03-24T07:52:10Z) - AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions [51.56484100374058]
ヘリコイド力学(Helicoid dynamics)は、その2番目のドメインの特定の障害状態に与えられる名前である。
システムは巧みに働き、エラーに陥り、何がうまくいかなかったかを正確に名付け、さらに高度な技術で同じパターンを再現する。
この先進的な事例シリーズは、7つの主要なシステムにまたがる体制を文書化する。
論文 参考訳(メタデータ) (2026-03-12T05:25:49Z) - fEDM+: A Risk-Based Fuzzy Ethical Decision Making Framework with Principle-Level Explainability and Pluralistic Validation [0.0]
説明可能性とトレーサビリティーモジュール(ETM)を導入し、それぞれの倫理的決定ルールと根底にある道徳的原則を明示的に結びつける。
単一参照検証を多元的セマンティック検証フレームワークに置き換える。
その結果、fEDM+と呼ばれる拡張されたfEDMは、解釈可能性とステークホルダー認識の検証を向上しつつ、形式的な検証性を保っている。
論文 参考訳(メタデータ) (2026-02-25T09:58:14Z) - Do LLMs Act Like Rational Agents? Measuring Belief Coherence in Probabilistic Decision Making [28.256934953904317]
大規模言語モデル (LLM) がコヒーレントな信念と安定な嗜好を持つ有理的実用性最大化要因であるかどうかを考察する。
我々のアプローチは、報告された確率がいかなる有理エージェントの真の信念と一致しないような偽りの条件を提供する。
論文 参考訳(メタデータ) (2026-02-06T00:50:33Z) - Towards Regulatory-Confirmed Adaptive Clinical Trials: Machine Learning Opportunities and Solutions [59.28853595868749]
本研究は,全人口と低給付人口の規制制約と治療方針値を統合した将来の臨床試験の新たな2つの目的を紹介する。
我々は、第III相臨床試験を設計するための新しい枠組みであるRFAN(Randomize First Augment Next)を定式化する。
我々のフレームワークは、標準的なランダム化コンポーネントと適応コンポーネントから構成されており、臨床試験中に患者を効率よく安全に獲得し、患者を治療アームに割り当てることを目的としている。
論文 参考訳(メタデータ) (2025-03-12T10:17:54Z) - Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models [63.559461750135334]
言語モデル(LM)は、目標を達成するために自律的に行動可能なエージェントを構築するために、ますます使われています。
本研究では,人為的リスク構造を体系的に変化させる評価枠組みを用いて,この「回答または延期」問題を考察する。
回答や判断に要する独立したスキルを分離した簡易なスキル分解手法が,LMの意思決定ポリシーを一貫して改善できることがわかった。
論文 参考訳(メタデータ) (2025-03-03T09:16:26Z) - Aligning Large Language Models for Faithful Integrity Against Opposing Argument [71.33552795870544]
大規模言語モデル(LLM)は複雑な推論タスクにおいて印象的な機能を示している。
原文が正しい場合でも、会話中に不誠実な議論によって容易に誤解される。
本稿では,信頼度と信頼度を両立させる新しい枠組みを提案する。
論文 参考訳(メタデータ) (2025-01-02T16:38:21Z) - Explaining by Imitating: Understanding Decisions by Interpretable Policy
Learning [72.80902932543474]
観察されたデータから人間の行動を理解することは、意思決定における透明性と説明責任にとって重要である。
意思決定者の方針をモデル化することが困難である医療などの現実的な設定を考えてみましょう。
本稿では, 設計による透明性の向上, 部分観測可能性の確保, 完全にオフラインで動作可能なデータ駆動型意思決定行動の表現を提案する。
論文 参考訳(メタデータ) (2023-10-28T13:06:14Z) - Accountability in Offline Reinforcement Learning: Explaining Decisions
with a Corpus of Examples [70.84093873437425]
本稿では、オフラインデータセットを決定コーパスとして利用するAOC(Accountable Offline Controller)を紹介する。
AOCはローデータシナリオで効果的に動作し、厳密なオフラインの模倣設定まで拡張でき、保存性と適応性の両方の品質を示す。
シミュレーションおよび実世界の医療シナリオにおいて、AOCのパフォーマンスを評価し、説明責任を維持しながら高いレベルのパフォーマンスでオフライン制御タスクを管理する能力を強調した。
論文 参考訳(メタデータ) (2023-10-11T17:20:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。