論文の概要: TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent
- arxiv url: http://arxiv.org/abs/2608.10258v1
- Date: Mon, 10 Aug 2026 21:43:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.827566
- Title: TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent
- Title(参考訳): TAF-MED:自己追従インテント下でのLLMのマルチターンセーフティ・リフレクション崩壊
- Abstract要約: 我々は,500の固定された3ターンシナリオの医師レビューベンチマークであるTAF-MEDを紹介する。
4000対の会話で8つの大言語モデル(LLM)を評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) increasingly provide conversational health information that may influence treatment decisions, yet existing benchmarks do not isolate whether medication-safety boundaries persist across follow-ups after explicit self-treatment intent. We introduce TAF-MED, a physician-reviewed benchmark of 500 fixed three-turn scenarios, and evaluate eight LLMs across 4,000 conversations. A rubric-based automated judge labelled responses as SAFE, LEAKY, or UNSAFE, and two physicians independently annotated a model-balanced random subset of 400 conversations. We assessed unsafe guidance, collapse after a strictly SAFE initial response, and model-ranking stability. Overall, 71.6% of conversations contained an UNSAFE response, and 61.4% of those beginning with a strictly SAFE response later collapsed to UNSAFE; model-level collapse rates ranged from 24.4% to 96.2%. Four of 28 model pairs reversed order between initial unsafe and collapse rates. Automated labels achieved 94.3% agreement with the adjudicated physician reference ($κ= 0.895$). These findings show that first-turn safety is an incomplete proxy for conversational safety persistence and motivate evaluation across complete dialogue trajectories. We will release TAF-MED on Hugging Face to support reproducible research on multi-turn medical safety.
- Abstract(参考訳): 大規模言語モデル(LLM)は、治療決定に影響を与える可能性のある会話型健康情報を提供する傾向にあるが、既存のベンチマークでは、明示的な自己治療意図の後、薬物安全境界がフォローアップ全体にわたって持続するかどうかを区別していない。
我々は,500の固定3ターンシナリオの医師レビューによるベンチマークであるTAF-MEDを導入し,4000の会話で8つのLSMを評価した。
ルーリックベースの自動判断器は、SAFE、LEAKY、UNSAFEとラベル付けされ、2人の医師が独立して400の会話のモデルバランスのランダムなサブセットに注釈を付けた。
厳密なSAFE初期応答とモデルレベルの安定性の後に,安全でないガイダンス,崩壊について検討した。
全体として、会話の71.6%はNSAFE応答を含み、61.4%は厳格なSAFE応答で後にNSAFEに崩壊し、モデルレベルの崩壊率は24.4%から96.2%であった。
28組のモデルのうち4組は、初期不安全と崩壊率の間の順序を逆転させた。
自動化されたラベルは、判決された医師の基準(κ=0.895$)と94.3%の合意に達した。
これらの結果から,初回安全は会話の安全維持のための不完全なプロキシであり,完全な対話軌跡間でのモチベーション評価であることがわかった。
マルチターン医療安全に関する再現可能な研究を支援するため,Hugging Face上でTAF-MEDをリリースする。
関連論文リスト
- EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models [3.659020283346239]
VLM安全性のためのエビデンス基盤フレームワークであるEviSafeを紹介する。
自然なユーザ向け行動、テキストおよび視覚的証拠の明確な根拠、および反事実的変化に対する行動感受性を共同で評価する。
EviSafeBenchは、フレームワークを1,181金の画像テキストシナリオで制御されたベンチマークとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-08-24T14:32:25Z) - Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B [0.0]
オープンウェイト医療言語モデルは、患者向けおよび臨床支援アプリケーションの基礎として、ますます利用されている。
MedGemma-4B-itの技術的洗練を必要としない攻撃におけるギャップを定量化する。
論文 参考訳(メタデータ) (2026-07-09T18:31:43Z) - Quantifying and Mitigating Premature Closure in Frontier LLMs [4.513932256095551]
早期閉鎖は診断ミスの原因として認識されているが、大言語モデル(LLM)では未検討である。
構造的および開放的な医療課題における5つのフロンティアLSMの評価を行った。
論文 参考訳(メタデータ) (2026-05-14T16:02:28Z) - AI Safety Training Can be Clinically Harmful [15.31927635809423]
本稿では,250例の長期曝露療法シナリオと146例のCBT認知再構成演習の4つの生成モデルについて検討した。
全てのモデルは表面の承認 (0.91-1.00) でほぼ完璧に得点し、治療適性は4つのモデル中3つの最重度で0.22-0.33に低下した。
論文 参考訳(メタデータ) (2026-04-25T21:09:50Z) - ThReadMed-QA: A Multi-Turn Medical Dialogue Benchmark from Real Patient Questions [5.63130104359934]
ThReadMed-QAは、r/AskDocsから抽出された2,437人の患者を検索する会話スレッドのベンチマークである。
我々は,238の会話の階層化テスト分割に基づいて,最先端のLLMを5つ評価した。
最も強いモデルであるGPT-5でさえ41.2%の完全正解しか得られない。
論文 参考訳(メタデータ) (2026-03-11T20:17:57Z) - Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context [82.32380418146656]
Health-ORSC-Benchは、医療におけるtextbfOver-Refusalと textbfSafe Completionの品質を測定するために設計された最初の大規模ベンチマークである。
私たちのフレームワークは、人間の検証を備えた自動パイプラインを使用して、さまざまなレベルの意図の曖昧さでモデルをテストします。
Health-ORSC-Benchは、次世代の医療AIアシスタントを調整するための厳格な標準を提供する。
論文 参考訳(メタデータ) (2026-01-25T01:28:52Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models [50.34706204154244]
推論能力の獲得は、引き継がれた安全アライメントを壊滅的に劣化させる。
特定のシナリオは、25倍の攻撃率を被る。
MLRMは、厳密な推論と問合せの安全結合にもかかわらず、初期段階の自己補正を示す。
論文 参考訳(メタデータ) (2025-04-09T06:53:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。