論文の概要: Beyond the Flag: Clinical Framing Closes the Moderation Gap in Suicide Risk Measurement
- arxiv url: http://arxiv.org/abs/2609.06263v1
- Date: Sat, 05 Sep 2026 21:16:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:19:40.099587
- Title: Beyond the Flag: Clinical Framing Closes the Moderation Gap in Suicide Risk Measurement
- Title(参考訳): フラッグ・オブ・ザ・フラッグ:自殺リスク測定におけるモデレーションのギャップを埋める
- Abstract要約: 臨床的に有意な重症度を回復するための安全信号の有効性について尋ねる。
4段階の順序スキーマ上で、ライセンスされた精神科医によって評価された516のr/Watchポストのベンチマークをリリースする。
我々は、二分旗ではなく、格付けされた重大さが、ケアの義務に比例するものであると主張している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Moderation APIs are built to flag policy-violating content, not to measure graded clinical risk. But a platform's duty does not end at detection: the response owed to passive distress differs sharply from the response owed to active planning with means access, and emerging regulation (e.g., California Senate Bill 243) is turning that distinction into a compliance requirement. We therefore ask how well deployed safety signals recover clinically meaningful severity. We release a benchmark of 516 r/SuicideWatch posts rated by a licensed psychiatrist on a four-level ordinal schema (Indicator, Ideation, Behavior, Attempt) grounded in the Columbia Suicide Severity Rating Scale, and evaluate moderation APIs, prompted LLMs, and supervised baselines under seven ordinal-aware metrics. Three findings. Vendor moderation APIs separate low- from high-severity posts well (0.860 high-risk F1) but measure severity poorly (0.395 macro F1), systematically over-predicting the most severe category. Clinically grounded zero-shot prompting recovers much of that gap (0.562 macro F1), and expert-authored framing (not fine-tuning, added reasoning, or naive multi-agent aggregation) is the effective lever. The value of reasoning depends on register: it hurts on long, noisy Reddit posts and helps on short, clinician-authored statements. We argue graded severity, not a binary flag, is what a proportionate duty of care requires, and release our evaluation framework to support that measurement.
- Abstract(参考訳): モデレーションAPIは、段階的な臨床リスクを測定するのではなく、ポリシー違反のコンテンツにフラグを付けるために構築される。
しかし、プラットフォームの義務は検知に終止符を打つものではない。受動的苦難に負う応答は、手段アクセスによるアクティブな計画に負う反応と大きく異なる。
そこで我々は,臨床上有意な重症度を回復する安全信号がどの程度有効であるかを問う。
我々は,コロンビア自殺重大度評価尺度に基づく4段階の順序スキーマ(指標,理想,行動,意図)上で,免許された精神科医が評価する516のr/自殺Watchポストのベンチマークを公開し,モデレーションAPIを評価し,LSMを誘導し,基準線を7つの順序対応メトリクスで監督する。
3つの発見。
ベンダーモデレーションAPIは、高重度ポスト(0.860ハイリスクF1)と低重度ポスト(0.860ハイリスクF1)を適切に分離するが、重症度を計測し(0.395マクロF1)、系統的には最も重度カテゴリを過大に予測する。
臨床的に接地されたゼロショットプロンプトは、そのギャップの大部分(0.562マクロF1)を回復し、専門家によるフレーミング(微調整、追加推論、単純マルチエージェントアグリゲーション)が有効なレバーである。
長い、騒々しいRedditの投稿を痛め、短い、臨床医による声明を助長する。
我々は、二分旗ではなく、格付けされた重大性はケアの義務が要求するものであり、その測定をサポートするための評価フレームワークをリリースすると主張している。
関連論文リスト
- Framework for Grounding Healthcare LLMs in a Causal Knowledge Graph: A Cardiovascular Example Pilot [0.9685837672183747]
大規模言語モデル(LLM)は、医療上の意思決定支援のためにますます提案されている。
LLMは介入、メカニズム、害、証拠、不確実性を推論するよりも、シングルアンサーの精度に報いる。
本稿では,医療における介入指向LDM行動のためのグラフ中心評価フレームワークを提案し,心臓血管パイロットでストレステストを行う。
論文 参考訳(メタデータ) (2026-08-15T19:21:51Z) - Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation [0.0]
10,200行の実行行を180のモデルバウンドリクエスト,45のセマンティックリクエスト,15の観測可能な刺激にトレースすることで,保存されたキャンペーンを監査する。
我々は、7リンクの積分チェインと、スコープ境界の終端積分linterをコントリビュートする。
論文 参考訳(メタデータ) (2026-08-13T06:44:40Z) - Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B [0.0]
オープンウェイト医療言語モデルは、患者向けおよび臨床支援アプリケーションの基礎として、ますます利用されている。
MedGemma-4B-itの技術的洗練を必要としない攻撃におけるギャップを定量化する。
論文 参考訳(メタデータ) (2026-07-09T18:31:43Z) - Before the Labels: How Dataset Construction Shapes Suicidality Detection in Clinical Text [0.5483653499671707]
我々は,ガバナンスの制約,ICDに基づくコホート選択,単一アノテーションラベリング,病院レベルのアグリゲーションが,臨床医の判断を反映したラベルをいかに生み出すかを示す。
言語学的分析により、同一のラベルが時間性、否定性、不確実性が異なる異種臨床フレーミングを仮定していることが示されている。
論文 参考訳(メタデータ) (2026-06-17T22:31:27Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops [0.07249400282852114]
大規模言語モデル(LLM)は、医療現場にますます導入されているが、臨床上の決定が関与すると、幻覚を引き起こす傾向が生じる。
本研究は, LLMが最近, 臨床的疑問に答える際に, 薬剤の投与を推奨するか, 中止を推奨するかを検討するものである。
LLMバックボーンを用いた5エージェント"Trust but verify"システムを開発した。
論文 参考訳(メタデータ) (2026-06-12T06:21:19Z) - Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context [82.32380418146656]
Health-ORSC-Benchは、医療におけるtextbfOver-Refusalと textbfSafe Completionの品質を測定するために設計された最初の大規模ベンチマークである。
私たちのフレームワークは、人間の検証を備えた自動パイプラインを使用して、さまざまなレベルの意図の曖昧さでモデルをテストします。
Health-ORSC-Benchは、次世代の医療AIアシスタントを調整するための厳格な標準を提供する。
論文 参考訳(メタデータ) (2026-01-25T01:28:52Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。