論文の概要: ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues
- arxiv url: http://arxiv.org/abs/2609.01111v1
- Date: Tue, 01 Sep 2026 11:51:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.612059
- Title: ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues
- Title(参考訳): ClinTraceBench : EHR-Derivedダイアログを用いた経時的臨床推論
- Authors: Huimin Wang, Zhengyi Zhao, Yutian Zhao,
- Abstract要約: ClinTraceBench: 385 MIMIC-IV- derived confirmed dialogues with event-ID provenance, a nine-task taxonomy, and L0--L4 deterministic + L5 human-audit validation。
我々は,8つの履歴表現戦略-----no-context floor, textitlast-visit-only, textitfull-context, BGE-M3 textitdense-retrieval, 2つの圧縮スキームと2つのエージェントメモリシステム-を評価する。
- 参考スコア(独自算出の注目度): 11.42809060379683
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical LLM assistants must reason over multi-visit patient trajectories, yet whether the compact history representations used to scale them---retrieval, structured timelines, LLM summaries, agentic memory---preserve the longitudinal signal clinical reasoning needs has not been measured. We introduce ClinTraceBench: 385 MIMIC-IV-derived verified dialogues with event-ID provenance, a nine-task taxonomy (T1--T9), and L0--L4 deterministic + L5 human-audit validation (98.92\% agreement). We evaluate eight history representation strategies---a no-context floor, \textit{last-visit-only}, \textit{full-context}, BGE-M3 \textit{dense-retrieval}, two compression schemes, and two agentic-memory systems (\textit{Mem0}, \textit{A-Mem})---across four backbones (DeepSeek-V3, GPT-4o-mini, Haiku~4.5, Sonnet~4.6) on 6{,}271 questions: 32 cells, 200{,}672 predictions. Four findings: (SP4) a controlled T3 injection probe isolates compression-induced \textit{relation} loss---with the attribution sentence present \textit{before} construction, \textit{Mem0}, \textit{A-Mem} and \textit{llm-summary} still recover only 0--5.3\% of the injected positives; (SP1) compressed strategies pay an aggregation tax on multi-visit trends and cross-patient comparisons; (SP2) the blind-to-full gap spans $+29.8$~pp (GPT-4o-mini) to $+62.7$~pp (Haiku); (SP3) abstention scales non-monotonically with context length. On the Pareto frontier Haiku dominates Sonnet under \textit{full-context} (\$25.76 vs.\ \$106.21), inverting the ``biggest backbone wins'' heuristic.
- Abstract(参考訳): 臨床LSMアシスタントは、多視的患者の軌跡を判断しなければならないが、それらをスケールするために使用されるコンパクトな履歴表現が、検索、構造化されたタイムライン、LCMサマリー、エージェントメモリ、および長手信号臨床推論の必要性を計測していない。
ClinTraceBench: 385 MIMIC-IV- derived confirmed dialogues with event-ID provenance, a nine-task taxonomy (T1-T9), and L0--L4 deterministic + L5 human-audit validation (98.92\% agreement)。
2つの圧縮スキームと2つのエージェントメモリシステム(DeepSeek-V3, GPT-4o-mini, Haiku~4.5, Sonnet~4.6)の4つのバックボーン(DeepSeek-V3, GPT-4o-mini, Haiku~4.5, Sonnet~4.6)は、32セル、200{,}672の予測である。
4つの発見: (SP4) 制御されたT3インジェクションプローブは、圧縮によって引き起こされた \textit{relation} の損失を分離する-- 属性文の現在 \textit{before} の構成、 \textit{Mem0} 、 \textit{A-Mem} および \textit{llm-summary} は、注入された正の0-5.3 %しか回復しない; (SP1) 圧縮された戦略は、マルチビジットトレンドと患者間比較に関する集約税を支払う; (SP2) ブラインド・トゥ・フルギャップは、+29.8$~pp (GPT-4o-mini) から$+62.7$〜pp (Haiku) に広がる。
ParetoのフロンティアであるHaikuは、textit{full-context} (\$25.76 vs.)の下でSonnetを支配している。
\ $106.21 は ``\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\ \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\} である。
関連論文リスト
- Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs [52.149036302760386]
大規模な言語モデルは、プロンプトによって引き起こされるシークレットを、流動的で良心的な出力にエンコードするように微調整することができる。
近年の研究では、内部の活性化から秘密を回収する線形プローブによる検出を提案する。
この防御は体系的に回避できるが,対象とするデータレベルの介入によって検出性が回復可能であることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:27:11Z) - TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management [0.0]
本稿では,大規模言語モデルのセッションを型付き知識グラフとしてモデル化するオープンソースのプロキシシステムであるTokenMizerを紹介する。
平均78トークン(範囲:42-124) - 評価ベースラインよりも2倍小さい再開ブロックを生成する。
全セッションで、TokenMizerはタスクリコールを51.0%、決定リコールを46.6%、ファイルリコールを58.7%としている。
論文 参考訳(メタデータ) (2026-06-04T16:12:28Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory [88.81430082035617]
LLMエージェントは、蓄積された対話履歴を忠実に保存し、効率的に検索し、深く推論できるメモリシステムを必要とする。
本稿では,ソース識別子に固定された生の対話セグメントを含む3つの共存表現の粒度を格納するTriMemを提案する。
論文 参考訳(メタデータ) (2026-05-19T15:05:06Z) - What Do EEG Foundation Models Capture from Human Brain Signals? [64.48249643001402]
現代の脳波基礎モデルは、自己教師付き事前訓練を通じて生信号から直接学習する。
我々は3つのサブクエストに分解する: モデルが何を学習するか、モデルを何に使用するのか、そしてどのように説明できるのか。
3つの基礎モデル(CSBrain, CBraMod, LaBraM),5つの臨床タスク(MDD, Stress, ISRUC-Sleep, TUSL, Siena)と6ファミリー63機能レキシコンを含む。
論文 参考訳(メタデータ) (2026-05-12T01:57:53Z) - ProactBench: Beyond What The User Asked For [5.422521416406412]
ProactBenchは、textscEmergent、単一の公開アンカーからの推論、textscCritical、複数のアンカー間での合成、textscRecovery、タスク完了後の前方にある値の3つのフェーズ型に分解する。
我々の情報アシンメトリーは、スタイル強調スコア、漏洩、外部コンテキスト汚染、情報ダンプに対して防御します。
論文 参考訳(メタデータ) (2026-05-09T23:56:04Z) - One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness [12.183451602438753]
単純な語彙制約(句読解文字または共通単語の禁止)により、命令調整されたLLMが応答を崩壊させることを示す。
ベースモデルでは,同じ制約の下で,小さな,騒々しい,双方向的な効果を伴って,体系的な崩壊を示さないことを示す。
論文 参考訳(メタデータ) (2026-04-14T17:40:01Z) - Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations [2.6382975801439836]
セグメントは最小限のキーワードのブックマークに置き換えられ、モデルはオンデマンドで全コンテンツを取得するリコール()ツールが与えられる。
LoCoMoベンチマークでは、コラボレーティブページングは、トランケーション、BM25、ワードオーバーラップ検索、検索ツールベースライン、フルコンテキストの6つのメソッドの中で、最も高い回答品質を達成する。
次に、境界戦略と消去政策(3,176個の合成プローブ、1,600個のLoCoMoプローブ)に対する5×4のアブレーションでページング設計空間を研究する。
論文 参考訳(メタデータ) (2026-04-14T07:06:35Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - ClaimFlow: Tracing the Evolution of Scientific Claims in NLP [67.23189226608389]
NLP文献のクレーム中心のビューである$texttClaimFlow$を紹介します。
新しいタスク $-$$textitClaim Relation Classification$$-$を定義する。
我々の分析によると、63.5$%の請求は決して再利用されない。
論文 参考訳(メタデータ) (2026-03-17T02:43:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。