論文の概要: Dynamic Bidirectional Pattern Memory: A Production-Scale Empirical Characterisation of Inference-Time Gating in Clinical NLP
- arxiv url: http://arxiv.org/abs/2607.00870v1
- Date: Wed, 01 Jul 2026 12:34:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.891014
- Title: Dynamic Bidirectional Pattern Memory: A Production-Scale Empirical Characterisation of Inference-Time Gating in Clinical NLP
- Title(参考訳): 動的双方向パターン記憶 : 臨床NLPにおける推論時間ゲーティングの大規模評価
- Abstract要約: 実運用規模の自然言語処理(NLP)パイプラインにおける推論時パターンメモリゲーティングについて検討した。
パイプラインは、ジェネレータ(Llama-3.3 70B)と検証器(MMed-Llama-3.1 70B)とをペアにして抽出を承認または拒否する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We study inference-time pattern-memory gating in a production-scale clinical natural language processing (NLP) pipeline. The pipeline pairs a generator (Llama-3.3 70B) proposing extractions with a verifier (MMed-Llama-3.1 70B) accepting or rejecting them, over 167,034 PMC-Patients narratives, and adds a lightweight memory that learns at deployment which extractions to filter, so the verifier need not re-examine candidates already seen to fail. We report four findings. First, learning filtering rules directly from the verifier's rejections failed at full scale: the relation-extraction filter stayed empty despite 785,797 logged rejections, because they were spread too thinly across too many distinct forms to accumulate. Second, a simpler rule using a fixed clinical ontology produced the same filtering without the verifier, capturing 49,734 ontology-violating relations on a held-out 5,000-patient set. Third, of five versions of the question-answering filter, four failed for distinct, instructive reasons; the fifth succeeded by checking whether a patient's extracted entities support the question asked, and where it applies was 1.84 times likelier to flag an answer the verifier would reject than one it would accept. Fourth, one pattern held across all five: a filter is selective only when it tests the same evidence the verifier weighs, not when it imitates the verifier's output. Together these give a transferable result for any generator-verifier pipeline: the most natural memory design can fail silently at scale, and whether a pre-generation gate is selective is decided before any engineering effort, by whether its signal probes the question the verifier itself answers. Throughout, the system flags suspect extractions rather than deleting them, so every decision stays visible for clinical review. All code and test artefacts are released openly.
- Abstract(参考訳): 実運用規模の自然言語処理(NLP)パイプラインにおける推論時パターンメモリゲーティングについて検討した。
パイプラインは、ジェネレータ(Llama-3.3 70B)と検証器(MMed-Llama-3.1 70B)とをペアリングし、167,034 PMC-Patientsの物語を受理または拒否し、フィルタに抽出するデプロイ時に学習する軽量メモリを追加する。
我々は4つの発見を報告した。
関係抽出フィルタは、785,797個のログに記録された拒絶をしても空のままであり、それはそれらがあまりに多くの異なる形式に分散しすぎるためである。
第2に, 固定された臨床オントロジーを用いた簡易な規則は, 検証無しで同じフィルターを発生させ, 患者5000名に対して49,734名のオントロジー違反関係を捉えた。
第3に、質問答えフィルタの5つのバージョンのうち4つは、明確な指導的理由から失敗し、第5は、患者の抽出されたエンティティが質問を支持しているかどうかを確認し、それが適用される場所は、検証者が受け入れるものよりも拒否する回答を1.84倍である。
フィルタは、検証者の出力を模倣するのでなく、検証者が重さを測るのと同じ証拠をテストするときのみ選択的である。
最も自然なメモリ設計は、大規模にサイレントに失敗し、前世代のゲートが選択されるかどうかを、その信号が検証者自身が答える質問を調査するかどうかによって決定する。
全体を通して、システムフラグは削除するのではなく抽出を疑うので、臨床検査にはすべての決定が目に見える。
すべてのコードとテスト成果物は、公開リリースされている。
関連論文リスト
- From Experiments to Decisions: Reusing Evidence in Autonomous Coding Research [0.0]
我々は400タスクのNeuroGolfキャンペーンでエビデンスをどのように再利用するかを再構築する。
数値的な反例は、オーバーブロード排除を公開する。
他のエピソードでは、失敗、不完全、そして修正されたプログラムが次に行うことを正当化する。
論文 参考訳(メタデータ) (2026-09-10T03:48:31Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - A multiverse-consensus pipeline for reproducible feature selection in untargeted LC-MS metabolomics [1.452875650827562]
LC-MSメタボロミクスは、多くの事前処理決定を必要とする。
目的のないメタボロミクスの特徴選択に多変量解析を適用する。
論文 参考訳(メタデータ) (2026-07-19T17:14:17Z) - A Multi-Analyst LLM Pipeline for Auditable Rule Discovery Across 68 Public Physiological Corpora [0.0]
オープンな生理的コーパスは検出器設計をサポートすることができるが、新しい非接触監視プラットフォームのためにどの検出器ルールを構築するべきかを直接は規定していない。
68の公的な生理的コーパスを候補ルール形状の監査可能なライブラリに変換し,その妥当性を検証した。
パイプラインは、検証された臨床検出器を生成しない。
論文 参考訳(メタデータ) (2026-07-07T20:56:37Z) - Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents [0.0]
出力トークンが出力される前に,アクティベーションプローブがクレデンシャルアクセスを検出できるかどうかを検討する。
第3に,マルチターンフィルタを累積情報フロー問題として扱う。
その結果、クレデンシャル・エミッション・ディフェンスは、事前出力監視、カナリア検出、時間的漏洩会計を併用すべきであることが示唆された。
論文 参考訳(メタデータ) (2026-06-02T18:53:17Z) - Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate [2.581200752140087]
患者投票型臨床トリアージベンチマークでは、制約付き多重選択出力における消費者LCMの低トライアージ率が高いことが報告されている。
両フォーマットで共有された臨床物語に同一の医療的特徴が現れるが、すべてのモデルにおいて、複数の選択決定トークンに沈黙する。
論文 参考訳(メタデータ) (2026-05-28T13:14:17Z) - When Should an AI Scientist Stop? Verifiable Experiment Steering and Refusal for Autonomous Discovery [0.0]
CARTOGRAPHは、AI科学者のための検証レイヤーである。
未解決宇宙実験ステアリング(選択)、明示的曖昧性閉鎖(解決)、残差に基づくライブラリ不整合検出(再利用)の2つを結合する。
論文 参考訳(メタデータ) (2026-05-26T18:19:16Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts [51.84894623128418]
現代の推論言語モデルは、すべてのトークンが寄与し、ステップを順番に消費しなければならないと暗黙的に仮定して、シーケンシャルな連鎖トレースを生成する。
我々は、モデル生成推論連鎖に適用した、系統的な介入パイプライン、除去、マスキング、シャッフル、ノイズ注入により、両方の仮定に挑戦する。
解答抽出は, スパース, 秩序不感, 構造的に堅牢な情報基板上で行う。
論文 参考訳(メタデータ) (2026-05-08T06:15:50Z) - CausalT5K: Diagnosing and Informing Refusal for Trustworthy Causal Reasoning of Skepticism, Sycophancy, Detection-Correction, and Rung Collapse [1.4608214000864057]
CausalT5Kは10ドメインにわたる5000以上のケースの診断ベンチマークである。
合成ベンチマークとは異なり、CausalT5Kはリアルな物語に因果トラップを埋め込んでいる。
予備的な実験では、静的監査ポリシーが普遍的に失敗する4段階のコントロールランドスケープが示される。
論文 参考訳(メタデータ) (2026-02-09T17:36:56Z) - DiFR: Inference Verification Despite Nondeterminism [5.879581944824945]
同じ推論プロセスを2回再実行することは、良質な数値ノイズのために異なる結果をもたらすことが多い。
Token-DiFRは、同一のランダムシードに条件付された信頼参照実装による予測と、生成されたトークンを比較して、推論出力を検証する手法である。
さらに,ランダムなプロジェクションを用いてアクティベーションをコンパクトな指紋に圧縮し,その後の検証を行う Activation-DiFR も導入する。
論文 参考訳(メタデータ) (2025-11-25T18:44:22Z) - Unified Unsupervised Anomaly Detection via Matching Cost Filtering [113.43366521994396]
教師なし異常検出(UAD)は、通常のトレーニングデータのみを用いて画像レベルの異常と画素レベルの異常を識別することを目的としている。
UADモデルの異常コスト量を補正するための汎用的なポストホック精錬フレームワークであるUnified Cost Filtering (UCF) を提案する。
論文 参考訳(メタデータ) (2025-10-03T03:28:18Z) - Sensitivity, Specificity, and Consistency: A Tripartite Evaluation of Privacy Filters for Synthetic Data Generation [57.13635002340272]
個人識別可能な情報を含むサンプルを除去するためのポストホックプライバシーフィルタリング技術が提案されている。
本研究は胸部X線合成に適用した濾過パイプラインの厳密な評価を行う。
これらの手法がセンシティブなアプリケーションに確実にデプロイされるためには,フィルタ設計の大幅な進歩が必要であると結論付けている。
論文 参考訳(メタデータ) (2025-10-02T08:32:20Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。