論文の概要: Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection
- arxiv url: http://arxiv.org/abs/2602.16037v1
- Date: Tue, 17 Feb 2026 21:45:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-19 15:58:30.445927
- Title: Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection
- Title(参考訳): 臨床症状検出のための自律的エージェントワークフローの最適化不安定性
- Abstract要約: 自律的改善の継続がパラドックス的に分類器の性能を低下させる現象について検討する。
検証感度はイテレーション毎に1.0から0.0の間で変動し,重度はクラス有病率に逆比例することがわかった。
セレクターエージェントの監視により、システムは専門家による脳霧検出のレキシコンを331%(F1)、胸痛を7%改善した。
- 参考スコア(独自算出の注目度): 3.0950658457067433
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Autonomous agentic workflows that iteratively refine their own behavior hold considerable promise, yet their failure modes remain poorly characterized. We investigate optimization instability, a phenomenon in which continued autonomous improvement paradoxically degrades classifier performance, using Pythia, an open-source framework for automated prompt optimization. Evaluating three clinical symptoms with varying prevalence (shortness of breath at 23%, chest pain at 12%, and Long COVID brain fog at 3%), we observed that validation sensitivity oscillated between 1.0 and 0.0 across iterations, with severity inversely proportional to class prevalence. At 3% prevalence, the system achieved 95% accuracy while detecting zero positive cases, a failure mode obscured by standard evaluation metrics. We evaluated two interventions: a guiding agent that actively redirected optimization, amplifying overfitting rather than correcting it, and a selector agent that retrospectively identified the best-performing iteration successfully prevented catastrophic failure. With selector agent oversight, the system outperformed expert-curated lexicons on brain fog detection by 331% (F1) and chest pain by 7%, despite requiring only a single natural language term as input. These findings characterize a critical failure mode of autonomous AI systems and demonstrate that retrospective selection outperforms active intervention for stabilization in low-prevalence classification tasks.
- Abstract(参考訳): 自己の振る舞いを反復的に洗練する自律的なエージェントワークフローは、かなりの可能性を秘めている。
自動的なプロンプト最適化のためのオープンソースのフレームワークであるPythiaを用いて、自律的な改善がパラドックス的にクラシファイア性能を低下させる現象である最適化不安定性について検討する。
頻度の異なる3つの臨床症状(息の短さ23%,胸痛12%,Long COVID brain fog3%)を評価したところ,検証感度が1.0から0.0の繰り返しで変動し,重度はクラス有病率に逆比例することがわかった。
3%の確率で、標準評価基準によって隠蔽された故障モードであるゼロ陽性症例を検知しながら95%の精度を達成した。
我々は、最適化を積極的にリダイレクトし、修正よりも過度な適合を増幅する誘導エージェントと、最も優れたイテレーションを遡及的に特定するセレクタエージェントの2つの介入を評価し、破滅的な失敗を防いだ。
セレクターエージェントの監視により、システムは専門家による脳霧検出のレキシコンを331%(F1)、胸痛を7%改善した。
これらの知見は,自律型AIシステムにおいて重要な障害モードを特徴とし,低頻度分類タスクにおいて,レトロスペクティブ選択が能動的介入よりも優れていることを示す。
関連論文リスト
- Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents [10.003509950132251]
ロングホライゾン実行障害は、構造化された多次元グレーディングの下で単一のロールアウトで測定可能となる。
自己進化型ハーネスを用いた適応型エージェント足場Asclepiusを紹介した。
Asclepiusは強力なベースラインエージェントフレームワークよりも22%向上する。
論文 参考訳(メタデータ) (2026-09-11T21:14:59Z) - Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk Triage [0.8683011785637821]
現代の精神医療は、上級監督官の監督が極めて不足している。
本稿では,微調整されたMistral-7Bインストラクタモデルを自動化された「スーパーバイザ・イン・ザ・ループ」システムとして活用する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-19T02:10:15Z) - Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation [0.32553561239735207]
臨床的判断に取って代わるのではなく、拡張するように設計されたエンジンであるxAARAを提示する。
xAARAは、タスク、ムーブメントフェーズ、ムーブメント品質のレベルを越えて、キャリブレーションされた不確実性と説明でARATアセスメントを返します。
105回のストロークサバイバー(788回の運動)では、xAARAは94.2%のタスク精度と81.3%の移動位相精度を達成した。
論文 参考訳(メタデータ) (2026-06-23T09:00:15Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - An Uncertainty-Aware Resilience Micro-Agent for Causal Observability in the Computing Continuum [2.589200983166521]
本稿では, 因果オブザーバビリティ(AURORA)のための不確実性認識型レジリエンスマイクロエージェントを提案する。
AURORAは、各断層のマルコフ毛布内の根因解析をサポートするために、自由エネルギー原理、因果線計算、局所化された因果線状態グラフを統合する並列マイクロエージェントを使用している。
実験の結果,AURORAは62.0%の修理精度と3msの平均修理時間を維持しながら,破壊作用率0%を達成し,ベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-05-11T15:28:37Z) - A Breast Vision Pathology Foundation Model for Real-world Clinical Utility [65.57568187389113]
a bfBRAVE, a breast-adaptive pathology foundation model developed and evaluation using a total resources of 101,638 breast wholeslide images。
臨床ワークフローにおけるBRAVEの実践的役割は、通常のAI支援による第2レビューから低リスクのケースを安全に排除すること、そしてさらなる評価のためのケースの優先順位付けなどである。
論文 参考訳(メタデータ) (2026-05-06T07:44:39Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Optimizing Point-of-Care Ultrasound Video Acquisition for Probabilistic Multi-Task Heart Failure Detection [3.5617951813421818]
本稿では、RLエージェントが次のビューを選択して取得を終了するパーソナライズされたデータ取得戦略を提案する。
終了時,診断モデルは大動脈狭窄(AS)重症度と左室放出率(LVEF)を同時予測する
本手法は32%の動画を用いて,AS重度分類とLVEF推定における平均平衡精度(bACC)を77.2%達成し,フルスタディ性能と一致した。
論文 参考訳(メタデータ) (2026-02-14T07:56:21Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Transparent Early ICU Mortality Prediction with Clinical Transformer and Per-Case Modality Attribution [42.85462513661566]
ICU滞在後48時間から, 生理的時系列測定と非構造的臨床記録とを融合した, 軽量で透明なマルチモーダルアンサンブルを提案する。
ロジスティック回帰モデルは、バイタル用双方向LSTMとノート用微調整された臨床ModernBERT変換器の2つのモード固有モデルからの予測を組み合わせる。
MIMIC-IIIベンチマークでは、遅延融合アンサンブルは、よく校正された予測を維持しながら、最高の単一モデルに対する差別を改善する。
論文 参考訳(メタデータ) (2025-11-19T20:11:49Z) - Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation [5.469454486414467]
大言語モデル (LLMs) は脊椎手術における臨床的決定支援の転換的可能性を提供する。
LLMは幻覚を通じて重大なリスクを引き起こすが、これは事実的に矛盾しているか、文脈的に不一致な出力である。
本研究は, 診断精度, 推奨品質, 推理堅牢性, 出力コヒーレンス, 知識アライメントを評価することによって, 幻覚リスクを定量化するための臨床中心の枠組みを提案する。
論文 参考訳(メタデータ) (2025-11-01T15:25:55Z) - Selective Diabetic Retinopathy Screening with Accuracy-Weighted Deep Ensembles and Entropy-Guided Abstention [0.0]
糖尿病網膜症(DR)は2030年までに全世界で1億3000万人以上の患者に影響を与えると予測されている。
不確実性推定と統合された深層アンサンブル学習フレームワークを導入し,DR検出における堅牢性,透明性,スケーラビリティを向上させる。
35,000個のEyePACS網膜基底画像のトレーニングと検証は、未濾過の精度93.70%を生み出した。
論文 参考訳(メタデータ) (2025-10-29T04:16:04Z) - DRBD-Mamba for Robust and Efficient Brain Tumor Segmentation with Analytical Insights [54.87947751720332]
脳腫瘍の正確なセグメンテーションは、臨床診断と治療に重要である。
マンバを拠点とするState Space Modelsは、有望なパフォーマンスを示している。
本稿では,計算オーバーヘッドを最小限に抑えながら,マルチスケールの長距離依存関係をキャプチャするマルチ解像度双方向マンバを提案する。
論文 参考訳(メタデータ) (2025-10-16T07:31:21Z) - Efficient Test-time Adaptive Object Detection via Sensitivity-Guided Pruning [73.40364018029673]
連続的なテスト時間適応オブジェクト検出(CTTA-OD)は、源となる事前訓練された検出器を常に変化する環境にオンライン適応させることを目的としている。
私たちのモチベーションは、学習したすべての特徴が有益であるとは限らないという観察に起因しています。
FLOPの計算オーバヘッドを12%削減し,優れた適応性を実現する。
論文 参考訳(メタデータ) (2025-06-03T05:27:56Z) - Primary Care Diagnoses as a Reliable Predictor for Orthopedic Surgical Interventions [0.10624941710159722]
リファラルワークフローの非効率性は、最適な患者と高い医療費に寄与する。
本研究では,プライマリケアの診断項目に基づく手続き的ニーズの予測の可能性について検討した。
論文 参考訳(メタデータ) (2025-02-06T17:15:12Z) - Undersampling and Cumulative Class Re-decision Methods to Improve
Detection of Agitation in People with Dementia [16.949993123698345]
消化は認知症(PwD)で最も多い症状の1つである。
前回の研究では、参加者17名から600日間のマルチモーダルウェアラブルセンサデータを収集し、1分間の窓での動揺を検出する機械学習モデルを開発した。
本稿では,まず,不均衡を解消するために異なるアンダーサンプリング手法を実装し,通常の動作データの20%だけが競合的動揺検出モデルの訓練に適しているという結論に至った。
論文 参考訳(メタデータ) (2023-02-07T03:14:00Z) - Reasons for the Superiority of Stochastic Estimators over Deterministic
Ones: Robustness, Consistency and Perceptual Quality [44.47246905244631]
完全品質の回復アルゴリズムは後部サンプリング器でなければならない。
決定論的復元アルゴリズムは高い品質を達成できるが、これは可能なすべてのソース画像の空間を埋めることによってのみ達成できる。
論文 参考訳(メタデータ) (2022-11-16T14:49:10Z) - ERNIE-SPARSE: Learning Hierarchical Efficient Transformer Through
Regularized Self-Attention [48.697458429460184]
情報ボトルネック感度と異なる注目トポロジ間の不整合の2つの要因がスパース変換器の性能に影響を及ぼす可能性がある。
本稿では,ERNIE-Sparseというモデルを提案する。
i) 局所情報とグローバル情報を逐次統一する階層スパース変換器(HST) と、(ii) 注意トポロジの異なる変換器の距離を最小化する自己注意正規化(SAR) の2つの特徴がある。
論文 参考訳(メタデータ) (2022-03-23T08:47:01Z) - SOUL: An Energy-Efficient Unsupervised Online Learning Seizure Detection
Classifier [68.8204255655161]
神経活動を記録して発作を検出するインプラントデバイスは、発作を抑えるために警告を発したり神経刺激を誘発したりするために採用されている。
移植可能な発作検出システムでは、低出力で最先端のオンライン学習アルゴリズムを使用して、神経信号のドリフトに動的に適応することができる。
SOULはTSMCの28nmプロセスで0.1mm2を占め、1.5nJ/分級エネルギー効率を実現した。
論文 参考訳(メタデータ) (2021-10-01T23:01:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。