論文の概要: A Multi-Agent LLM Framework for Personalized Health Checkup Interpretation and Guidance
- arxiv url: http://arxiv.org/abs/2610.01451v1
- Date: Thu, 01 Oct 2026 10:48:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.063272
- Title: A Multi-Agent LLM Framework for Personalized Health Checkup Interpretation and Guidance
- Title(参考訳): パーソナライズされた健康チェックアップの解釈と指導のためのマルチエージェントLLMフレームワーク
- Abstract要約: 本稿では,複数の意図を識別し,それぞれをタスク固有のエージェントにマップし,並列に実行し,出力を合成する多エージェント大規模言語モデル(LLM)を提案する。
韓国のコンプレックスクエリ120に対して, シングルエージェントとマルチエージェント設定で生成した回答を, 2~4つの要件を組み合わせて比較した。
- 参考スコア(独自算出の注目度): 5.6906397069670644
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personalized interpretation of health checkup results requires reasoning across longitudinal records, medical knowledge, lifestyle guidance, and healthcare navigation. We present a multi-agent large language model (LLM) system that identifies multiple intents, maps each to a task-specific agent, executes them in parallel, and synthesizes their outputs. We compared answers generated in Single Agent and Multi Agent settings on 120 Korean compound queries combining two to four requirements, using synthetic health checkup records. The Multi Agent improved the weighted LLM-judge score from 1.695 to 1.797 (p = 0.027), and three additional LLM judges showed consistent improvements ($Δ$ = +0.111 to +0.186, all p < 0.05). The gains came from usefulness, consistency, and the handling of every requirement in compound queries, whereas numerical accuracy and grounding improved significantly under only one of the four judges and medical safety did not differ, and critical failures occurred at similar rates (Single Agent 15.0% vs. Multi Agent 13.3%). Two human evaluators preferred Multi Agent in 66.7% and 68.3% of pairwise comparisons. Multi Agent execution increased latency and cost by 1.31$\times$ and 2.02$\times$, respectively. In exploratory subgroup analyses, the improvement was concentrated in queries involving personal-record lookup.
- Abstract(参考訳): 健康診断結果のパーソナライズされた解釈には、縦断的な記録、医療知識、ライフスタイルガイダンス、医療ナビゲーションの推論が必要である。
本稿では,複数の意図を識別し,それぞれをタスク固有のエージェントにマップし,並列に実行し,出力を合成する多エージェント大規模言語モデル(LLM)を提案する。
韓国の120の複合クエリに対して, シングルエージェントおよびマルチエージェント設定で生成した回答を, 2~4つの要件を組み合わせた合成健康チェック記録を用いて比較した。
マルチエージェントは重み付き LLM-judge スコアを1.695 から 1.797 (p = 0.027) に改善し、3人のLCM 審査員が一貫した改善を示した(Δ$ = +0.111 to +0.186, all p < 0.05)。
一方、数値的精度と根拠は4人の審査員のうちの1人以下で大幅に改善され、医療安全は変わらず、同じ速度で致命的な失敗が生じた(Single Agent 15.0% vs. Multi Agent 13.3%)。
2人の人間評価者は、対比較の66.7%と68.3%でMulti Agentを好んだ。
マルチエージェントの実行は、それぞれ1.31$\times$と2.02$\times$のレイテンシとコストを増加させた。
探索的サブグループ分析では、個人記録検索を含むクエリに改善が集中した。
関連論文リスト
- Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs [6.442213381552777]
臨床エージェントベンチマークは同一の入力に対して同一の判定を報告でき、エージェントは各ランに対して実質的に異なる順序を出力する。
これは、固定された全ての入力でタスクをリプレイし、スコアではなく注文を比較します。
この研究は、アクションレベルのばらつきが存在することを証明し、スコアによって記録されずに通過できるが、どのレートも一般化するわけではない。
論文 参考訳(メタデータ) (2026-09-11T22:44:35Z) - From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring [2.0918370570198763]
遠隔患者モニタリング(RPM)は膨大なデータを生成するが、データ量が臨床スタッフを圧倒したため、目覚ましい臨床試験(Tele-HF, BEAT-HF)は失敗した。
RPMバイタルのコンテキストトリアージにモデルコンテキストプロトコル(MCP)を用いた自律型AIエージェントSentinelを開発した。
論文 参考訳(メタデータ) (2026-03-10T00:50:54Z) - A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing [0.4349324020366305]
大規模言語モデル(LLM)は、医療問題に対する回答を約束するが、臨床的使用は、弱い検証、不十分な証拠の根拠、信頼できない信頼のシグナルによって制限される。
本稿では,補完的なLCMとエビデンス検索,不確実性推定,バイアスチェックを組み合わせて回答信頼性を向上させるマルチエージェント医療QAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-15T14:17:27Z) - Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning [112.16686518063456]
textbfMulti-Agent Test-Time Reinforcement Learning (MATTRL)を導入する。
MATTRLは、マルチターンの議論、テストタイムの経験の検索と統合、最終的な意思決定のコンセンサスに到達するための、複数の専門家のチームを形成する。
MATTRLは、医学、数学、教育の挑戦的なベンチマーク全体にわたって、マルチエージェントベースラインで平均3.67%、同等のシングルエージェントベースラインで平均8.67%の精度を向上する。
論文 参考訳(メタデータ) (2026-01-14T17:57:43Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents [58.79302663733703]
大規模言語モデルに基づくマルチエージェントシステムは、専門家エージェントの協力により、様々なタスクにまたがる優れた能力を示している。
不器用なエージェントや悪意のあるエージェントが与える影響 - システム全体のパフォーマンスにおいて、頻繁にタスクでエラーを犯すものは、いまだに過小評価されていない。
本稿では,下流タスクにおける障害要因下での各種システム構造のレジリエンスについて検討する。
論文 参考訳(メタデータ) (2024-08-02T03:25:20Z) - Advancing Healthcare Automation: Multi-Agent System for Medical Necessity Justification [0.0]
本稿では,LLMエージェントを利用したマルチエージェントシステム(MAS)の優先オーソライゼーションタスクの自動化について検討する。
GPT-4のチェックリストは,証拠による項目レベルの判断の精度が86.2%,総合的なチェックリスト判定の精度が95.6%であることを示す。
論文 参考訳(メタデータ) (2024-04-27T18:40:05Z) - MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making [45.74980058831342]
MDAgents(Medical Decision-making Agents)と呼ばれる新しいマルチエージェントフレームワークを導入する。
割り当てられた単独またはグループの共同作業構造は、実際の医療決定過程をエミュレートして、手元にある医療タスクに合わせて調整される。
MDAgentsは医療知識の理解を必要とするタスクに関する10のベンチマークのうち7つのベンチマークで最高のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2024-04-22T06:30:05Z) - ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs [61.07130026622437]
大規模言語モデル(LLM)は、まだ自然言語推論タスクに苦戦している。
心の社会に動機づけられて、我々はReConcileを提案する。
LLMエージェント間のラウンドテーブル会議として設計されたマルチモデルマルチエージェントフレームワーク。
論文 参考訳(メタデータ) (2023-09-22T17:12:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。