論文の概要: Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning
- arxiv url: http://arxiv.org/abs/2610.00562v1
- Date: Wed, 30 Sep 2026 18:36:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.708792
- Title: Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning
- Title(参考訳): LLMはロングホライズンに対して理学療法が可能か? : 縦断的臨床推論におけるコンテキスト戦略の実証的評価
- Abstract要約: 長いコンテキストモデルは、ますます大量の情報を処理することができるが、より多くの歴史を提供することで、関連する証拠がよりアクセスしやすくしたり、推論を改善したりすることはない。
我々は,MedLoCoMo上での5つのコンテキスト戦略を比較し,回答の正当性,問合せ確認距離に対する頑健性,無関係な前提による質問の棄却について検討した。
これらの結果は, LLMがどの程度の履歴をアクセスできるかだけでなく, 関連する証拠がどの程度選択され, 提示されるかにも大きく依存することを示している。
- 参考スコア(独自算出の注目度): 7.7967300042074505
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Longitudinal clinical reasoning requires large language models (LLMs) to identify and integrate relevant evidence distributed across extended patient histories. Although long-context models can process increasingly large amounts of information, providing more history does not necessarily make relevant evidence more accessible or improve reasoning. We compare five context strategies (Full, Recent, Episodic, Semantic, and Hybrid) on MedLoCoMo across four open-weight LLMs, examining answer correctness, robustness to query-evidence distance, and abstention on questions with unsupported premises. Episodic and Hybrid generally achieve the strongest overall accuracy, while Recent Context degrades most as supporting evidence becomes more distant; Episodic and Hybrid maintain the highest accuracy at long distances. Analysis of adversarial questions further shows that strong performance on answerable questions does not necessarily translate to successful abstention when the available history does not support the requested conclusion. These findings show that reliable longitudinal reasoning depends not only on how much history an LLM can access, but critically on how relevant evidence is selected and presented for reasoning.
- Abstract(参考訳): 長期臨床推論は、拡張された患者の履歴に散在する関連する証拠を同定し、統合するために大きな言語モデル(LLM)を必要とする。
長いコンテキストモデルは、ますます大量の情報を処理することができるが、より多くの履歴を提供することは、必ずしも関連する証拠をアクセスしやすくしたり、推論を改善したりするとは限らない。
我々は,MedLoCoMo の4つのオープンウェイト LLM のコンテキスト戦略 (Full, recent, Episodic, Semantic, Hybrid) を比較し,回答の正しさ,クエリ・エビデンス距離に対するロバスト性,無関係な前提による質問に対する棄却性を検討した。
エピソードとハイブリッドは一般的に最も高い総合的精度を達成する一方、最近の文脈は、支持する証拠がより遠くなるにつれて劣化し、エピソードとハイブリッドは長距離において最も高い精度を維持する。
対立質問の分析は、回答可能な質問に対する強いパフォーマンスが、要求された結論を支持していない場合、必ずしも棄権に繋がるとは限らないことを示している。
これらの結果は, LLMがどの程度の履歴をアクセスできるかだけでなく, 関連する証拠がどの程度選択され, 提示されるかにも大きく依存することを示している。
関連論文リスト
- REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning [46.43518025955049]
大規模言語モデル(LLM)は、複雑なタスクを解決するために、ますます長い形式推論を活用している。
既存の根拠的アプローチは、生成後に引用を付加するか、LCMに推論中に証拠を回収するよう促すかのいずれかである。
我々は,LLMが文脈的接地が必要なタイミングを判断できる適応型ファクト・ステートメント・サイレンス・フレームワークREFACTを提案する。
論文 参考訳(メタデータ) (2026-07-23T01:41:17Z) - MedHorizon: Towards Long-context Medical Video Understanding in the Wild [78.79695798197447]
実際の臨床検査には、フルプロデュースなビデオ理解が必要であることが多い。
既存のベンチマークでは、この証拠はすでに画像やショートクリップ、あるいは事前にセグメンテーションされたビデオを通じてローカライズされていると仮定することが多い。
MedHorizonは、長文医用ビデオ理解のためのWildベンチマークである。
論文 参考訳(メタデータ) (2026-05-07T16:37:10Z) - Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs [52.405085773954596]
大規模な言語モデル(LLM)は、単純な問題を克服し、不要に長いアウトプットを生成し、より難しいものを過小評価する傾向にある。
これは、モデルが問題の難しさを誤認し、応答長を適切に調整できないことを示唆している。
実験の結果, 許容精度を維持しつつ, 生成時間を大幅に短縮できることがわかった。
論文 参考訳(メタデータ) (2025-04-30T18:48:06Z) - LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data [19.79929012055293]
LongFaithは忠実な長文推論命令データセットを合成するための新しいパイプラインである。
基礎的真理と引用に基づく推論のプロンプトを統合することにより、注意散らしを排除し、推論連鎖の精度を向上させる。
論文 参考訳(メタデータ) (2025-02-18T06:40:23Z) - LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion [20.293369733522983]
LongReasonは、大規模言語モデルの長文推論能力を評価するための総合ベンチマークである。
LongReasonは、3つのタスクカテゴリにまたがる多様な推論パターンを持つ794の多重選択推論質問で構成されている。
LLMをLongReason上で評価した結果,コンテキスト長の増加に伴い,ほとんどのモデルが大幅な性能低下を経験していることが判明した。
論文 参考訳(メタデータ) (2025-01-25T05:32:14Z) - ALR$^2$: A Retrieve-then-Reason Framework for Long-context Question Answering [42.146660039671076]
我々は,大規模言語モデル(LLM)のための検索・推論フレームワークを開発した。
現代のLLMは、関連した事実を正確に回収するのに苦労し、代わりにしばしば「検索された事実」を幻覚させる。
本稿では,LLMの長文推論能力を明示的な2段階手順で拡張する手法であるALR$2$を紹介する。
論文 参考訳(メタデータ) (2024-10-04T08:29:12Z) - DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels [86.93099925711388]
長い文脈内での物語的推論に特化したデータセットである textbfDetectiveQA を提案する。
100万以上のトークンを平均化する探偵小説を活用して、中国語と英語の両方で1200人の注釈付き質問を含むデータセットを作成します。
論文 参考訳(メタデータ) (2024-09-04T06:28:22Z) - Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA [71.04146366608904]
長いコンテキストモデリング能力は広く注目を集めており、超コンテキストウィンドウを持つLarge Language Models (LLMs) の出現につながっている。
拡張多文書質問応答(QA)によって現実的なシナリオに整合する新しい長文ベンチマークであるLoongを提案する。
Loong氏は、Spotlight Locating, Comparison, Clustering, Chain of Reasoningという、コンテキスト長の4つのタスクを紹介している。
論文 参考訳(メタデータ) (2024-06-25T09:42:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。