論文の概要: Identifying Evidence-Based Nudges in Biomedical Literature with Large Language Models
- arxiv url: http://arxiv.org/abs/2602.10345v1
- Date: Tue, 10 Feb 2026 22:36:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-12 21:44:01.31984
- Title: Identifying Evidence-Based Nudges in Biomedical Literature with Large Language Models
- Title(参考訳): 大規模言語モデルを用いたバイオメディカル文学におけるエビデンスに基づくナッジの同定
- Abstract要約: 我々は、非構造化バイオメディカル文献から証拠に基づく行動分類を識別し、抽出するスケーラブルなAI駆動システムを提案する。
栄養は微妙で非強制的な介入であり、選択を制限することなく行動に影響を与える。
- 参考スコア(独自算出の注目度): 2.2015514798912412
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a scalable, AI-powered system that identifies and extracts evidence-based behavioral nudges from unstructured biomedical literature. Nudges are subtle, non-coercive interventions that influence behavior without limiting choice, showing strong impact on health outcomes like medication adherence. However, identifying these interventions from PubMed's 8 million+ articles is a bottleneck. Our system uses a novel multi-stage pipeline: first, hybrid filtering (keywords, TF-IDF, cosine similarity, and a "nudge-term bonus") reduces the corpus to about 81,000 candidates. Second, we use OpenScholar (quantized LLaMA 3.1 8B) to classify papers and extract structured fields like nudge type and target behavior in a single pass, validated against a JSON schema. We evaluated four configurations on a labeled test set (N=197). The best setup (Title/Abstract/Intro) achieved a 67.0% F1 score and 72.0% recall, ideal for discovery. A high-precision variant using self-consistency (7 randomized passes) achieved 100% precision with 12% recall, demonstrating a tunable trade-off for high-trust use cases. This system is being integrated into Agile Nudge+, a real-world platform, to ground LLM-generated interventions in peer-reviewed evidence. This work demonstrates interpretable, domain-specific retrieval pipelines for evidence synthesis and personalized healthcare.
- Abstract(参考訳): 我々は、非構造化バイオメディカル文献から証拠に基づく行動分類を識別し、抽出するスケーラブルなAI駆動システムを提案する。
栄養は微妙で非強制的な介入であり、選択を制限することなく行動に影響を与える。
しかし、PubMedの800万以上の記事からこれらの介入を特定することはボトルネックとなっている。
まず,ハイブリッドフィルタ(キーワード,TF-IDF,コサイン類似性,および「長期ボーナス」)を用いて,コーパスを約81,000人まで削減する。
次に、OpenScholar(量子化LLaMA 3.1 8B)を使用して論文を分類し、nudge型やターゲット動作のような構造化されたフィールドを単一のパスで抽出し、JSONスキーマに対して検証する。
ラベル付きテストセット(N=197。
最高の設定(Title/Abstract/Intro)は67.0%のF1スコアと72.0%のリコールを達成した。
自己整合性(7つのランダム化パス)を用いた高精度な変種は、100%の精度で12%のリコールを実現し、高信頼のユースケースに対する調整可能なトレードオフを示した。
このシステムは現実のプラットフォームであるAgile Nudge+に統合され、LLMが生成した介入を査読された証拠の根拠にしています。
この研究は、エビデンス合成とパーソナライズされたヘルスケアのための解釈可能なドメイン固有の検索パイプラインを示す。
関連論文リスト
- Evaluation design conditions the expert-vs-auto MeSH gap: a controlled comparison of bag-of-words and BiomedBERT on the Cohen benchmark [0.0]
我々は3つのトピックについてCohen et al. (2006) の薬物クラスベンチマークを用いて、代替設計の下でスタチンがどのように変化するかを調べる。
トランスフォーマーや10倍の単語バッグを使ったパイプラインのスクリーニングでは、テスト対象のトピックのギャップは約0.02 WSS@95%であり、CIは少なくとも1つのバウンダリでゼロである。
論文 参考訳(メタデータ) (2026-07-23T14:37:23Z) - Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence [45.78409219344429]
マルチモーダル大言語モデル (MLLM) は, 臨床VQAと放射線学報告の生成に強い期待を示すが, 推測時幻覚は信頼性を損なう。
本稿では,両面のエビデンス注入による幻覚を系統的に緩和する,総合的かつトレーニング不要なエビデンス注入フレームワークを提案する。
textttLLaVA-1.5-7B, texttLLaVA-Med-1.5-7B, texttQwen3-VL-8B/32B, textttInternVL を用いた2つのタスクと5つのデータセットの系統的評価を行った。
論文 参考訳(メタデータ) (2026-06-30T08:07:25Z) - Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior [0.0]
人間の認知の多様性が行動から回復し、LSMエージェントに移行できるかどうかを問う。
Nousは、実際のポリマーケット取引活動から構造化された8次元の行動プロファイルを抽出し、プロンプトを通じてエージェントに注入する。
我々は,Nousを認知的モノカルチャー問題と即時治療の限界を計測するものとして位置づける。
論文 参考訳(メタデータ) (2026-06-11T08:18:25Z) - ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows [7.27267618572654]
ProtoMedAgentは、反復的なゼロ段階のテスト時間最適化問題としてマルチモーダルな臨床報告を定式化する。
オンライン生成は、厳密な集合論微分と反射的スクリーブ・クリティカルループによって制限される。
ProtoMedAgentは91.2%の比較集合Fithfulnessを実現し、標準RAG(46.2%)を根本的に上回る
論文 参考訳(メタデータ) (2026-05-13T20:57:37Z) - PHANTOM: Polymorphic Honeytoken Adaptation with Narrative-Tailored Organisational Mimicry [0.2538209532048867]
ハネトケンは、不正な属性アクセスを検出するために植えられたデコイデジタル資産である。
PHANTOMは,組織固有の知識を符号化することで,文脈的に説得力のあるハネトケンを生成するフレームワークである。
結果は外部のAPIコールなしで再現されるため、パイプラインは空調された環境で完全にデプロイできる。
論文 参考訳(メタデータ) (2026-05-04T17:14:13Z) - Generalization Gaps in Political Fake News Detection: An Empirical Study on the LIAR Dataset [0.764671395172401]
LIARベンチマークを用いて,9つの機械学習アルゴリズムの診断評価を行った。
モデルの重み付きF1スコアを超えないきめ細かい分類の「パフォーマンスシーリング」を発見した。
木に基づくアンサンブルの大規模な"一般化ギャップ"は、99%以上のトレーニング精度を達成したが、テストデータで約25%に崩壊した。
論文 参考訳(メタデータ) (2025-12-20T23:08:18Z) - The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems [0.0]
幻覚予測をRAG検出に適用し、スコアを有限サンプルカバレッジ保証付き決定セットに変換する。
分布尾レンズを用いてこの障害を分析し,NLIモデルが許容可能なAUC(0.81)を達成する一方で,「最も厳しい」幻覚は,忠実な応答と意味的に区別できないことを示した。
論文 参考訳(メタデータ) (2025-12-17T04:22:28Z) - DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services [49.70819009392778]
大規模言語モデル (LLM) とマルチエージェントシステム (MAS) は、ディスパッチを増強する機会を提供する。
本研究の目的は,現実的なシナリオをシミュレートする分類基盤型マルチエージェントシステムの開発と評価である。
論文 参考訳(メタデータ) (2025-10-24T08:01:21Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - Crucial-Diff: A Unified Diffusion Model for Crucial Image and Annotation Synthesis in Data-scarce Scenarios [65.97836905826145]
医療、産業、自動運転といったさまざまなシナリオにおけるデータの不足は、モデルの過度な適合とデータセットの不均衡につながる。
重要なサンプルを合成するドメインに依存しないフレームワークであるCrucial-Diffを提案する。
我々のフレームワークは多様な高品質なトレーニングデータを生成し、ピクセルレベルのAPは83.63%、F1-MAXは78.12%である。
論文 参考訳(メタデータ) (2025-07-14T04:41:38Z) - Leveraging Large Language Models for Cybersecurity: Enhancing SMS Spam Detection with Robust and Context-Aware Text Classification [4.281580125566764]
本研究では,SMSデータ中のスパムメッセージの検出における特徴抽出手法と分類アルゴリズムの有効性を評価する。
TF-IDFは、Naive Bayes、Support Vector Machines、Deep Neural Networksと組み合わせると、最も信頼性の高いパフォーマンスを提供する。
論文 参考訳(メタデータ) (2025-02-16T06:39:36Z) - Reproducible Machine Learning-based Voice Pathology Detection: Introducing the Pitch Difference Feature [1.7779568951268254]
本稿では,現在公開されているSaarbr"ucken Voice Databaseを用いた音声病理診断手法を提案する。
機械学習(ML)アルゴリズムを6つ評価する - サポートベクターマシン、kネアレスト隣人、ナイーブベイズ、決定木、ランダムフォレスト、AdaBoost。
アプローチは, 女性, 男性, 合計で85.61%, 84.69%, および85.22%であった。
論文 参考訳(メタデータ) (2024-10-14T14:17:52Z) - Elastic Weight Removal for Faithful and Abstractive Dialogue Generation [61.40951756070646]
対話システムは、関連する文書に含まれる知識に忠実な応答を生成するべきである。
多くのモデルは、それと矛盾したり、検証不可能な情報を含んでいる代わりに幻覚応答を生成する。
本手法は,幻覚と抽出反応を同時に阻止するために拡張できることが示唆された。
論文 参考訳(メタデータ) (2023-03-30T17:40:30Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - Assessment of contextualised representations in detecting outcome
phrases in clinical trials [14.584741378279316]
本稿では,300 PubMed の要約を専門的に注釈付けしたデータセット "EBM-COMET" を紹介する。
結果の抽出には,事前学習した文脈表現を微調整する。
ベストモデル(BioBERT)は81.5%のF1、81.3%の感度、98.0%の特異性を達成している。
論文 参考訳(メタデータ) (2022-02-13T15:08:00Z) - Text Mining to Identify and Extract Novel Disease Treatments From
Unstructured Datasets [56.38623317907416]
Google Cloudを使って、NPRラジオ番組のポッドキャストのエピソードを書き起こします。
次に、テキストを体系的に前処理するためのパイプラインを構築します。
我々のモデルは、Omeprazoleが心臓熱傷の治療に役立てることに成功しました。
論文 参考訳(メタデータ) (2020-10-22T19:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。