論文の概要: Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability
- arxiv url: http://arxiv.org/abs/2607.06127v2
- Date: Thu, 09 Jul 2026 11:02:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.263167
- Title: Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability
- Title(参考訳): 共有意思決定の実践測定(OPTION12):プライバシーと持続性向上のためのオープンソース小型LCM(OS-sLLM)の検討
- Abstract要約: 本稿では, オブザーバOPTION12フレームワークを用いた共有意思決定(SDM)の自動評価のための, オープンソースの小型言語モデル (OS-sLLMs) について検討する。
発達段階のパイロット研究において,3つの一般ドメインと2つの医療ドメインOS-sLLMを評価した。
その結果、一般ドメインモデルは、幻覚と命令追従の失敗を示す医療ドメインモデルよりも優れていることがわかった。
- 参考スコア(独自算出の注目度): 9.69093422708825
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present LLM4SDM, the first study of open-source smaller language models (OS-sLLMs) for automated assessment of shared decision making (SDM) using the Observer OPTION12 framework. Unlike previous work that relies on large commercial models and the shorter OPTION5 instrument, our study focuses on privacy-preserving locally deployable models and Dutch melanoma consultation transcripts. Using expert-annotated clinical consultations, we evaluate three general-domain and two medical-domain OS-sLLMs during a development-phase pilot study. Results show that general-domain models outperform medical-domain models, which exhibit substantial hallucination and instruction-following failures. Gemma3:12b achieves the strongest agreement with human annotations (Pearson r=0.51, Spearman \r{ho}=0.59). Item-level and qualitative analyses reveal systematic challenges related to temporal discourse reasoning, conversational role attribution, and evidence grounding. We further introduce a Judge-LLM consensus framework designed to support disagreement resolution among multiple models. Our findings suggest that while current OS-sLLMs cannot replace human annotators, they offer a promising foundation for privacy-preserving human-in-the-loop SDM assessment.
- Abstract(参考訳): LLM4SDM は Observer OPTION12 フレームワークを用いた共有意思決定(SDM)の自動評価のための,オープンソースの小型言語モデル (OS-sLLM) の最初の研究である。
大規模な商用モデルとOPTION5の短い機器による以前の研究とは異なり、我々はプライバシ保存型ローカルデプロイモデルとオランダのメラノーマ相談書に焦点をあてた。
3つの一般ドメインと2つの医療ドメインOS-sLLMを発達段階のパイロット研究で評価した。
その結果、一般ドメインモデルは、幻覚と命令追従の失敗を示す医療ドメインモデルよりも優れていることがわかった。
Gemma3:12bは人間のアノテーションとの最も強い合意(Pearson r=0.51, Spearman \r{ho}=0.59)を達成している。
項目レベルおよび質的分析は、時間的談話推論、会話的役割帰属、根拠となる証拠に関連する体系的な課題を明らかにする。
さらに、複数のモデル間の不一致解決をサポートするために設計されたジャッジ・LLMコンセンサスフレームワークを導入する。
以上の結果から,現在のOS-sLLMは人間のアノテータを置き換えることはできないが,プライバ保護によるSDM評価のための有望な基盤を提供する可能性が示唆された。
関連論文リスト
- MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning [52.064286116035134]
我々はMed-VQA(Med-VQA)のための視覚的LVLM応答を保証するフレームワークであるMedAlignを開発した。
まず、優先学習を視覚的コンテキストに合わせるために、マルチモーダルな直接選好最適化(mDPO)の目的を提案する。
次に、画像とテキストの類似性を生かし、クエリを専門的でコンテキスト拡張されたLVLMにルーティングする検索型混合処理(RA-MoE)アーキテクチャを設計する。
論文 参考訳(メタデータ) (2025-10-24T02:11:05Z) - How can we assess human-agent interactions? Case studies in software agent design [52.953425368394306]
我々は,人間とエージェントの相互作用の厳密な評価に向けて,二つの大きな一歩を踏み出した。
エージェント設計のより効率的な人間中心評価のためのフレームワークであるPULSEを提案する。
私たちは、オープンソースのソフトウェアエージェントOpenHandsを中心に構築された大規模なWebプラットフォームにフレームワークをデプロイします。
論文 参考訳(メタデータ) (2025-10-10T19:04:28Z) - Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation [4.286815457787583]
Causal-SAM-LLMはLarge Language Models(LLM)を因果推論の役割に高める新しいフレームワークである。
第一に、Linguistic Adrial Disentanglement (LAD)は視覚言語モデルを用いて、融合した画像スタイルのリッチでテキストによる記述を生成する。
第2に、Test-Time Causal Intervention (TCI)は、LLMが臨床者の自然言語コマンドを解釈し、セグメント化デコーダの特徴をリアルタイムで変調する対話的なメカニズムを提供する。
論文 参考訳(メタデータ) (2025-07-04T13:52:16Z) - The Hidden Link Between RLHF and Contrastive Learning [56.45346439723488]
RLHF(Reinforcement Learning from Human Feedback)とDPO(Simple Direct Preference Optimization)は相互情報(MI)の観点から解釈可能であることを示す。
このフレームワーク内では、RLHFとDPOの両方を、ベースモデルから派生した正と負のサンプルに基づいて対照的な学習を行う方法として解釈することができる。
そこで本稿では,DPO で観測される選択的傾向の後期的低下を軽減するための相互情報最適化 (MIO) を提案する。
論文 参考訳(メタデータ) (2025-06-27T18:51:25Z) - HiddenBench: Assessing Collective Reasoning in Multi-Agent LLMs via Hidden Profile Tasks [12.203366267017737]
マルチエージェント LLM における集合的推論を評価するための最初のベンチマークである HiddenBench を紹介する。
ベンチマークを基礎として,このパラダイムをカスタムタスクで形式化し,GPT-4.1グループが分散知識の統合に失敗したことを示す。
次に、カスタムデザイン、先行研究、自動生成から引き出された65のタスクにまたがる完全なベンチマークを構築します。
論文 参考訳(メタデータ) (2025-05-15T19:22:54Z) - LLM-based Agent Simulation for Maternal Health Interventions: Uncertainty Estimation and Decision-focused Evaluation [30.334268991701727]
エージェントに基づくシミュレーションは複雑な人間の行動のモデル化に不可欠である。
従来のアプローチでは、広範なドメイン知識と大規模なデータセットが必要です。
大規模言語モデル(LLM)は、幅広い世界の知識を活用することで、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2025-03-25T20:24:47Z) - LlaMADRS: Prompting Large Language Models for Interview-Based Depression Assessment [75.44934940580112]
LlaMADRSは、オープンソースのLarge Language Models(LLM)を利用して、うつ病の重症度評価を自動化する新しいフレームワークである。
本研究は,クリニカルインタヴューの解釈・スコアリングにおけるモデル指導のために,慎重に設計された手がかりを用いたゼロショットプロンプト戦略を用いている。
実世界における236件のインタビューを対象とし,臨床評価と強い相関性を示した。
論文 参考訳(メタデータ) (2025-01-07T08:49:04Z) - Distilling Large Language Models for Matching Patients to Clinical
Trials [3.4068841624198942]
近年の大規模言語モデル(LLMs)の成功は、医療分野における彼らの採用の道を開いた。
本研究は,患者と臨床の整合性に対するプロプライエタリ (GPT-3.5, GPT-4) とオープンソース LLM (LLAMA 7B, 13B, 70B) の併用性について,最初の系統的検討を行った。
この制限された合成データセットを微調整したオープンソースのLLMは、プロプライエタリなデータセットと同等の性能を示した。
論文 参考訳(メタデータ) (2023-12-15T17:11:07Z) - L-Eval: Instituting Standardized Evaluation for Long Context Language
Models [91.05820785008527]
長い文脈言語モデル(LCLM)のより標準化された評価を行うためにL-Evalを提案する。
20のサブタスク、508の長いドキュメント、2000以上の人間ラベルのクエリ応答対を含む新しい評価スイートを構築した。
その結果、一般的なn-gramマッチングの指標は人間の判断とよく相関しないことがわかった。
論文 参考訳(メタデータ) (2023-07-20T17:59:41Z) - Leveraging Expert Consistency to Improve Algorithmic Decision Support [62.61153549123407]
建設のギャップを狭めるために観測結果と組み合わせることができる情報源として,歴史専門家による意思決定の利用について検討する。
本研究では,データ内の各ケースが1人の専門家によって評価された場合に,専門家の一貫性を間接的に推定する影響関数に基づく手法を提案する。
本研究は, 児童福祉領域における臨床現場でのシミュレーションと実世界データを用いて, 提案手法が構成ギャップを狭めることに成功していることを示す。
論文 参考訳(メタデータ) (2021-01-24T05:40:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。