論文の概要: $\texttt{AMEND++}$: Benchmarking Eligibility Criteria Amendments in Clinical Trials
- arxiv url: http://arxiv.org/abs/2601.06300v1
- Date: Fri, 09 Jan 2026 20:32:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-13 19:08:00.737195
- Title: $\texttt{AMEND++}$: Benchmarking Eligibility Criteria Amendments in Clinical Trials
- Title(参考訳): $\texttt{AMEND++}$: 臨床試験における信頼性基準のベンチマーク
- Abstract要約: 臨床試験の修正は、しばしば遅延、コストの増大、管理上の負担をもたらす。
我々は,初期試験プロトコルの適格基準が今後修正されるかどうかを予測することを目的とした,新しいNLPタスクであるテキスト適格基準修正予測を導入する。
- 参考スコア(独自算出の注目度): 15.25434812687198
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical trial amendments frequently introduce delays, increased costs, and administrative burden, with eligibility criteria being the most commonly amended component. We introduce \textit{eligibility criteria amendment prediction}, a novel NLP task that aims to forecast whether the eligibility criteria of an initial trial protocol will undergo future amendments. To support this task, we release $\texttt{AMEND++}$, a benchmark suite comprising two datasets: $\texttt{AMEND}$, which captures eligibility-criteria version histories and amendment labels from public clinical trials, and $\verb|AMEND_LLM|$, a refined subset curated using an LLM-based denoising pipeline to isolate substantive changes. We further propose $\textit{Change-Aware Masked Language Modeling}$ (CAMLM), a revision-aware pretraining strategy that leverages historical edits to learn amendment-sensitive representations. Experiments across diverse baselines show that CAMLM consistently improves amendment prediction, enabling more robust and cost-effective clinical trial design.
- Abstract(参考訳): 臨床試験の修正は、しばしば遅延、コストの増大、管理上の負担を伴い、適格基準は最も一般的に修正された要素である。
我々は,初期試験プロトコルの適格基準が今後修正されるかどうかを予測することを目的とした,新しいNLPタスクである「textit{eligibility criteria revision forecast」を導入する。
このタスクをサポートするために、私たちは2つのデータセットからなるベンチマークスイートである$\texttt{AMEND++}$をリリースした。
さらに、歴史的編集を活用して修正に敏感な表現を学習するリビジョン対応事前学習戦略である、$\textit{Change-Aware Masked Language Modeling}$ (CAMLM)を提案する。
多様なベースラインにわたる実験は、CAMLMが一貫して修正予測を改善し、より堅牢で費用対効果の高い臨床試験設計を可能にしていることを示している。
関連論文リスト
- TRACE: Transition-Aware Residual Control for Multi-Objective Materials Discovery [12.756590731591286]
既存のエージェントは評価された候補とそのスコアを格納するので、どの素材が成功したかはわかるが、どの編集が有用なプロパティ変更を引き起こしたかは分かっていない。
我々は、評価された編集をフィードバックの基本単位として扱う、トランジション対応残差制御フレームワークTRACEを提案する。
TRACEは、各ローカルリファインメントを、観測されたプロパティデルタによる親子移行として記録し、トランジションエビデンスを集約して再利用可能な編集効果を推定し、予測能力によって将来の編集をランク付けする。
論文 参考訳(メタデータ) (2026-08-23T13:20:35Z) - Agentic Search for Counterfactual Recourse under Fixed LLM Budgets [0.033842793760651545]
Comp-MCTSは,独特なオラクル価の反事実の収量を最大化するエージェント木探索フレームワークである。
Comp-MCTSは、単一候補のLATSスタイルのベースラインよりも、独特なオラクル価の反事実の収率でかなり優れることを示す。
論文 参考訳(メタデータ) (2026-06-07T15:53:10Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation [50.23374353859762]
多様な単発デモを収集することで「最大限のカバレッジ」を達成できる。
我々は、この現象を包括的-密度トレードオフとして定式化する。
Anchor-Centric Adaptation (ACA) は、2段階のフレームワークで、まずコアアンカーでの繰り返しデモを通じてポリシースケルトンを安定化し、次に教師力によるエラーマイニングと制約付き残差更新を通じて高リスク境界までカバー範囲を広げる。
論文 参考訳(メタデータ) (2026-05-08T07:35:24Z) - Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking [40.44372785257615]
我々は,この手順レベルの目標を明示的なチューニング予算の下で推論する。
選択対応の繰り返しレポートプロトコルであるSIRENを提案する。
制御されたシミュレーションとMMLU-Proチューニング実験は、勝者ベースのレポートが楽観的であることを示している。
論文 参考訳(メタデータ) (2026-05-07T10:18:56Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Evaluating the Evaluator: Problems with SemEval-2020 Task 1 for Lexical Semantic Change Detection [1.1340133299604382]
語彙意味変化検出のための最も影響力のあるベンチマークであるSemEval-2020 Task 1を再検討する。
ベンチマークは、かなりのコーパスと前処理の問題に影響されていることを示す。
我々は、限定言語の範囲が限定された小さな目標セットは現実主義を減らし、統計的不確実性を増大させると主張している。
論文 参考訳(メタデータ) (2026-04-14T19:01:25Z) - Whose Name Comes Up? Benchmarking and Intervention-Based Auditing of LLM-Based Scholar Recommendation [0.0]
大きな言語モデル(LLM)は、学術専門家の推薦にますます使われている。
拒絶や幻覚、不均一なカバレッジといった失敗が、モデルの選択やデプロイメントの決定に起因するかどうかは不明だ。
LLMScholarBenchは,LLMに基づく学術推薦のベンチマークである。
論文 参考訳(メタデータ) (2026-02-09T16:34:57Z) - Optimal Budgeted Adaptation of Large Language Models [8.207283283207138]
ラベル付きデータの可用性と下流の精度のトレードオフは、大きな言語モデルにおいて依然として中心的な課題である。
そこで本稿では,LLM をコンテキスト型 Stackelberg ゲームとしてキャストすることで,Emphbudget-aware による微調整を指導するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T01:08:15Z) - Are We Evaluating the Edit Locality of LLM Model Editing Properly? [68.441768731381]
この目的のために既存の特異性評価プロトコルは不十分であることがわかった。
既存の特異度指標は特異度正規化器の強度と弱い相関関係にある。
また、現在のメトリクスには十分な感度が欠けており、異なるメソッドの特異性性能の区別に効果がないこともわかりました。
論文 参考訳(メタデータ) (2026-01-24T07:07:21Z) - Reviewing the Reviewer: Elevating Peer Review Quality through LLM-Guided Feedback [75.31379834079648]
レビューを論証セグメントに分解するLLM駆動型フレームワークを提案する。
遅延思考と特異性をラベル付けした1,309文のデータセットであるLazyReviewPlusもリリースしました。
論文 参考訳(メタデータ) (2026-01-17T20:32:18Z) - Additive Distributionally Robust Ranking and Selection [0.8283940114367679]
そこで本研究では,$k + m - 1$の事前仮説クリティカルシナリオのみをサンプリングすることを目的とした,単純な加算割当(AA)手順を提案する。
AAが一貫したものであり、驚くべきことに、最も強い意味で付加性を達成することを証明します。
結果は、DRR&Sの加法構造に対する新しい、そして反直観的な洞察を与える。
論文 参考訳(メタデータ) (2025-09-07T17:36:29Z) - Say It Another Way: Auditing LLMs with a User-Grounded Automated Paraphrasing Framework [17.91981142492207]
本稿では,ユーザ行動に根ざした制御されたフレーズを生成するフレームワークであるAUGMENTを紹介する。
AUGMENTは言語的に情報を得た規則を活用し、命令の順守、意味的類似性、リアリズムのチェックを通じて品質を強制する。
ケーススタディでは、制御されたパラフレーズは、制約のない変動の下で隠されたままの系統的な弱点を明らかにする。
論文 参考訳(メタデータ) (2025-05-06T14:17:30Z) - Towards Regulatory-Confirmed Adaptive Clinical Trials: Machine Learning Opportunities and Solutions [59.28853595868749]
本研究は,全人口と低給付人口の規制制約と治療方針値を統合した将来の臨床試験の新たな2つの目的を紹介する。
我々は、第III相臨床試験を設計するための新しい枠組みであるRFAN(Randomize First Augment Next)を定式化する。
我々のフレームワークは、標準的なランダム化コンポーネントと適応コンポーネントから構成されており、臨床試験中に患者を効率よく安全に獲得し、患者を治療アームに割り当てることを目的としている。
論文 参考訳(メタデータ) (2025-03-12T10:17:54Z) - Test-Time Alignment for Large Language Models via Textual Model Predictive Control [63.508812485566374]
Textual Model Predictive Control (TMPC) は、推論時に大規模言語モデルを調整するために適応された新しい予測計画フレームワークである。
TMPCは、談話レベル翻訳、長文応答生成、プログラム合成の3つの異なるセグメンテーション特性を持つタスクで評価される。
その結果、TMPCはパフォーマンスを継続的に改善し、一般性を強調している。
論文 参考訳(メタデータ) (2025-02-28T07:24:33Z) - Giving the Old a Fresh Spin: Quality Estimation-Assisted Constrained Decoding for Automatic Post-Editing [43.354917413940534]
復号処理中に単語レベルの品質推定情報を組み込むことで過度補正を緩和する手法を提案する。
英語-ドイツ語,英語-ヒンディー語,英語-マラティア語対に関する実験により,提案手法が大幅に改善されたことを示す。
論文 参考訳(メタデータ) (2025-01-28T19:46:18Z) - MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators [53.91199933655421]
大規模言語モデル(LLM)は、機械翻訳(MT)の品質評価の裁判官として大きな可能性を秘めている。
非インパクト的なエラーをフィルタリングするアイデアに基づいて、ユニバーサルでトレーニング不要なフレームワークである$textbfMQM-APEを紹介します。
実験の結果,GEMBA-MQMに対する誤差の信頼性と品質の両方が一貫して改善されていることがわかった。
論文 参考訳(メタデータ) (2024-09-22T06:43:40Z) - Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning [31.972053219549757]
TREACLEは、ユーザの金銭的コストとレイテンシの制約を尊重しながら、モデルとプロンプトスキームを共同で選択する強化学習ポリシーである。
評価の結果,TREACLEはベースラインに比べて最大85%のコスト削減が可能であり,精度は高いことがわかった。
論文 参考訳(メタデータ) (2024-04-17T05:56:49Z) - SCREWS: A Modular Framework for Reasoning with Revisions [58.698199183147935]
我々は、リビジョンを伴う推論のためのモジュラーフレームワークであるSCREWSを紹介する。
我々は、SCREWSが、共通のフレームワークの下で、いくつかの以前のアプローチを統合することを示す。
我々は,多種多様な推論タスクに基づいて,最先端のLCMを用いてフレームワークの評価を行った。
論文 参考訳(メタデータ) (2023-09-20T15:59:54Z) - Towards Automated Document Revision: Grammatical Error Correction,
Fluency Edits, and Beyond [46.130399041820716]
ACLアンソロジーから採取した学術論文をプロの編集者が改訂する文書改訂コーパスTETRAを導入する。
TETRAの独特性を既存の文書修正コーパスと比較し、微妙な違いであっても、修正後の文書の品質を識別できることを実証する。
論文 参考訳(メタデータ) (2022-05-23T17:37:20Z) - Sequential algorithmic modification with test data reuse [4.893345190925178]
機械学習アルゴリズムの初期リリース後、後続の収集データで再トレーニングすることで、モデルを微調整することができる。
各修正はパフォーマンスを劣化させるリスクを導入し、テストデータセットで検証する必要があります。
最近の研究では、同じデータセットで修正を繰り返しテストする方法が示されている。
論文 参考訳(メタデータ) (2022-03-21T22:43:40Z) - Post-Contextual-Bandit Inference [57.88785630755165]
コンテキストバンディットアルゴリズムは、電子商取引、医療、政策立案における非適応的なA/Bテストを置き換える傾向にある。
研究参加者の成果を改善することもでき、良い方針や最良の政策を特定できる可能性を高めることもできる。
研究の終盤における新規介入の信頼性推論を支援するため, 平均治療効果, サブグループ効果, あるいは新政策の価値について, 有効な信頼区間を構築したい。
論文 参考訳(メタデータ) (2021-06-01T12:01:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。