論文の概要: Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent
- arxiv url: http://arxiv.org/abs/2608.04772v1
- Date: Wed, 05 Aug 2026 12:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.923411
- Title: Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent
- Title(参考訳): ガイドライン・アズ・オラクル:眼科電話トリアージエージェントのゼロアノテーショントレーニング
- Authors: Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song,
- Abstract要約: 本稿では,米国眼科学会のガイドラインを70行のオペレーショナルルールテーブルにコンパイルするガイドライン・アズ・オラクル(GAO)を紹介する。
提案する8つの構成戦略をカタログ化し,提案手法の紹介,1ファクト境界ペア,メタデータのみの修復,ラベル修復について述べる。
- 参考スコア(独自算出の注目度): 6.32175194611846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling supervision for multi-turn medical agents is difficult because expert dialogue annotation is costly and clinical conversations are privacy-restricted. We introduce Guideline-as-Oracle (GAO), which compiles American Academy of Ophthalmology guidance into a 70-row operational rule table and uses it as the sole source of instance-level supervision for 3,000 training dialogues, reserving human labeling for evaluation. Because converting rules into dialogues is itself a design problem, we catalog eight construction strategies, including cited-row tier assignment, one-fact boundary pairs, metadata-only repair, and label repair, and characterize the evidential status of each: labeling mechanism, null, confounded, or evaluated only as a package. Fine-tuning a 9B backbone on this corpus yields GAO-Triage, improving agreement with a 201-case operational reference from 61.7% to 74.1% (exact McNemar p=0.0046) and emergent-case recall from 9.5% to 69.0%; the gains persist across a second seed and patient simulator. None of the seven general-purpose systems we test dominates GAO-Triage on both metrics, and GAO-Triage requires no frontier model at inference time. Permuting label-dialogue assignments collapses the model to a constant-routine predictor, indicating that the signal lies in guideline-derived assignment rather than dialogue surface form. Label repair coincides with the disappearance of a late-training safety degradation.
- Abstract(参考訳): 専門家対話アノテーションはコストがかかり、臨床会話はプライバシーに制限があるため、マルチターン医療エージェントのスケーリング監視は困難である。
本稿では,米国眼科学会のガイドラインを70行のオペレーティング・ルールテーブルにコンパイルし,3000のトレーニング・ダイアログのインスタンスレベル・インスペクションの唯一のソースとして利用し,評価のために人間のラベルを保存するためのガイドライン・アズ・オラクル(GAO)を紹介した。
ルールをダイアログに変換することは、それ自体設計上の問題であるため、参照ロウ層割り当てや1ファクト境界ペア、メタデータのみの修復、ラベル修復を含む8つの構成戦略をカタログ化し、ラベル機構、ヌル、コンストラクション、パッケージとしてのみ評価する。
このコーパスの9Bバックボーンを微調整するとGAO-Triageが得られ、201ケースの運用基準を61.7%から74.1%(マクネマールp=0.0046)に改善し、緊急ケースのリコールを9.5%から69.0%に改善し、第2シードと患者シミュレータ間で利得が持続する。
私たちがテストした7つの汎用システムはどちらもGAO-Triageを支配せず、GAO-Triageは推論時にフロンティアモデルを必要としない。
ラベルと対話の割り当ての置換は、モデルを定数ルーチン予測器に分解し、信号が対話面の形式ではなく、ガイドラインから導かれる代入にあることを示す。
ラベル修復は、遅発性安全劣化の消失と一致する。
関連論文リスト
- Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs [0.0]
Qwen2.5 7B, Llama 3.1 8B, Gemma2 9Bの3つのオープンソースモデルを評価する。
スキーマ非コンプライアンスは3つのモデルファミリ間で一貫性があり、ベースラインコンプライアンス率は85.9から91.6%である。
バリデーション・リペア・フレームワークは、モデル全体で98.4から99.4%の範囲で、全体的なコンプライアンスを99.0パーセント達成している。
論文 参考訳(メタデータ) (2026-07-27T12:45:27Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges [2.8523456804049885]
安全審査員は、進化する基準に対してモデルアウトプットを評価するためにますます配置される。
最近のメタ評価研究は、プロンプトとルーブリックの変動下では脆く保たれていることを示している。
本稿では,インスタンス条件の動的ルーブリックと,信頼性と表現性を備えたカリキュラムを組み合わせたトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-06-08T08:02:57Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking [2.2573512203799626]
本稿では,NLUを独立したツールコールとして再構成する有界神経シンボルアーキテクチャであるReacTODを提案する。
有界ReActループは反復自己補正を可能にし、MultiWOZ上のシングルパス推論よりも最大9.3ポイント精度を向上させる。
論文 参考訳(メタデータ) (2026-05-18T20:06:04Z) - Detecting Stealth Sycophancy in Mental-Health Dialogue with Dynamic Emotional Signature Graphs [4.002154823241671]
最終審査員として大規模言語モデルに頼ることなく,多言語対応対話の評価を行う。
直接LLM判定器と対称テキスト類似度測定器は治療品質に不適合であることが判明した。
この問題に対処するため,動的感情署名グラフ(DESG)を提案する。
DESGは、分離された臨床状態を持つ対話ウィンドウを表現し、非対称な臨床幾何学を用いてそれらをスコアする。
論文 参考訳(メタデータ) (2026-05-05T07:56:20Z) - Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols [6.357772907811544]
SSRP(Self- Synthesizing Reasoning Protocols)は、アーキテクチャ計画と手続き実行の分離を実装するメタ認知フレームワークである。
提案する実験層は,浅電流に基づく検索パイロット,高エントロピーSOP,セマンティックハイジャック3ホップ多要素合成タスクの3種類である。
以上の結果から,GPT 5.4の非定常バニラ基準線が0.1%に崩壊し,SSRPは715X耐力限界を達成した。
論文 参考訳(メタデータ) (2026-04-27T14:13:30Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。