論文の概要: Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization
- arxiv url: http://arxiv.org/abs/2608.20768v3
- Date: Thu, 27 Aug 2026 05:28:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.523198
- Title: Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization
- Title(参考訳): エンドポイントゲインを超えて:医療スペシャライゼーションのウェイトデルタ監査
- Abstract要約: 重み付きデルタパス監査法を提案し,これを2つの一般・一般・医療・専門のチェックポイントペアに適用する。
その主張は、臨床的検証、修復、サーキットレベルのメカニズムではなく、テキストのみの多重選択ベンチマークの動きに関するものである。
- 参考スコア(独自算出の注目度): 2.782879873824998
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Specialist language models are usually understood through endpoint gains: the generalist scores lower, the specialist scores higher, and the difference is treated as evidence of specialization. This leaves the released update itself largely unexamined. We propose a paired weight-delta path audit and apply it to two public, aligned generalist-to-medical-specialist checkpoint pairs: Gemma-3-4B-IT to MedGemma-4B-IT and Qwen2.5-7B-Instruct to HuatuoGPT-o1-7B. In both pairs, the full decoder-side update strongly reconstructs measured medical benchmark movement (0.974 and 1.183 endpoint-normalized retention), making each decoder delta an appropriate substrate for the audit. Yet the movement is not cleanly localized. MLP is the strongest broad component family in both pairs, but mixed off-domain movements, 10-seed matched controls, and endpoint-anchored rollbacks prevent a unique coarse-family explanation. The audit therefore separates update-level reconstruction from component-level explanation. Its claims concern text-only multiple-choice benchmark movement, not clinical validation, repair, or circuit-level mechanism.
- Abstract(参考訳): スペシャリスト言語モデルは通常エンドポイントゲインを通して理解され、ジェネラリストのスコアは低く、スペシャリストのスコアは高く、違いは特殊化の証拠として扱われる。
これにより、リリースされたアップデートそのものは、ほとんど検討されていない。
We propose a paired weight-delta path audit and it applied to two public, aligneded general-to-medical-specialists checkpoint pairs: Gemma-3-4B-IT to MedGemma-4B-IT and Qwen2.5-7B-Instruct to HuatuoGPT-o1-7B。
両方のペアにおいて、フルデコーダ側の更新は測定された医療ベンチマークの動き(0.974と1.183のエンドポイント正規化保持)を強く再構築し、各デコーダが監査に適切な基板となるようにした。
しかし、この動きは純粋に局所化されていない。
MLPは両組で最強の広義成分ファミリーであるが、10列の整合制御、エンドポイントアンカレッドロールバックといった混合オフドメインの動きは、独自の粗いファミリーの説明を妨げている。
従って監査は、更新レベルの再構築とコンポーネントレベルの説明を分離する。
その主張は、臨床的検証、修復、サーキットレベルのメカニズムではなく、テキストのみの多重選択ベンチマークの動きに関するものである。
関連論文リスト
- MedSNIP: Building and Benchmarking Snippet-Level Granularity for Medical Fact Verification [50.13873960887466]
我々はスニペットレベルの医療事実検証のベンチマークであるMedSNIP-Benchを紹介する。
また,自動スニペット生成パイプラインであるMedSNIPを導入する。
MedSNIP-Bench、HealthFC、MedHallu全体で、スニペットレベルの検証は偽クラスF1を保存または改善する。
論文 参考訳(メタデータ) (2026-09-11T14:08:44Z) - Differentiable Interval Bottlenecks for Interpretable Anomaly Detection in Numerical Data [0.5213778368155993]
DIFFINTは、遅延ボトルネックがソフトな軸方向のインターバルメンバシップのセットとして構成されるオートエンコーダである。
統計的にタイトされた7つの方法のリードクラスターの中で唯一の解釈可能な検出器である。
論文 参考訳(メタデータ) (2026-09-03T14:05:27Z) - Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI [3.7524666944787644]
2つの疑問は、どのモダリティに責任があるか、そしてモデルがモダリティを落として大音量または無音で失敗するかである。
モデルに依存しないモダリティ・欠陥の枠組みとして、Nのモダリティの埋め込み、マスクを意識したプローブ、ラベルを与えられた場合、例ごとの故障分類を返します。
モダリティ当たりのVSサイレントレートを報告し、3つのモダリティ相補性行列にスケールする。
論文 参考訳(メタデータ) (2026-08-02T19:38:56Z) - Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training [4.970364068620607]
ドメイン一般化(DG)を取り入れた最初の患者非依存型マルチモーダルうつ病検出フレームワークを提案する。
提案モデルでは、双方向長短期記憶(BiLSTM)と、意思決定のためのセグメントレベル融合を伴うモーダル内およびクロスモーダルアテンション機構を統合する。
このベースラインへのDGの追加は精度が2.5%増加し、F1スコアは3.3%増加し、93.2%の精度、93.2%の精度、96.2%のリコール、94.2%のF1スコアを達成した。
論文 参考訳(メタデータ) (2026-07-24T13:52:27Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications [17.69274632062373]
オープンエンドの会話エージェントは、早期診断ハンドオフとサイレントな臨床幻覚という、2つの重要な障害モードを伴いがちである。
LLM-as-a-judge'のルーティングを決定論的オーケストレーション制約に置き換えることで、両方の問題に対処するマルチエージェントフレームワークを提案する。
本稿では,150症例を対象に,ラマ3.1-70b-インストラクトモデルを用いたシミュレートされた患者エージェントを用いたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-06-16T15:39:19Z) - Shift-Dependent Asymmetry: Orthogonal Inverse Low-Rank Adaptation for Federated Medical Segmentation [60.41721951405564]
Low-Rank Adaptation (LoRA)は、医療画像のためのセグメンテーション基盤モデルの効率的なフェデレーション微調整を可能にする。
ほとんどの連合LoRA法は、医学的セグメンテーションにおいてエンコーダ-デコーダ非対称性の下で破れる一様アグリゲーション規則を採用している。
このミスマッチの絡み合いは、サイト固有のバイアスと解剖を共有し、一般化を損なう。
本稿では,効率的な更新空間における共有局所コリニアリティを罰する部分空間直交正規化器を提案する。
論文 参考訳(メタデータ) (2026-06-07T15:39:28Z) - GenGait: A Transformer-Based Model for Human Gait Anomaly Detection and Normative Twin Generation [11.553495883461359]
本研究では,トランスフォーマーマスマスキングオートエンコーダをベースとした,関節レベル自動修正のためのラベルフリーフレームワークを提案する。
提案手法は、疾患ラベルを必要とせず、歩行障害の解釈可能な主観的局所化を可能にする。
論文 参考訳(メタデータ) (2026-04-02T13:06:27Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models [57.20761595019967]
注意空間にL1をベースとした正規化・精細化を施した,効率的かつトレーニング不要な機構である正規化注意誘導(NAG)を提案する。
NAGは、CFGが忠実性を維持しながら崩壊する効果的な負のガイダンスを復元する。
NAGはアーキテクチャ(UNet、DiT)、サンプリングレシスタンス(複数ステップ、複数ステップ)、モダリティ(イメージ、ビデオ)をまたいで一般化する
論文 参考訳(メタデータ) (2025-05-27T13:30:46Z) - TAGS: A Test-Time Generalist-Specialist Framework with Retrieval-Augmented Reasoning and Verification [27.918192794935255]
テストタイムフレームワークであるTAGSについて述べる。このフレームワークは、幅広い能力を持つ模範とドメイン固有のスペシャリストを組み合わせることで、補完的な視点を提供する。
TAGSは9つのMedQAベンチマークで強力なパフォーマンスを実現し、GPT-4oの精度は13.8%、DeepSeek-R1は16.8%、バニラ7Bモデルは14.1%から23.9%向上した。
論文 参考訳(メタデータ) (2025-05-23T18:28:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。