論文の概要: How Should Transformers Encode Numeric Values in Electronic Health Records?
- arxiv url: http://arxiv.org/abs/2607.01391v1
- Date: Wed, 01 Jul 2026 18:49:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.558009
- Title: How Should Transformers Encode Numeric Values in Electronic Health Records?
- Title(参考訳): トランスフォーマーは電子カルテの数値をエンコードすべきか?
- Abstract要約: 数値精度、最適化、アーキテクチャの柔軟性のトレードオフを示す。
値-概念相互作用を明示的にモデル化する手法は,精度に敏感な算術処理に最適である。
タスク全体にわたって、モデルは正確な算術ではなく、信頼できる「十分良い」数値計算を一貫して示す。
- 参考スコア(独自算出の注目度): 11.191468812375321
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: How do we encode numeric values in transformer-based sequence processing, particularly in electronic health record (EHR) data? We systematically compare discrete, continuous, and hybrid value encoding strategies using synthetic arithmetic tasks embedded within real-world EHR data, as well as real-world clinical prediction tasks. Our study reveals trade-offs between numeric precision, optimisation stability, and architectural flexibility. We find that approaches that explicitly model value-concept interactions perform best on precision-sensitive arithmetic tasks when architectural constraints permit. Hybrid token-based approaches that retain numeric values but apply binning prior to projection provide a more robust and broadly applicable alternative, with the optimal number of bins following a simple empirically derived power-law in dataset size. Across tasks, models consistently exhibit reliable "good enough" numeric computation rather than exact arithmetic, while clinical gains from incorporating laboratory values are task-dependent. This suggests that robustness and deployability often outweigh maximal numeric precision in practice, motivating hybrid token-based approaches as a practical default.
- Abstract(参考訳): トランスフォーマーベースのシーケンス処理、特に電子健康記録(EHR)データにおいて、数値値をエンコードするにはどうすればよいか?
実世界のERHデータに埋め込まれた合成算術タスクと実世界の臨床予測タスクを用いて、離散的、連続的、ハイブリッドな値符号化戦略を体系的に比較する。
本研究は,数値精度,最適化安定性,アーキテクチャの柔軟性のトレードオフを明らかにする。
アーキテクチャ制約が許される場合, 値-概念相互作用を明示的にモデル化する手法は, 精度に敏感な算術処理に最適であることがわかった。
数値を保持するハイブリッドトークンベースのアプローチは、投射前にバイナリを適用することで、より堅牢で広く適用可能な代替手段を提供する。
タスク全体にわたって、モデルは正確な算術よりも信頼性の高い「十分良い」数値計算を示し、実験室の値を組み込むことによる臨床的な利益はタスクに依存している。
これは、ロバスト性とデプロイ性が、実際は最大数値精度を上回ることがしばしばあり、実際的なデフォルトとしてハイブリッドトークンベースのアプローチを動機付けていることを示唆している。
関連論文リスト
- Learning Interpretable Point-Based Clinical Risk Scores via Direct Optimization [16.98127677447133]
我々は,明示的かつ合理的な最適性目標の下で,加法的スコアリングを直接学習する新しい機械学習アルゴリズムを開発した。
提案手法を電子健康記録(EHR)コーホートに応用し,整数重み付き共生スコアを構築し,退院後死亡リスクを測定する。
論文 参考訳(メタデータ) (2026-05-18T20:58:39Z) - Value-Aware Numerical Representations for Transformer Language Models [1.2680800636608986]
トランスフォーマーベースの言語モデルは、しばしば数学的推論ベンチマークにおいて強力な結果を得る。
中心的な制限は、数値が数値を明示的にエンコードしないシンボルトークンとして処理されることである。
本稿では,標準的なトークン化入力を専用のプレフィックストークンで拡張する値認識数値表現を提案する。
論文 参考訳(メタデータ) (2026-01-14T18:59:14Z) - Mixed Precision Training of Neural ODEs [1.3382837742547355]
本稿では,ニューラルネットワークのための混合精度学習フレームワークを提案する。
明示的なODEソルバとカスタムバックプロパゲーションスキームを組み合わせる。
約50%のメモリ削減と最大2倍のスピードアップを実現し、精度は単精度トレーニングに匹敵する。
論文 参考訳(メタデータ) (2025-10-27T16:32:56Z) - Data-Driven Surrogate Modeling Techniques to Predict the Effective Contact Area of Rough Surface Contact Problems [39.979007027634196]
効果的な接触領域は、摩耗、封止、熱伝導や電気伝導といった多物理現象において重要な役割を果たしている。
本研究では,データ駆動手法を高速に評価し,効果的な接触領域を予測するための代理モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-24T08:15:46Z) - Synergistic Development of Perovskite Memristors and Algorithms for Robust Analog Computing [53.77822620185878]
本稿では,ペロブスカイト・メムリスタの製作を同時に最適化し,ロバストなアナログDNNを開発するための相乗的手法を提案する。
BO誘導ノイズインジェクションを利用したトレーニング戦略であるBayesMultiを開発した。
我々の統合されたアプローチは、より深くより広いネットワークでのアナログコンピューティングの使用を可能にし、最大100倍の改善を実現します。
論文 参考訳(メタデータ) (2024-12-03T19:20:08Z) - Discovering physical laws with parallel symbolic enumeration [67.36739393470869]
並列記号列挙法(PSE)を導入し,限られたデータから汎用数学的表現を効率的に抽出する。
実験の結果,PSEは最先端のベースラインアルゴリズムと比較して精度が高く,計算速度も速いことがわかった。
PSEは、記号的、解釈可能なモデルの正確で効率的なデータ駆動による発見の進歩を表している。
論文 参考訳(メタデータ) (2024-07-05T10:41:15Z) - Fast Shapley Value Estimation: A Unified Approach [71.92014859992263]
冗長な手法を排除し、単純で効率的なシェープリー推定器SimSHAPを提案する。
既存手法の解析において、推定器は特徴部分集合からランダムに要約された値の線形変換として統一可能であることを観察する。
実験により,SimSHAPの有効性が検証され,精度の高いShapley値の計算が大幅に高速化された。
論文 参考訳(メタデータ) (2023-11-02T06:09:24Z) - Incrementally-Computable Neural Networks: Efficient Inference for
Dynamic Inputs [75.40636935415601]
ディープラーニングは、センサーデータやユーザ入力などの動的入力を効率的に処理するという課題に直面していることが多い。
インクリメンタルな計算アプローチを採用し、入力の変化に応じて計算を再利用する。
本稿では,この手法をトランスフォーマーアーキテクチャに適用し,修正入力の分数に比例した複雑性を持つ効率的なインクリメンタル推論アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-07-27T16:30:27Z) - A Stable, Fast, and Fully Automatic Learning Algorithm for Predictive
Coding Networks [65.34977803841007]
予測符号化ネットワークは、ベイズ統計学と神経科学の両方にルーツを持つ神経科学にインスパイアされたモデルである。
シナプス重みに対する更新規則の時間的スケジュールを変更するだけで、元の規則よりもずっと効率的で安定したアルゴリズムが得られることを示す。
論文 参考訳(メタデータ) (2022-11-16T00:11:04Z) - HyperImpute: Generalized Iterative Imputation with Automatic Model
Selection [77.86861638371926]
カラムワイズモデルを適応的かつ自動的に構成するための一般化反復計算フレームワークを提案する。
既製の学習者,シミュレータ,インターフェースを備えた具体的な実装を提供する。
論文 参考訳(メタデータ) (2022-06-15T19:10:35Z) - Conservative Objective Models for Effective Offline Model-Based
Optimization [78.19085445065845]
計算設計の問題は、合成生物学からコンピュータアーキテクチャまで、様々な場面で発生している。
本研究では,分布外入力に対する接地的目標の実際の値を低くする目的関数のモデルを学習する手法を提案する。
COMは、様々なMBO問題に対して、既存のメソッドの実装と性能の面では単純である。
論文 参考訳(メタデータ) (2021-07-14T17:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。