論文の概要: Prototype Language Models
- arxiv url: http://arxiv.org/abs/2607.00510v1
- Date: Wed, 01 Jul 2026 06:45:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.762646
- Title: Prototype Language Models
- Title(参考訳): プロトタイプ言語モデル
- Authors: Dan Ley, Giang Nguyen, Himabindu Lakkaraju, Julius Adebayo,
- Abstract要約: プロトタイプ言語モデルは、学習されたプロトタイプのスパースで非負の混合によって、それぞれの予測を形成する。
スパースプロトタイプ構造は、損失ランドスケープの曲率を局所化し、よりトラクタブルなヘッセンとなることを示す。
- 参考スコア(独自算出の注目度): 32.76699413390825
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowing which training examples drive outputs is fundamental to auditing, correcting, and understanding language models, yet for modern LLMs this remains expensive, approximate, and largely post-hoc. Standard language models generate tokens through a dense network pathway, causing training data's influence to be distributed across parameters rather than organized along explicit, traceable components. We introduce a prototype language model architecture, Prototypes for Interpretable Sequence Modeling (PRISM), that forms each prediction via a sparse, non-negative mixture of learned prototypes, trained with clustering objectives that anchor each prototype to coherent neighborhoods of training examples. Across architectures from 130M to 1.6B parameters trained on up to 50B tokens, prototype language models either surpass or remain within 2.5 percentage points on average downstream accuracy of matched dense baselines. We show that sparse prototype structure localizes curvature in the loss landscape, yielding a more tractable Hessian and enabling training data attribution that is ~500x faster than post hoc baselines when consuming equivalent memory. Calibrating linear prototype controllers can improve downstream accuracy by roughly 3 points while tracing those corrections back to training neighborhoods, and targeted prototype suppression can remove model behaviors without finetuning or measurable loss in generation quality.
- Abstract(参考訳): どのトレーニングサンプルがアウトプットを駆動するかを知ることは、監査、修正、言語モデルの理解に不可欠であるが、現代のLLMでは、これは高価で近似的であり、ほとんどがポストホックである。
標準言語モデルは、密集したネットワークパスを通じてトークンを生成し、明示的でトレース可能なコンポーネントに沿って編成されるのではなく、トレーニングデータの影響をパラメータに分散させる。
本稿では,言語モデルアーキテクチャのプロトタイプであるPrototypes for Interpretable Sequence Modeling (PRISM)を紹介した。
最大50Bトークンでトレーニングされた130Mから1.6Bまでのアーキテクチャ全体において、プロトタイプ言語モデルは一致した高密度ベースラインの平均下流精度で2.5ポイント以内に留まる。
スパースプロトタイプ構造は、損失ランドスケープ内の曲率を局所化し、よりトラクタブルなヘッセンを発生させ、等価メモリを消費する際のポストホックベースラインよりも500倍高速なトレーニングデータアトリビューションを可能にする。
線形プロトタイプコントローラのキャリブレーションは、これらの補正をトレーニング地区に追跡しながら、約3ポイントのダウンストリーム精度を向上させることができ、ターゲットとなるプロトタイプの抑制は、生成品質の微調整や測定不能な損失を伴わずにモデル動作を除去することができる。
関連論文リスト
- ProtoTTA: Prototype-Guided Test-Time Adaptation [8.178991486617972]
本稿では,モデル出力のみに依存するのではなく,中間プロトタイプ信号を利用するプロトタイプモデルのためのフレームワークであるProtoTTAを紹介する。
ProtoTTAは、プロトタイプの類似性分布のエントロピーを最小化し、シフトしたデータに対する信頼性とプロトタイプ固有のアクティベーションを促進する。
また、新しい解釈可能性指標と視覚言語最小化モデル(VLM)評価フレームワークを導入し、TTA力学を説明する。
論文 参考訳(メタデータ) (2026-04-16T19:52:57Z) - MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models [27.682531424487564]
スパシティアウェアトレーニングは、大きな言語モデルをハードウェアフレンドリーなスパースパターンに変換するための効果的なアプローチである。
スパースモデルのための連続的かつ微分可能なスパース対応トレーニングフレームワークであるContinuous Adaptive Sparse Trainer (CAST)を提案する。
以上の結果から,従来の最先端手法に比べて,トレーニングリソースの最小化による難易度とゼロショット精度の両面で有意な改善が見られた。
論文 参考訳(メタデータ) (2025-09-30T09:28:47Z) - Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation [75.18058114915327]
一般化されたFew-Shot Semanticnative(GFSS)は、いくつかの注釈付き例だけでセグメンテーションモデルを新しいクラスに拡張することを目的としている。
プリトレーニング済みCLIPのマルチモーダルプロトタイプ上での確率的プロトタイプ校正フレームワークであるFewCLIPを提案する。
FewCLIPはGFSSとクラスインクリメンタルセッティングの両方で最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2025-06-28T18:36:22Z) - What Do Learning Dynamics Reveal About Generalization in LLM Reasoning? [83.83230167222852]
モデルの一般化動作は,事前記憶列車の精度と呼ばれるトレーニング指標によって効果的に特徴づけられることがわかった。
モデルの学習行動と一般化を結びつけることで、トレーニング戦略に目標とする改善を導くことができる。
論文 参考訳(メタデータ) (2024-11-12T09:52:40Z) - This Looks Better than That: Better Interpretable Models with ProtoPNeXt [14.28283868577614]
原型部品モデルは、コンピュータビジョンのためのブラックボックスディープラーニングモデルに代わる一般的な解釈可能な代替品である。
原型モデルのコンポーネントを統合するための新しいフレームワーク、ProtoPNeXtを作成します。
論文 参考訳(メタデータ) (2024-06-20T18:54:27Z) - Rethinking Few-shot 3D Point Cloud Semantic Segmentation [62.80639841429669]
本稿では,FS-PCSによる3Dポイント・クラウドセマンティックセマンティックセグメンテーションについて再検討する。
我々は、最先端の2つの重要な問題、前景の漏洩とスパースポイントの分布に焦点をあてる。
これらの問題に対処するために、新しいベンチマークを構築するための標準化されたFS-PCS設定を導入する。
論文 参考訳(メタデータ) (2024-03-01T15:14:47Z) - The Languini Kitchen: Enabling Language Modelling Research at Different
Scales of Compute [66.84421705029624]
本稿では,アクセル時間で測定された等価計算に基づくモデル比較を可能にする実験的プロトコルを提案する。
私たちは、既存の学術的ベンチマークを上回り、品質、多様性、文書の長さで上回る、大規模で多様で高品質な書籍データセットを前処理します。
この研究は、GPT-2アーキテクチャから派生したフィードフォワードモデルと、10倍のスループットを持つ新しいLSTMの形式でのリカレントモデルという2つのベースラインモデルも提供する。
論文 参考訳(メタデータ) (2023-09-20T10:31:17Z) - Same Pre-training Loss, Better Downstream: Implicit Bias Matters for
Language Models [46.24479693469042]
本稿では,(1)事前学習損失が下流性能を完全に説明できないこと,(2)事前学習損失がない場合の下流性能とモデルの平坦性はよく相関していることを示す。
論文 参考訳(メタデータ) (2022-10-25T17:45:36Z) - Meta-learning Pathologies from Radiology Reports using Variance Aware
Prototypical Networks [3.464871689508835]
本稿では,数ショットのテキスト分類のためのプロトタイプネットワークの簡易拡張を提案する。
我々の主な考えは、クラスプロトタイプをガウスに置き換え、サンプルを適切なクラスセントロイドの近くでクラスタ化することを奨励する正規化項を導入することである。
論文 参考訳(メタデータ) (2022-10-22T05:22:29Z) - Unsupervised Paraphrasing with Pretrained Language Models [85.03373221588707]
教師なし環境で,事前学習した言語モデルを用いて高品質なパラフレーズを生成する訓練パイプラインを提案する。
提案手法は,タスク適応,自己スーパービジョン,動的ブロッキング(Dynamic Blocking)という新しい復号アルゴリズムから構成される。
提案手法は,Quora Question PairとParaNMTの両方のデータセット上で,最先端の性能を達成できることを示す。
論文 参考訳(メタデータ) (2020-10-24T11:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。