論文の概要: Understanding Pre-training and Fine-tuning from Loss Landscape Perspectives
- arxiv url: http://arxiv.org/abs/2505.17646v1
- Date: Fri, 23 May 2025 09:06:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-05-26 18:08:33.947627
- Title: Understanding Pre-training and Fine-tuning from Loss Landscape Perspectives
- Title(参考訳): 失われた景観から見た事前学習と微調整の理解
- Authors: Huanran Chen, Yinpeng Dong, Zeming Wei, Yao Huang, Yichi Zhang, Hang Su, Jun Zhu,
- Abstract要約: 事前学習によって「基本能力」の盆地が作り出され、その後の微調整によって「特殊能力」の盆地が生まれる。
最上級の景観(すなわち、ほとんどの方向に沿った風景)と最悪の景観(すなわち、最悪の方向に沿った風景)の2つのタイプの損失景観について検討する。
- 参考スコア(独自算出の注目度): 41.198324363256525
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent studies have revealed that the loss landscape of large language models resembles a basin, within which the models perform nearly identically, and outside of which they lose all their capabilities. In this work, we conduct further studies on the loss landscape of large language models. We discover that pre-training creates a "basic capability" basin, and subsequent fine-tuning creates "specific capability" basins (e.g., math, safety, coding) within the basic capability basin. We further investigate two types of loss landscapes: the most-case landscape (i.e., the landscape along most directions) and the worst-case landscape (i.e., the landscape along the worst direction). We argue that as long as benign fine-tuning remains within the most-case basin, it will not compromise previous capabilities. Similarly, any fine-tuning (including the adversarial one) that stays within the worst-case basin would not compromise previous capabilities. Finally, we theoretically demonstrate that the size of the most-case basin can bound the size of the worst-case basin and the robustness with respect to input perturbations. We also show that, due to the over-parameterization property of current large language models, one can easily enlarge the basins by five times.
- Abstract(参考訳): 近年の研究では、大きな言語モデルの損失景観が流域に似ており、その内部ではモデルがほぼ同一に機能し、その外では全ての能力を失うことが示されている。
本研究では,大規模言語モデルの損失景観についてさらなる研究を行う。
事前学習によって基本能力盆地が生成され,その後の微調整によって基本能力盆地内に「特殊能力」盆地(数学,安全,コーディングなど)が形成される。
さらに、最も大きな風景(すなわち、ほとんどの方向に沿った風景)と最悪の景観(すなわち、最悪の方向に沿った風景)の2つのタイプの損失景観について検討する。
我々は、良心的な微調整が最上級の盆地に留まる限り、以前の能力を損なうことはないと論じている。
同様に、最悪のケースの盆地に留まる微調整(敵を含む)は、以前の能力を損なうことはない。
最後に, 最大ケース盆地の大きさが, 入力摂動に対する最悪のケース盆地の大きさとロバスト性とを束縛できることを理論的に証明する。
また,現在の大規模言語モデルの過度パラメータ化特性から,流域を5倍に拡大できることが示唆された。
関連論文リスト
- Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling [49.41422138354821]
非負の因子分析をBradley-Terry選好モデルに統合する原理的報酬モデリングフレームワークを提案する。
BNRMは、スパースで非負の潜在因子生成過程を通じて報酬を表す。
BNRMは報酬の過度な最適化を著しく軽減し、分布シフトによるロバスト性を改善し、強いベースラインよりも解釈可能な報酬分解をもたらすことを示す。
論文 参考訳(メタデータ) (2026-02-11T08:14:11Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Reducing Memorisation in Generative Models via Riemannian Bayesian Inference [40.41090345118905]
データ分布の変動をよりよく捉えた予測後部を構築する。
提案手法は,一般化を保ちながら記憶を減少させることを示した。
全体として,損失の幾何学を考えることで,パラメータ空間の有効利用が可能となることを示す。
論文 参考訳(メタデータ) (2026-01-30T11:08:51Z) - Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding [25.87853252053879]
水路環境に特化して設計された最初のキャプションデータセットであるWaterCaptionを紹介する。
WaterCaptionは、きめ細かいマルチリージョンの長文記述に焦点を当てている。
我々は,USVのためのエッジデプロイ可能なマルチモーダルな大規模言語モデルであるDa Yuを提案する。
論文 参考訳(メタデータ) (2025-06-24T03:48:48Z) - Understanding Overadaptation in Supervised Fine-Tuning: The Role of Ensemble Methods [11.695512384798299]
監視された微調整は、基礎モデルを専門的なタスクに適応するための支配的なアプローチである。
視覚モデルでは、事前訓練されたモデルと微調整されたモデルを組み合わせることでこの問題を軽減することが示されている。
アンサンブルモデルは基礎モデルからの一般的な知識を保持するだけでなく、微調整されたドメイン自体においても、微調整されたモデルよりも優れる。
論文 参考訳(メタデータ) (2025-06-02T17:23:16Z) - Do Language Models Use Their Depth Efficiently? [53.56816097840505]
Llama 3.1 および Qwen 3 モデルの残留ストリームを分析する。
後半のレイヤが前半のレイヤよりもはるかに少ないことが分かりました。
マルチホップタスクでは、モデルが深度を増してサブレサルを構成するという証拠が見つからない。
論文 参考訳(メタデータ) (2025-05-20T04:00:56Z) - Energy-Conserving Neural Network Closure Model for Long-Time Accurate and Stable LES [0.0]
我々は,鍵となる物理保存則を保ちながら安定性を強制する閉鎖モデルとして,スキュー対称ニューラルネットワークアーキテクチャを開発した。
提案手法は, 質量, 運動量, エネルギーの保存を確実にする離散化と, 粗粒な速度場における質量の保存を維持するための対面吸収フィルタを利用する。
論文 参考訳(メタデータ) (2025-04-08T09:49:18Z) - Understanding Flatness in Generative Models: Its Role and Benefits [9.775257597631244]
教師付き学習における堅牢性を高めることが知られているフラット・ミニマは、生成モデルにおいてほとんど探索されていない。
より平坦なミニマは、対象の事前分布における摂動に対する頑健性を改善するという理論的主張を確立する。
拡散モデルにおける平坦なミニマは、生成性能だけでなく、頑健性も向上することを示した。
論文 参考訳(メタデータ) (2025-03-14T04:38:53Z) - HYPNOS : Highly Precise Foreground-focused Diffusion Finetuning for Inanimate Objects [1.706656684496508]
頑健な拡散モデルは、ある積の結果のほぼ完全な再構成を行う能力によって決定される。
現在の顕著な拡散に基づく微調整技術は、前景オブジェクトの一貫性を維持するには不十分である。
我々は,高精度な前景焦点拡散微調整技術であるHypnosを提案する。
論文 参考訳(メタデータ) (2024-10-18T08:20:37Z) - Depth Anything V2 [84.88796880335283]
V2は3つの重要なプラクティスを通じて、より微細でより堅牢な深度予測を生成する。
すべてのラベル付き実像を合成画像に置き換え、教師モデルの容量を拡大し、大規模な擬似ラベル付き実像のブリッジを通じて生徒モデルを教える。
その強い一般化能力から、距離深度モデルを得るために、距離深度ラベルを微調整する。
論文 参考訳(メタデータ) (2024-06-13T17:59:56Z) - Super Consistency of Neural Network Landscapes and Learning Rate Transfer [72.54450821671624]
我々は、失われたヘッセンのレンズを通して風景を研究する。
我々は、$mu$P のスペクトル特性がネットワークの大きさに大きく依存していることを発見した。
ニューラルタンジェントカーネル(NTK)や他のスケーリングシステムでは、シャープネスは異なるスケールで非常に異なるダイナミクスを示す。
論文 参考訳(メタデータ) (2024-02-27T12:28:01Z) - Learning Robust Precipitation Forecaster by Temporal Frame Interpolation [65.5045412005064]
本研究では,空間的不一致に対するレジリエンスを示す頑健な降水予測モデルを構築した。
提案手法は,textit4cast'23コンペティションの移行学習リーダーボードにおいて,textit1位を確保したモデルにおいて,予測精度が大幅に向上した。
論文 参考訳(メタデータ) (2023-11-30T08:22:08Z) - On the Embedding Collapse when Scaling up Recommendation Models [53.66285358088788]
埋め込み崩壊現象をスケーラビリティの阻害とみなし、埋め込み行列は低次元の部分空間を占有する傾向にある。
本稿では,組込み集合固有の相互作用モジュールを組み込んで,多様性を持つ組込み集合を学習する,単純かつ効果的な組込み設計を提案する。
論文 参考訳(メタデータ) (2023-10-06T17:50:38Z) - Uncertainty Quantification in Inverse Models in Hydrology [9.020366051310384]
本研究では,ストリームフローと気象データから物理特性を復元する知識誘導確率逆モデリング手法を提案する。
我々は,河川流域特性を推定するための最先端の逆モデルと比較した。
我々のフレームワークはまた、逆モデルとフォワードモデルの両方の不確実性を定量化できるため、説明可能性の向上も提供する。
論文 参考訳(メタデータ) (2023-10-03T16:39:21Z) - Fine-tuning can cripple your foundation model; preserving features may be the solution [87.35911633187204]
タスク上の概念を認識できる微調整モデルの能力は、事前訓練されたモデルに比べて大幅に低下する。
我々は、下流タスクに関連する新しい概念を学習しながら、モデルが事前学習した知識を保存できる「textitLDIFS$」という新しい微調整手法を提案する。
論文 参考訳(メタデータ) (2023-08-25T11:49:51Z) - Can we avoid Double Descent in Deep Neural Networks? [3.1473798197405944]
二重降下は、ディープラーニングコミュニティの注目を集めている。
これは、高一般化を維持するために最適なモデルのサイズについて深刻な疑問を提起する。
本研究は, 学習問題の適切な条件付けにより, 二重降下現象は回避可能であることを示す。
論文 参考訳(メタデータ) (2023-02-26T08:12:28Z) - An evaluation of deep learning models for predicting water depth
evolution in urban floods [59.31940764426359]
高空間分解能水深予測のための異なる深層学習モデルの比較を行った。
深層学習モデルはCADDIESセル-オートマタフラッドモデルによってシミュレーションされたデータを再現するために訓練される。
その結果,ディープラーニングモデルでは,他の手法に比べて誤差が低いことがわかった。
論文 参考訳(メタデータ) (2023-02-20T16:08:54Z) - Towards Accurate Reconstruction of 3D Scene Shape from A Single
Monocular Image [91.71077190961688]
まず、未知のスケールまで深さを予測し、単一の単眼画像からシフトする2段階のフレームワークを提案する。
次に、3Dポイントの雲のデータを利用して、奥行きの変化とカメラの焦点距離を予測し、3Dシーンの形状を復元します。
我々は9つの未知のデータセットで深度モデルを検証し、ゼロショット評価で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-08-28T16:20:14Z) - Likelihood Landscapes: A Unifying Principle Behind Many Adversarial
Defenses [15.629921195632857]
本研究では,防御技術が地形形状に与える影響について検討する。
敵防衛技術のサブセットは、可能性の景観を平らにする同様の効果をもたらす。
論文 参考訳(メタデータ) (2020-08-25T22:51:51Z) - The Global Landscape of Neural Networks: An Overview [23.79848233534269]
ニューラルネットワークの最近の成功は、その損失がそれほど悪くはないことを示唆している。
我々は,「悪い」経路のような幾何学的特性の広いネットワークに関する厳密な結果について論じるとともに,最適化された局所最小値を排除したり,無限大への可視化を減らしたりするいくつかの修正について論じる。
論文 参考訳(メタデータ) (2020-07-02T22:50:20Z) - Learnable Bernoulli Dropout for Bayesian Deep Learning [53.79615543862426]
Learnable Bernoulli Dropout (LBD) は、他のモデルパラメータと共に最適化されたパラメータとしてドロップアウト率を考慮する新しいモデルに依存しないドロップアウトスキームである。
LBDは画像分類とセマンティックセグメンテーションにおける精度と不確実性の推定を改善する。
論文 参考訳(メタデータ) (2020-02-12T18:57:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。