論文の概要: The Blessing of Dimensionality: How Near-Orthogonality in High-Dimensional Spaces Explains Temporal Portability
- arxiv url: http://arxiv.org/abs/2607.20301v1
- Date: Wed, 22 Jul 2026 15:48:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.137722
- Title: The Blessing of Dimensionality: How Near-Orthogonality in High-Dimensional Spaces Explains Temporal Portability
- Title(参考訳): 次元の祝福--高次元空間における近直交が時空間の可搬性を説明する
- Abstract要約: The long-term temporal portability of PortLLM patch across 10 continual pretraining steps using base model Mistral, Gemma, Qwen。
ポータビリティは長期にわたって持続し、ベースモデルが定期的に更新される際には、繰り返し微調整が不要であることを示す。
- 参考スコア(独自算出の注目度): 39.02435736839143
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Fine-tuning has been widely used to adapt large language models (LLMs) for domain-specific tasks. Parameter efficient fine-tuning (PEFT) methods such as low-rank adaptation (LoRA) are frequently used to reduce computational costs. PortLLM is a training-free and data-free scheme used to adapt LLMs after continual pretraining. Although the initial PortLLM results show that LoRA patches exhibit short-term temporal portability, the long-term performance of PortLLM across several updates of continual pretraining remains underexplored. Furthermore, the intriguing effectiveness of PortLLM is not well understood from a theoretical standpoint. We address these two open questions by (1) performing an extensive empirical study of the long-term temporal portability of PortLLM patches across 10 continual pretraining steps using base models Mistral, Gemma, and Qwen; and (2) offering two theoretical analyses to explain our observation that the simple PortLLM method achieves competitive performance. We find empirically that the portability persists across longer time duration, indicating that repeated fine-tuning is not required when the base model is periodically updated. We find theoretically that near-orthogonality of high-dimensional vectors is a key justification for temporal portability. Our analyses also demonstrate a geometric perspective of the loss landscape in facilitating the theoretical comparison of different adaptation options.
- Abstract(参考訳): ファインチューニングは、ドメイン固有のタスクに大規模な言語モデル(LLM)を適用するために広く使われている。
低ランク適応 (LoRA) のようなパラメータ効率のよい微細チューニング (PEFT) 法は計算コストを削減するために頻繁に用いられる。
PortLLM は、連続的な事前訓練後に LLM を適応するために使われるトレーニングフリーでデータフリーなスキームである。
初期のPortLLMの結果は、LoRAパッチが短期的な一時的ポータビリティを示すことを示しているが、PortLLMの長期的性能は、継続事前トレーニングのいくつかの更新で明らかにされていない。
さらに、PortLLMの興味深い効果は理論的観点からはよく理解されていない。
これら2つのオープンな質問は,(1)基本モデルであるMistral,Gemma,Qwenを用いて,PortLLMパッチの長期的ポータビリティの長期的検証を行い,(2)単純なPortLLM法が競争性能を達成できることを示す2つの理論的解析を行った。
ポータビリティが長期にわたって持続していることは実証的に明らかであり、ベースモデルが定期的に更新される際には、繰り返し微調整が不要であることを示す。
理論上、高次元ベクトルのほぼ直交性は時間的可搬性にとって重要な正当性である。
また, 異なる適応オプションの理論的比較を容易にするために, 損失景観の幾何学的視点を示す。
関連論文リスト
- MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models [64.2820121997882]
MIITAはメモリ駆動型推論時間適応フレームワークである。
教師付きエクスペリエンスをセマンティックアンカーを備えたコンパクトな修正指向プロトタイプとして格納し、セマンティックおよび不確実性ベースのキューを使用して推論時にそれらを検索する。
実験により、MIITAは最終性能を継続的に改善し、固定メモリの予算下での忘れを軽減している。
論文 参考訳(メタデータ) (2026-05-20T03:03:04Z) - Pruned Adaptation Modules: A Simple yet Strong Baseline for Continual Foundation Models [9.273551382858525]
Pruned Adaptation Modules (PAM)は、トレーニング済みのResNetの大部分を凍結する、シンプルだが効果的な方法である。
PAMは相変わらず壊滅的な忘れ込みを軽減し、最先端のFMベースのCILアプローチより優れています。
論文 参考訳(メタデータ) (2026-03-22T11:15:34Z) - Efficient and Stable Reinforcement Learning for Diffusion Language Models [59.75789436018925]
拡散型大規模言語モデル(dLLM)の複雑な推論能力を解き放つには強化学習(RL)が不可欠である
dLLMの適用は、効率と安定性において、ユニークな課題に直面します。
本稿では,dLLMに対するRLの効率性と安定性を同時に向上するフレームワークであるスポース・テンポラル・プルーニング(STP)を提案する。
論文 参考訳(メタデータ) (2026-02-09T17:04:23Z) - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards [61.52322047892064]
テスト時間スケーリング(TTS)は、Large Reasoning Models(LRM)の機能を大幅に強化した。
我々は, LRM が推論過程において最終回答を得た後も, 再検討なしに反復的自己検証を頻繁に行うことを観察した。
本稿では,Anchor-based Process Reward (APR)を提案する。
論文 参考訳(メタデータ) (2026-01-31T14:53:20Z) - Beyond the Next Port: A Multi-Task Transformer for Forecasting Future Voyage Segment Durations [3.9443085703523706]
本研究は,将来のETA予測をセグメントレベルの時系列予測問題として再検討する。
本研究では, 過去の航行時間, 目的地港の混雑, および静的容器記述子を統合するトランスフォーマーアーキテクチャを開発した。
提案フレームワークは,長期の時間的依存を捕捉するための因果的にマスキングされた注意機構と,セグメントセーリング時間とポート混雑状態を共同で予測するマルチタスク学習ヘッドを用いる。
論文 参考訳(メタデータ) (2026-01-12T21:32:05Z) - Compute-Accuracy Pareto Frontiers for Open-Source Reasoning Large Language Models [0.0]
大規模言語モデル(LLM)は複雑な推論ベンチマークで急速に改善されている。
産業アプリケーションの場合、モデルの選択は生の精度だけでなく、リソースの制約や推論コストにも依存する。
論文 参考訳(メタデータ) (2025-12-31T10:51:32Z) - GateTS: Versatile and Efficient Forecasting via Attention-Inspired routed Mixture-of-Experts [0.0]
本稿では,一変量時系列予測のためのトレーニングプロセスを単純化するモデルアーキテクチャを提案する。
提案手法は,従来の1層ソフトマックスルータに取って代わる,スパークスMoE計算と,アテンションにインスパイアされた新しいゲーティング機構を組み合わせたものである。
論文 参考訳(メタデータ) (2025-08-24T20:39:50Z) - WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training [64.0932926819307]
本稿では,学習速度減衰とモデルマージの正式な関係を確立するフレームワークであるWarmup-Stable and Merge(WSM)を紹介する。
WSMは様々な崩壊戦略をエミュレートするための統一された理論基盤を提供する。
私たちのフレームワークは、複数のベンチマークで広く採用されているWarmup-Stable-Decay(WSD)アプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-07-23T16:02:06Z) - FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximation [55.12070409045766]
ポストトレーニング量子化(PTQ)は近年,費用対効果と有望なモデル圧縮パラダイムとして注目されている。
ビジョン変換器(ViT)の現在のPTQ法は、特に低ビット量子化において、精度が著しく低下している。
論文 参考訳(メタデータ) (2025-06-13T07:57:38Z) - PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches [34.65386386598757]
PortLLMはトレーニング不要のフレームワークで、ドメイン固有の知識をキャプチャするための、最初の軽量モデル更新パッチを作成する。
PortLLMは、最大12.2倍のGPUメモリ使用率でLoRAファインチューニングに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-10-08T13:41:08Z) - Pareto Low-Rank Adapters: Efficient Multi-Task Learning with Preferences [49.14535254003683]
本稿では,機械学習におけるマルチタスクトレードオフに対処するパラメータ効率の高い新しい手法PaLoRAを紹介する。
実験の結果、PaLoRAは様々なデータセットで最先端のMTLとPFLのベースラインを上回っていることがわかった。
論文 参考訳(メタデータ) (2024-07-10T21:25:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。