論文の概要: LionVote: Per-Layer Learning Rate Adaptation for Lion
- arxiv url: http://arxiv.org/abs/2607.09266v1
- Date: Fri, 10 Jul 2026 10:30:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.820434
- Title: LionVote: Per-Layer Learning Rate Adaptation for Lion
- Title(参考訳): LionVote: Lionのラーニングレート適応
- Authors: Kris Atallah,
- Abstract要約: 階層ごとの診断では、所定の学習速度では、ライオンの有効スケールは2.6-2.8倍である。
ViT-Tiny/CIFAR-100では、LionVoteは69.0%の精度で69.7%の精度を達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Per-layer diagnostics reveal that, at the prescribed learning rate, Lion's effective scale is 2.6-2.8x too high for attention and MLP parameters and ~2x too high for normalization layers on ViT-Tiny/CIFAR-100; this 32% cross-layer-type disparity cannot be reproduced by a single global rate. The measurement comes from LionVote, a per-layer learning rate mechanism in which each parameter tensor maintains a compound level, a persistent integer updated every c epochs by two diagnostics (gradient direction stability and momentum health) resolved by a validation loss tiebreaker. Voting thresholds derive from geometric identities, the EMA time constant, and a noise-floor estimate; cadence is bounded structurally and selected by ablation. On ViT-Tiny/CIFAR-100, LionVote achieves 69.7% top-1 accuracy vs. Lion's 69.0% (p < 0.02, Welch's t-test) and AdamW's 68.8%. Per-layer adaptation value depends on both architectural heterogeneity and task; on uniform CNN architectures tuned SGD with cosine annealing remains dominant, and on ViT architectures gains are task-dependent.
- Abstract(参考訳): 階層ごとの診断では、Lionの有効スケールは2.6-2.8倍であり、注意とMLPパラメータは2.2倍であり、ViT-Tiny/CIFAR-100上の正規化層では2倍である。
この測定は、各パラメータテンソルが複合レベルを維持している層ごとの学習率メカニズムであるLionVoteから得られ、永続整数は、検証損失タイブレーカによって解決された2つの診断(段階的な方向安定性と運動量健康)によって、cエポック毎に更新される。
投票閾値は、幾何学的アイデンティティ、EMA時間定数、ノイズフロア推定から導かれる。
ViT-Tiny/CIFAR-100では、LionVoteの69.0%(p < 0.02, Welchのt-test)とAdamWの68.8%に対して69.7%の精度を達成した。
均一なCNNアーキテクチャでは、コサインアニールで調整されたSGDが支配的であり、ViTアーキテクチャでは、ゲインはタスクに依存している。
関連論文リスト
- Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers [0.0]
デプロイされた安全分類器における分散シフトのオンラインモニタリングシステムを提案する。
検出後、共形吸収層は、目標誤差を回復する決定に適応する。
このシステムは平均遅延39.5800ステップで86.6%の検知を実現している。
論文 参考訳(メタデータ) (2026-06-10T11:24:25Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Learning Rate Engineering: From Coarse Single Parameter to Layered Evolution [11.642796814179926]
我々は,(Gen1)グローバル固定学習率,(Gen2)グローバルスケジューリング,(Gen3)パラメータレベル適応,(Gen4)階層レベルの微分,(Gen5)ジョイントレイヤタイムスケジューリングの5世代に学習率スケジューリングを体系化する。
本稿では,位相適応コサインスケジューリング,深度対応Grokfastフィルタ,LARSスタイルの信頼率を1つのコヒーレント勾配に統合する統合フレームワークであるDALSを提案する。
我々は、合成、CIFAR-10(スクラッチから)、RTEの5世代にわたる3つのDALS変種を含む18の戦略をベンチマークした。
論文 参考訳(メタデータ) (2026-04-30T01:13:48Z) - A Neural Affinity Framework for Abstract Reasoning: Diagnosing the Compositional Gap in Transformer Architectures via Procedural Task Taxonomy [0.0]
ルールベースのコード分析によって97.5%の精度で検証された、全てのタスクの最初の9つのカテゴリの分類を提示する。
我々は、CNNを生のグリッドピクセルで訓練することにより、分類の視覚的コヒーレンスを証明する(S3の95.24%、全体的な36.25%、3.3倍の確率)。
カリキュラム分析の結果,トランスフォーマーに対する神経親和性が低いタスクの35.3%が明らかにされた。
論文 参考訳(メタデータ) (2025-12-08T02:46:00Z) - Urban 3D Change Detection Using LiDAR Sensor for HD Map Maintenance and Smart Mobility [26.712098856567888]
都市規模LiDARのための物体中心型不確実性認識パイプラインを提案する。
これはエポックを多分解能NDTと整列し、次に点対平面ICP、高さを正規化し、位置検出レベルを導出する。
15代表のスービアコでは95.2%の精度、90.4%のmF1、82.6%のmIoUがトリプルトKPConvを超える精度、0.2のmF1、0.8のmIoUがブロックされ、IoUが74.8%に達し、7.6ポイント改善された。
論文 参考訳(メタデータ) (2025-10-24T02:59:55Z) - AHDMIL: Asymmetric Hierarchical Distillation Multi-Instance Learning for Fast and Accurate Whole-Slide Image Classification [51.525891360380285]
AHDMILは非対称な階層的蒸留マルチインスタンス学習フレームワークである。
2段階のトレーニングプロセスを通じて、無関係なパッチを排除します。
分類性能と推論速度の両方において、従来の最先端手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-08-07T07:47:16Z) - End-to-End Implicit Neural Representations for Classification [57.55927378696826]
Inlicit Neural representations (INRs) は、ニューラルネットワークパラメータの信号を符号化し、信号再構成に優れた結果を示す。
INRをベースとした分類は、CNNのようなピクセルベースの手法に比べて、依然としてかなり低性能である。
本研究は,SIRENを学習段階のスキームとともに初期化するエンド・ツー・エンドの戦略を提案する。
論文 参考訳(メタデータ) (2025-03-23T16:02:23Z) - Thyroidiomics: An Automated Pipeline for Segmentation and Classification of Thyroid Pathologies from Scintigraphy Images [0.23960026858846614]
本研究の目的は,甲状腺シンチグラフィー画像を用いた甲状腺疾患分類を向上する自動パイプラインを開発することである。
2,643人の甲状腺シンチグラフィー画像を収集し,DG(diffuse goiter),MNG(multinodal goiter),甲状腺炎(TH)に分類した。
パイプラインは、さまざまなクラスにわたるいくつかの分類指標で、医師のセグメンテーションに匹敵するパフォーマンスを示した。
論文 参考訳(メタデータ) (2024-07-14T21:29:28Z) - Patch-Level Contrasting without Patch Correspondence for Accurate and
Dense Contrastive Representation Learning [79.43940012723539]
ADCLRは、正確で高密度な視覚表現を学習するための自己教師型学習フレームワークである。
提案手法は, コントラッシブな手法のための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2023-06-23T07:38:09Z) - End-to-end LSTM based estimation of volcano event epicenter localization [55.60116686945561]
火山イベントの局所化問題に対処するために, エンドツーエンドのLSTMスキームを提案する。
LSTMは、時間変化の信号のダイナミクスを捉えることができるため、選択された。
その結果、LSTMベースのアーキテクチャは成功率、すなわち1.0Km未満のエラーが48.5%に等しいことを示した。
論文 参考訳(メタデータ) (2021-10-27T17:11:33Z) - SOUL: An Energy-Efficient Unsupervised Online Learning Seizure Detection
Classifier [68.8204255655161]
神経活動を記録して発作を検出するインプラントデバイスは、発作を抑えるために警告を発したり神経刺激を誘発したりするために採用されている。
移植可能な発作検出システムでは、低出力で最先端のオンライン学習アルゴリズムを使用して、神経信号のドリフトに動的に適応することができる。
SOULはTSMCの28nmプロセスで0.1mm2を占め、1.5nJ/分級エネルギー効率を実現した。
論文 参考訳(メタデータ) (2021-10-01T23:01:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。