論文の概要: LoRA-generating hypernetworks for efficient on-device LLM generative personalization
- arxiv url: http://arxiv.org/abs/2609.24979v1
- Date: Mon, 21 Sep 2026 17:55:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.456728
- Title: LoRA-generating hypernetworks for efficient on-device LLM generative personalization
- Title(参考訳): デバイス上での効率的なLLM生成パーソナライズのためのLORA生成ハイパーネット
- Abstract要約: 本稿では,デバイス上の大規模言語モデル(LLM)をパーソナライズするための新しい手法を提案する。
ハイパーネットワークをトレーニングして、ユーザのコンテキストトークンを、そのユーザに適したローランク適応(LoRA')にマッピングする。
トレーニングされた共通アーティファクトがユーザのデバイスにデプロイされると、各ユーザはハイパーネットワークを使用してパーソナライズされたLoRAを合成する。
- 参考スコア(独自算出の注目度): 7.839385278616725
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-device large language models (`LLMs'), e.g. running on mobile phones, are ripe for improvement via personalization. The limited compute resources of mobile devices impose limits on model scale and thus model quality, making any realizable quality gains highly impactful. At the same time, their personal nature (i.e., the close coupling to a particular user) means that a given on-device LLM tends to be used in similar, predictable patterns over the course of time. This paper presents a novel method for personalizing on-device LLMs. It trains a hypernetwork to map a user's context tokens to a low-rank adaptation (`LoRA') well-suited to that user. Once the trained common artifacts are deployed to users' devices, each user uses the hypernetwork to synthesize (entirely on device) a personalized LoRA. This approach blends the benefits while avoiding the drawbacks of two existing approaches to LLM customization: in-context learning (`ICL') and parameter-efficient fine-tuning (`PEFT'). Like ICL (and unlike PEFT), the on-device phase of our approach is computationally feasible, requiring only forward passes through neural networks. Like PEFT (and unlike ICL), our approach modifies the `target' base LLM via weights (the LoRA), avoiding negative consequences (e.g. increased latency) associated with extending the input sequence. Our approach is particularly well-suited to the mobile device regime. Apart from the on-device compute and latency benefits mentioned, it also requires minimal additional storage, as internally its architecture partly leverages the same LLM weights as belong to the target LLM to be personalized. We demonstrate the benefits of LoRA-generating hypernetworks on several representative personalization datasets, comparing against baselines like ICL and PEFT. Of note, our personalization experiments focus on more challenging and less studied long-form text generation tasks.
- Abstract(参考訳): 携帯電話で動作するオンデバイス大型言語モデル(`LLMs')は、パーソナライズによる改善のために熟成されている。
モバイルデバイスの限られた計算資源は、モデルスケールに制限を課し、したがってモデル品質を規定する。
同時に、それらの個人的性質(すなわち特定のユーザとの密結合)は、デバイス上のLCMが、時間とともに同様の予測可能なパターンで使用される傾向があることを意味する。
本稿では,デバイス上でのLCMをパーソナライズするための新しい手法を提案する。
ハイパーネットワークをトレーニングして、ユーザのコンテキストトークンを、そのユーザに適したローランク適応(`LoRA')にマッピングする。
トレーニングされた共通アーティファクトがユーザのデバイスにデプロイされると、各ユーザはハイパーネットワークを使用して、パーソナライズされたLoRAを(デバイス上で)合成する。
このアプローチは、LLMのカスタマイズに既存の2つのアプローチである「ICL」と「PEFT」の欠点を回避しつつ、利点をブレンドする。
ICL(およびPEFT)と同様に、私たちのアプローチのオンデバイスフェーズは計算可能であり、ニューラルネットワークを前方通過するだけでよい。
PEFT(およびICLと異なり)と同様に、我々のアプローチは、入力シーケンスの拡張に伴う負の結果(例えば遅延の増加)を避けるため、重み(LoRA)を介して 'target' ベース LLM を変更する。
当社のアプローチはモバイルデバイス体制に特に適しています。
上述したオンデバイスコンピューティングとレイテンシのメリットとは別に、内部アーキテクチャはパーソナライズするLLMに属するものと同じLLM重みを利用するため、最小限のストレージも必要である。
いくつかの代表的パーソナライゼーションデータセットに対して,LoRA生成ハイパーネットの利点を示し,ICLやPEFTといったベースラインと比較した。
なお、われわれのパーソナライズ実験は、より困難で研究の少ない長文テキスト生成タスクに焦点を当てている。
関連論文リスト
- One Model for All: Multi-Objective Controllable Language Models [65.4626816393381]
我々は、優先条件付きポリシーネットワークとして単一の言語モデルをトレーニングするために、MOC(Multi-Objective Control)を導入する。
提案手法では,マルチオブジェクト最適化(MOO)の原則をRLHFに導入し,LLMを優先条件付きポリシネットワークとしてトレーニングする。
大規模な実験は、3つの面において基線よりもMOCの利点を実証している。
論文 参考訳(メタデータ) (2026-04-06T07:48:32Z) - Floe: Federated Specialization for Real-Time LLM-SLM Inference [32.782914689403746]
Floeは、レイテンシに敏感でリソース制約のある環境向けに設計されたハイブリッドなフェデレーション学習フレームワークである。
個人データと微調整はオンデバイスのままであり、クラウドLLMはプロプライエタリな重みを公開せずに一般的な知識を提供する。
Floeはモデルパフォーマンスを大幅に改善し、リアルタイム制約下でエッジデバイスの推論遅延を低減する。
論文 参考訳(メタデータ) (2026-02-15T20:28:38Z) - CoSteer: Collaborative Decoding-Time Personalization via Local Delta Steering [80.54309860395763]
CoSteerは、ローカライズされたデルタステアリングを通じてデコード時のパーソナライズを可能にする、新しいコラボレーティブフレームワークである。
トークンレベルの最適化をオンライン学習問題として定式化し、ローカルデルタベクトルがリモートLLMのロジットを動的に調整する。
このアプローチは、生のデータや中間ベクトルではなく、最後のステアリングトークンのみを送信することで、プライバシを保護します。
論文 参考訳(メタデータ) (2025-07-07T08:32:29Z) - HSplitLoRA: A Heterogeneous Split Parameter-Efficient Fine-Tuning Framework for Large Language Models [30.345920952847752]
大規模言語モデル(LLM)は、自然言語処理領域などに革命をもたらし、目覚ましいブレークスルーを達成した。
膨大なパラメータサイズのため、様々な下流タスクのためのプライベートデータでこれらのモデルを微調整することが主流になっている。
本研究では,分割学習(SL)と低ランク適応(LoRA)に基づくフレームワークであるHSplitLoRAを提案する。
論文 参考訳(メタデータ) (2025-05-05T17:09:19Z) - PLM: Efficient Peripheral Language Models Hardware-Co-Designed for Ubiquitous Computing [48.30406812516552]
我々は、モデルアーキテクチャとエッジシステムの制約を協調的に最適化する共同設計プロセスを通じて開発された、周辺言語モデルであるPLMを紹介する。
PLMはMulti-head Latent Attentionメカニズムを採用し、正方形ReLUアクティベーション機能を採用してスパーシティを促進し、ピークメモリフットプリントを減少させる。
評価の結果, PLMは, 公開されているデータに基づいて訓練された既存の小言語モデルよりも優れていた。
論文 参考訳(メタデータ) (2025-03-15T15:11:17Z) - Activation Sparsity Opportunities for Compressing General Large Language Models [4.5624217435826]
この研究は、最先端AIモデルにおけるアクティベーション空間の強制とパープレキシティ(精度)のトレードオフを体系的に調査する。
実験により,重要なFFN成分に対する主記憶の約50%と計算量の削減を無視可能な精度劣化で達成できることが実証された。
論文 参考訳(メタデータ) (2024-12-13T02:26:54Z) - Crayon: Customized On-Device LLM via Instant Adapter Blending and Edge-Server Hybrid Inference [20.666893617591136]
オンデバイス LLM カスタマイズのための新しいアプローチである Crayon を提案する。
我々は,より要求の多いクエリや非カスタマイズタスクをサーバ上のより大きな,より有能なLDMに確実に割り当てるデバイスサーバハイブリッド推論戦略を開発する。
論文 参考訳(メタデータ) (2024-06-11T07:00:08Z) - AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration [54.692405042065815]
LLM低ビット量のみの量子化のためのハードウェアフレンドリーなアプローチであるActivation-Aware Weight Quantization (AWQ)を提案する。
AWQ は 1% の正重みしか保護せず,命令調整型 LM とマルチモーダル LM の量子化性能に優れる。
また,4ビットオンデバイスLLM/VLMに適した,効率的なフレキシブルな推論フレームワークであるTinyChatを実装した。
論文 参考訳(メタデータ) (2023-06-01T17:59:10Z) - Federated Split GANs [12.007429155505767]
ユーザデバイス自体でMLモデルをトレーニングするための代替手法を提案する。
我々は、GAN(ジェネレーティブ・逆境ネットワーク)に注目し、その固有のプライバシー保護属性を活用する。
我々のシステムはデータのプライバシを保ち、短時間のトレーニング時間を保ち、制約のないデバイスで同じ精度でモデルトレーニングを行う。
論文 参考訳(メタデータ) (2022-07-04T23:53:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。