論文の概要: Micro Language Models Enable Instant Responses
- arxiv url: http://arxiv.org/abs/2604.19642v1
- Date: Tue, 21 Apr 2026 16:31:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.870989
- Title: Micro Language Models Enable Instant Responses
- Title(参考訳): インスタントレスポンスを可能にするマイクロ言語モデル
- Authors: Wen Cheng, Tuochao Chen, Karim Helwani, Sriram Srinivasan, Luke Zettlemoyer, Shyamnath Gollakota,
- Abstract要約: スマートウォッチやスマートグラスのようなエッジデバイスは、電力と計算の制約により、最小の100M-1Bパラメータ言語モデルでさえ連続的に動作できない。
マイクロ言語モデル($LMs)を導入し、デバイス上でコンテキスト的にグラウンドされた応答の最初の4-8ワードを即座に生成する。
我々は,70M-256Mクラスの既存モデルに適合するモデルを用いて,有用な言語生成を極端に大規模に維持することを示す。
- 参考スコア(独自算出の注目度): 49.192613030724424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Edge devices such as smartwatches and smart glasses cannot continuously run even the smallest 100M-1B parameter language models due to power and compute constraints, yet cloud inference introduces multi-second latencies that break the illusion of a responsive assistant. We introduce micro language models ($μ$LMs): ultra-compact models (8M-30M parameters) that instantly generate the first 4-8 words of a contextually grounded response on-device, while a cloud model completes it; thus, masking the cloud latency. We show that useful language generation survives at this extreme scale with our models matching several 70M-256M-class existing models. We design a collaborative generation framework that reframes the cloud model as a continuator rather than a respondent, achieving seamless mid-sentence handoffs and structured graceful recovery via three error correction methods when the local opener goes wrong. Empirical results show that $μ$LMs can initiate responses that larger models complete seamlessly, demonstrating that orders-of-magnitude asymmetric collaboration is achievable and unlocking responsive AI for extremely resource-constrained devices. The model checkpoint and demo are available at https://github.com/Sensente/micro_language_model_swen_project.
- Abstract(参考訳): スマートウォッチやスマートグラスのようなエッジデバイスは、電力と計算の制約により、最小の100M-1Bパラメータ言語モデルでさえ連続的に動作できないが、クラウド推論は応答性アシスタントの錯覚を破るマルチ秒レイテンシーを導入する。
マイクロ言語モデル (μ$LMs): 超コンパクトモデル (8M-30Mパラメータ) を導入し、デバイス上でコンテキスト的に接地された応答の最初の4-8ワードを即座に生成し、クラウドモデルはそれを完了し、クラウド遅延を隠蔽する。
我々は,70M-256Mクラスの既存モデルに適合するモデルを用いて,有用な言語生成を極端に大規模に維持することを示す。
我々は,クラウドモデルを応答ではなく継続子として再編成する協調生成フレームワークを設計し,ローカルオープナーの故障時に3つのエラー補正手法を用いてシームレスな中文ハンドオフと構造化された優雅な回復を実現する。
実証的な結果から、$μ$LMsは、大きなモデルがシームレスに完了した応答を起動し、高次非対称なコラボレーションが達成可能であり、非常にリソースに制約のあるデバイスに対して応答性AIをアンロックできることが示されている。
モデルチェックポイントとデモはhttps://github.com/Sensente/micro_language_model_swen_projectで公開されている。
関連論文リスト
- ConvFill: Model Collaboration for Responsive Conversational Voice Agents [6.166061057506208]
本稿では,パワフルなバックエンドモデルからストリーミング知識をシームレスに取り入れつつ,軽量なオンデバイスモデルがコンテキスト的に適切な対話を生成するタスクである対話型インフィルを提案する。
合成多領域会話に基づく360MパラメータモデルであるConvFillを提案する。
ConvFillは,200ms以下の応答待ち時間を維持しつつ,同一サイズのスタンドアロンの小型モデルに対して36~42%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-11-10T18:50:30Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - Token Level Routing Inference System for Edge Devices [21.721914273034972]
本稿では,クラウドベースの大規模モデルから重要なトークン生成を選択的に参照しながら,小型モデルでデバイス上での推論を可能にする,新しい協調型復号推論システムを提案する。
注目すべきは、M1 MacBook上で0.5Bモデルのみを使用してCommonsenseQAのパフォーマンスを60%向上させ、クラウドの大規模モデルにアップロードされるトークン生成の7%以下であることだ。
論文 参考訳(メタデータ) (2025-04-10T15:54:19Z) - Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines [74.42485647685272]
GMLM(Generative Masked Language Models)に焦点を当てる。
我々は,マルコフ連鎖の入力として使用されるマスキングにより,データ分布の条件付き確率に適合するモデルを訓練し,モデルからサンプルを抽出する。
我々は,T5モデルを並列デコーディングに適応させ,最小品質の犠牲を伴って機械翻訳における2~3倍の高速化を実現した。
論文 参考訳(メタデータ) (2024-07-22T18:00:00Z) - Knowledge boosting during low-latency inference [20.617827647115874]
低レイテンシのストリーミングアプリケーションは、より大きなモデルの知識能力の恩恵を受けることができるが、エッジデバイスはリソース制約のためにこれらのモデルを実行できない。
提案手法は,大規模モデルを推論中に時間遅延入力で動作させながら,小型モデルの性能を向上する新しい手法であるナレッジ・ブーイングを提案する。
その結果,小型モデルと大規模モデルのパフォーマンスギャップが大きくなり,低レイテンシアプリケーションにおける大規模モデルコラボレーションに有望な方法が示された。
論文 参考訳(メタデータ) (2024-07-09T22:04:23Z) - MatFormer: Nested Transformer for Elastic Inference [91.45687988953435]
MatFormerは、多様なデプロイメント制約にまたがる弾性推論を提供するように設計された、新しいTransformerアーキテクチャである。
MatFormerは、標準的なTransformerモデルにネストフィードフォワードネットワーク(FFN)ブロック構造を組み込むことで、これを実現している。
8億5000万デコーダのみのMatFormer言語モデル(MatLM)により,5億2200万から8億5千万のパラメータにまたがる複数の小さなモデルを抽出できることを示す。
論文 参考訳(メタデータ) (2023-10-11T17:57:14Z) - Zemi: Learning Zero-Shot Semi-Parametric Language Models from Multiple
Tasks [77.90900650816046]
ゼロショットセミパラメトリック言語モデルである$textZemi$を紹介します。
私たちは、新しいセミパラメトリックマルチタスクによるトレーニングパラダイムで、textZemi$をトレーニングします。
具体的には、大規模タスクに依存しない未ラベルコーパスからの検索により、マルチタスクトレーニングとゼロショット評価を強化する。
論文 参考訳(メタデータ) (2022-10-01T04:08:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。