論文の概要: AnySimLite: A Lightweight Few-Shot Similarity Encoder for On-Device Speech-Adjacent Classification
- arxiv url: http://arxiv.org/abs/2606.26452v1
- Date: Wed, 24 Jun 2026 23:25:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.110958
- Title: AnySimLite: A Lightweight Few-Shot Similarity Encoder for On-Device Speech-Adjacent Classification
- Title(参考訳): AnySimLite:オンデバイス音声隣接分類のための軽量Few-Shot類似エンコーダ
- Abstract要約: 我々は、AnySimLiteが、数ショット設定で、常に最先端(SOTA)またはSOTA競合性能を達成可能であることを示す。
最悪の場合であっても、パフォーマンス低下は7%以下であり、SOTA qLLaMA_LoRA-7Bベースラインのモデルサイズの$frac1250mathrmth$を使用する。
- 参考スコア(独自算出の注目度): 2.5057127311354885
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: To minimize privacy concerns and inference latency on edge devices like smartphones, lightweight on-device models remain important for end-user applications. Many of these applications involve natural language classification, but deploying multiple specialized models creates a memory footprint challenge. We investigate: Can a single lightweight architecture solve multiple Speech-Adjacent (SA) classification tasks through reduction to a nuanced text similarity formulation? We propose AnySimLite, a lightweight similarity encoder that combines word-level and character-level channels. Together with a dataset transformation strategy, we evaluate AnySimLite across multiple SA classification tasks and show that it consistently achieves state-of-the-art (SOTA) or SOTA-competitive performance in few-shot settings while maintaining a low memory footprint. Even in the worst case, the performance drop remains below 7% while using $<\frac{1}{250}^{\mathrm{th}}$ of the model size of the SOTA qLLaMA_LoRA-7B baseline.
- Abstract(参考訳): スマートフォンのようなエッジデバイスにおけるプライバシの懸念と推論のレイテンシを最小限に抑えるために、軽量なオンデバイスモデルはエンドユーザーアプリケーションにとって重要である。
これらのアプリケーションの多くは自然言語の分類を含むが、複数の特殊なモデルをデプロイすることはメモリフットプリントに挑戦する。
一つの軽量なアーキテクチャは、ニュアンス付きテキスト類似性の定式化に還元することで、複数の音声隣接(SA)分類タスクを解くことができるか?
本稿では,単語レベルと文字レベルを組み合わせた軽量な類似エンコーダであるAnySimLiteを提案する。
データセット変換戦略とともに、複数のSA分類タスクにまたがるAnySimLiteを評価し、低メモリフットプリントを維持しながら、数ショット設定で、最先端(SOTA)またはSOTA競合性能を一貫して達成していることを示す。
最悪の場合であっても、パフォーマンスの低下は7%以下であり、SOTA qLLaMA_LoRA-7Bベースラインのモデルサイズの$<\frac{1}{250}^{\mathrm{th}}$を使用する。
関連論文リスト
- Speech Emotion Recognition using Attention-based LSTM-Network with Residual Connection [0.0]
音声の感情認識は、現代の人間とコンピュータのインタラクションシステムにおいて重要な要素である。
本稿では,残差接続をソフトアテンションと統合した軽量アーキテクチャであるResLSTM-SAを提案する。
最高の性能を持つ変種(ResLSTM-SA-h64)は最大で0.6517のUARを達成し、46.8kの訓練可能なパラメータしか持たない。
論文 参考訳(メタデータ) (2026-06-02T09:08:59Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks [96.60530830276281]
RuleSafeは、スケーラブルなLLM支援シミュレーションフレームワーク上に構築された、新しいオペレーティングベンチマークである。
VQ-Memoryはベクトル量子化変分オートエンコーダを用いたコンパクトで構造化された時間表現である。
論文 参考訳(メタデータ) (2026-03-10T11:13:54Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions [5.67477841586604]
textbfAeroLiteは、リモートセンシング画像のためのタグ付きキャプションフレームワークである。
textbfAeroLiteはGPT-4oを利用して、大規模で意味的にリッチな擬似カプセルデータセットを生成する。
本稿では,視覚的埋め込みにセマンティックタグをアライメントする,新しい多層パーセプトロン(MLP)アーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-04-13T11:29:31Z) - Efficient Multi-Instance Generation with Janus-Pro-Dirven Prompt Parsing [53.295515505026096]
Janus-Pro-driven Prompt Parsingは、テキスト理解とレイアウト生成をブリッジするプロンプト解析モジュールである。
MIGLoRAはパラメータ効率の良いプラグインで、低ランク適応を UNet (SD1.5) と DiT (SD3) のバックボーンに統合する。
提案手法はパラメータ効率を維持しつつCOCOおよびLVISベンチマークの最先端性能を実現する。
論文 参考訳(メタデータ) (2025-03-27T00:59:14Z) - AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language [3.7440657375085986]
この研究は、低リソースのアサメ言語における画像キャプションのための計算効率の良いモデルであるAC-Liteを提示する。
ShuffleNetv2x1.5とGRUベースの言語デコーダの組み合わせと双線形アテンションは、最小限の計算で最高のパフォーマンスを提供する。
AC-Liteは2.45 GFLOPと22.87Mパラメータを持つCOCO-ACデータセットで82.3 CIDErスコアを達成した。
論文 参考訳(メタデータ) (2025-03-03T12:07:52Z) - Cross-Speaker Encoding Network for Multi-Talker Speech Recognition [74.97576062152709]
Cross-MixSpeaker
ネットワークは、話者間の表現を集約することでSIMOモデルの制限に対処する。
ネットワークはSOTと統合され、SIMOとSISOの両方の利点を利用する。
論文 参考訳(メタデータ) (2024-01-08T16:37:45Z) - Application-Agnostic Language Modeling for On-Device ASR [6.03523493247947]
オンデバイス自動音声認識システムは,サーバベースシステムと比較していくつかの課題に直面している。
スピード、ディスクサイズ、メモリに関して、より厳格な制約を満たす必要がある。
我々の新しいアプローチの1つは、元のモデルの速度と精度を維持しながら、ディスクサイズを半分に減らします。
論文 参考訳(メタデータ) (2023-05-16T19:31:18Z) - LACoS-BLOOM: Low-rank Adaptation with Contrastive objective on 8 bits
Siamese-BLOOM [2.9327503320877457]
意味的に意味のある単語の埋め込みを生成するために最適化された多言語大言語モデルである8ビットのSiamese-BLOOMを提案する。
文類似度分類のために,スケーラブルアダプタ(LoRA)と8ビットAdamでBLOOMを微調整する。
実験の結果,LACoS-BLOOMからの学習した埋め込みの質は,モデルパラメータの数とラベルなしトレーニングデータの量に比例することがわかった。
論文 参考訳(メタデータ) (2023-05-10T18:26:42Z) - LiteTransformerSearch: Training-free On-device Search for Efficient
Autoregressive Language Models [34.673688610935876]
モデルトレーニングを必要とせずに、レイテンシとパープレクシリティが最前線に現れることを示す。
我々は,多種多様なデバイス上での軽量トランスフォーマーサーチ (LTS) の評価を行った。
最大2倍のレイテンシでTransformer-XLのパープレキシティを実現することができることを示す。
論文 参考訳(メタデータ) (2022-03-04T02:10:43Z) - LightSpeech: Lightweight and Fast Text to Speech with Neural
Architecture Search [127.56834100382878]
我々は、FastSpeechに基づくより軽量で効率的なTSモデルを自動的に設計するLightSpeechを提案する。
実験の結果,提案手法により検出されたモデルは,CPU上での15倍のモデル圧縮比と6.5倍の推論高速化を実現していることがわかった。
論文 参考訳(メタデータ) (2021-02-08T07:45:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。