論文の概要: HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models
- arxiv url: http://arxiv.org/abs/2608.04351v1
- Date: Wed, 05 Aug 2026 01:50:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.687075
- Title: HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models
- Title(参考訳): HyPASE:大規模音声言語モデルのためのパラメータ効率の良い音声感情微調整のための双曲幾何学
- Authors: Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng,
- Abstract要約: HyPASEは、LALMベースの音声感情認識のための多言語PEFTフレームワークである。
双曲幾何学の適応過程を基礎にすることで、HyPASEはLALM微調整のための非常に効率的な経路を提供する。
- 参考スコア(独自算出の注目度): 12.550945552236632
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Audio-Language Models (LALMs) excel at general speech understanding; however, adapting them to fine-grained tasks like Speech Emotion Recognition (SER) remains a significant bottleneck. Current Parameter-Efficient Fine-Tuning (PEFT) methods typically operate in flat Euclidean space, and this geometry fails to capture the multi-granularity nature of emotion cues, which range from low-level prosody to high-level semantics. To address this, we propose HyPASE, a hyperbolic PEFT framework for LALM-based SER. HyPASE leverages the Poincare ball model, using the hyperbolic radius as an explicit proxy for representational granularity. The framework consists of two core components: a Hyperbolic Geometric Adapter (HGA) for layer-adaptive weight modulation, and an Emotion-aware Multi-capacity Cross-modal Aggregator (EMCA) that compresses multi-scale features into compact audio prefixes. Empirical results on standard benchmarks show that HyPASE outperforms Euclidean PEFT baselines across all metrics on MELD and achieves a notable Unweighted Accuracy gain on IEMOCAP, particularly in class-imbalanced emotion recognition, with the accompanying slight Weighted Accuracy trade-off reflecting hyperbolic space's geometric prioritization of minority-class representations; furthermore, HyPASE achieves robust zero-shot cross-dataset generalization within a constrained parameter budget. By grounding the adaptation process in hyperbolic geometry, HyPASE offers a highly efficient path for LALM fine-tuning.
- Abstract(参考訳): LALM(Large Audio-Language Models)は、一般的な音声理解において優れているが、音声感情認識(SER)のようなきめ細かいタスクにそれらを適用することは、依然として大きなボトルネックとなっている。
現在のパラメータ効率の良いファインチューニング(PEFT)法は一般に平坦なユークリッド空間で動作し、この幾何学は低レベルの韻律から高レベルの意味論まで、感情キューの多粒性の性質を捉えることに失敗する。
そこで我々は,LALMベースのSERのためのハイパーボリックPEFTフレームワークHyPASEを提案する。
HyPASEは、双曲半径を表現の粒度の明示的なプロキシとして用いて、ポインケア・ボールモデルを利用している。
このフレームワークは2つのコアコンポーネントで構成されており、階層適応重み変調のためのHGA(Hyperbolic Geometric Adapter)と、マルチスケール機能をコンパクトなオーディオプレフィックスに圧縮するEMCA(Emotion-aware Multi-capacity Cross-modal Aggregator)で構成されている。
標準ベンチマークにおける実証的な結果から、HyPASEはMELD上のすべての指標においてユークリッドPEFTベースラインより優れており、特にクラス不均衡な感情認識においてIEMOCAPに対して顕著な未重み付き精度の向上を達成している。
双曲幾何学の適応過程を基礎にすることで、HyPASEはLALM微調整のための非常に効率的な経路を提供する。
関連論文リスト
- Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation [14.492779733437082]
Referring Remote Sensing Imageは、リモートセンシングイメージで自然言語表現によって指定された対象または領域をローカライズし、セグメンテーションする。
既存のRRSISモデルは大規模な基礎モデルの恩恵を受けているが、それらは主に完全な微調整に依存している。
本稿では,効率的なクロスモーダルアライメントのためのセマンティック・スケールと空間選択という新しい枠組みを提案する。
論文 参考訳(メタデータ) (2026-06-29T12:54:10Z) - HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion [19.942149487828946]
HyperDiTはHyper-Connected Cross-Scale Interactionsを確立する統一フレームワークである。
細粒度ストリームとセマンティックガイダンスを組み合わせることで、HyperDiTは高忠実度画素生成に優れたパラダイムを提供する。
論文 参考訳(メタデータ) (2026-05-15T08:51:55Z) - Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts [20.82313207866023]
複数の幾何学空間を同時に利用して曲率認識表現を学習する統合フレームワークを提案する。
ヘテロジニアスな幾何学的専門家とローランド適応(LoRA)を拡張したMoSLoRAを開発した。
多様なベンチマークによる実験は、MoSLoRAが強いベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-02-16T06:07:32Z) - HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment [84.65251073657883]
双曲的エンターメント幾何に基づく適応型テキスト・画像アライメントアライメントアセスメントフレームワークHyperAlignを提案する。
まず、CLIPを用いてユークリッド特徴を抽出し、双曲空間にマッピングする。
第二に、離散エンターメント論理を連続的な幾何学的構造管理に変換する動的スーパービジョンエンターメントモデリング機構を設計する。
第3に,双曲幾何学的特徴を利用してサンプルレベルの変調パラメータを生成する適応変調回帰器を提案する。
論文 参考訳(メタデータ) (2026-01-08T05:41:06Z) - HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models [50.31704374968706]
マルチモーダルな大言語モデル(MLLM)は、視覚的およびテキスト的理解を整合させるための変換的アプローチとして登場した。
それらは通常、多粒度レベルでのクロスモーダルアライメントを達成するために、訓練のために非常に高い計算資源を必要とする。
この非効率性の重要な源は、CLIPやSAMなど、広く採用されている視覚エンコーダであり、多粒度レベルでの言語との整合性が欠如している。
論文 参考訳(メタデータ) (2025-10-23T08:16:44Z) - HELM: Hyperbolic Large Language Models via Mixture-of-Curvature Experts [29.365614317331932]
我々はHypErbolic Large Language ModelsのファミリーであるHELMを紹介する。
HELM-MICEでは,双曲型マルチヘッド潜在注意法を開発した。
両方のモデルに対して、回転位置符号化と RMS 正規化の本質的な双曲的等価性を開発する。
論文 参考訳(メタデータ) (2025-05-30T15:42:42Z) - Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation [10.502680141980642]
オープンボキャブラリセマンティックセグメンテーションは、画像中の各ピクセルに任意のテキスト記述をラベル付けしようとする。
視覚言語基盤モデル、特にCLIPは、オープン語彙能力を取得するための強力なツールとして登場した。
H-CLIPは、CLIPの総パラメータの約4%を更新するだけで、新しいSOTAオープン語彙セマンティックセマンティックセマンティクス結果を達成する。
論文 参考訳(メタデータ) (2024-05-29T07:41:34Z) - HRCF: Enhancing Collaborative Filtering via Hyperbolic Geometric
Regularization [52.369435664689995]
HRCF (textitHyperbolic Regularization powered Collaborative Filtering) を導入し,幾何認識型双曲正規化器を設計する。
具体的には、ルートアライメントとオリジン認識ペナルティによる最適化手順を強化する。
提案手法は,双曲的凝集による過度な平滑化問題に対処でき,モデルの識別能力も向上する。
論文 参考訳(メタデータ) (2022-04-18T06:11:44Z) - Efficient Semantic Image Synthesis via Class-Adaptive Normalization [116.63715955932174]
クラス適応正規化(CLADE)は、セマンティッククラスにのみ適応する軽量かつ等価なバリアントである。
セマンティクスレイアウトから計算したクラス内位置マップエンコーディングを導入し,cladeの正規化パラメータを変調する。
提案されたCLADEは異なるSPADEベースのメソッドに一般化し、SPADEと比較して同等の生成品質を達成できる。
論文 参考訳(メタデータ) (2020-12-08T18:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。