論文の概要: Steering Speech-Language Models: Training-Free Task Specialization via Contrastive Activation Addition
- arxiv url: http://arxiv.org/abs/2610.04683v1
- Date: Sat, 03 Oct 2026 17:53:30 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:53:52.636038
- Title: Steering Speech-Language Models: Training-Free Task Specialization via Contrastive Activation Addition
- Title(参考訳): ステアリング音声言語モデル:コントラストアクティベーション付加による訓練不要タスクスペシャライゼーション
- Abstract要約: 本稿では,一般的な音声タスクのためのステアリングベクトルを導出する,訓練不要なコントラストアクティベーション付加プロトコルを提案する。
表現空間にこれらのベクトルを推論時に付加することで、目的の音声課題をより効果的に実行できることが示される。
さらに、特定の言語のターゲットスクリプトを強制するためのスクリプト正規化指示の有用性を示す。
- 参考スコア(独自算出の注目度): 26.816392584458352
- License:
- Abstract: Activation steering has proven effective for controlling the behavior of Large Language Models (LLMs) at inference time, but its application to SpeechLLMs remains new, and training-free steering approaches for such models are still largely unexplored. We propose a training-free Contrastive Activation Addition (CAA) protocol that derives steering vectors for common speech tasks (e.g. transcription) in SpeechLLMs from a small number of labeled utterances. We showcase that adding these vectors in the representation space, at inference time, enforces better the targeted speech task. We further show that, when combined with prompting, these vectors yield to consistent improvement over prompting alone on most evaluated tasks such as Automatic Speech Recognition (ASR) or Emotion Recognition (ER), and transfer to out-of-domain data. We additionally demonstrate the usefulness of script-normalization directions to enforce the target script of a specific language.
- Abstract(参考訳): アクティベーションステアリングは大規模言語モデル(LLM)の動作を推論時に制御するのに有効であることが証明されているが、そのSpeechLLMへの応用は新しいままであり、そのようなモデルに対するトレーニングフリーステアリングアプローチはいまだに探索されていない。
本稿では,少数のラベル付き発話からSpeechLLMにおける共通音声タスク(例えば文字起こし)のステアリングベクトルを導出する,訓練不要なContrastive Activation Addition (CAA)プロトコルを提案する。
表現空間にこれらのベクトルを推論時に付加することで、目的の音声タスクをより効果的に行えることを示す。
さらに,これらのベクトルをプロンプトと組み合わせることで,ASR(Automatic Speech Recognition)やER(Emotion Recognition)といった最も評価の高いタスクにのみアクセスし,ドメイン外のデータに転送することで,一貫した改善が得られることを示す。
さらに、特定の言語のターゲットスクリプトを強制するためのスクリプト正規化指示の有用性を示す。
関連論文リスト
- Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering [36.07257282655538]
本稿では、明示的な命令ではなく、暗黙的なアクティベーションステアリングを通じてエージェントメモリを表現する訓練不要のフレームワークであるNeural Procedural Memory(NPM)を紹介する。
評価の結果,NPMは明示的なテキスト命令を用いて,ベースラインと同等に動作していることがわかった。
論文 参考訳(メタデータ) (2026-06-29T06:05:25Z) - BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs [84.59993864748195]
音声生成から命令理解を分離する「操作主義」に着想を得た新しいパラダイムを提案する。
本稿では,LLMが導体として機能するフレームワークであるBatonVoiceを紹介し,ユーザの指示を理解する。
別個のTSモデルである「オーケストラ」は、これらの特徴から音声を生成する。
論文 参考訳(メタデータ) (2025-09-30T16:52:14Z) - Self-Powered LLM Modality Expansion for Large Speech-Text Models [62.27700381806554]
大規模言語モデル(LLM)は、様々なタスクにまたがる顕著なパフォーマンスを示す。
本研究は,バニラ調律の限界に対処して,LSM訓練における音声データセットの利用を改良することを目的とする。
そこで本研究では,モデル自体が生成する拡張音声認識データを利用して,より効果的な命令チューニングを行う自己力 LSM を提案する。
論文 参考訳(メタデータ) (2024-10-04T04:34:24Z) - DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data [84.01401439030265]
最近のエンドツーエンド言語モデル(SLM)は、大規模言語モデル(LLM)の機能に拡張されている。
音声とテキストのペアデータを生成するための,シンプルで効果的な自動処理手法を提案する。
本モデルでは,音声教育データを必要としない音声関連タスクの汎用性を示す。
論文 参考訳(メタデータ) (2024-09-30T07:01:21Z) - SpeechPrompt: Prompting Speech Language Models for Speech Processing Tasks [94.10497337235083]
我々はまず,音声処理分野における音声 LM の促進の可能性を探る。
音声処理タスクを音声単位生成タスクに再構成する。
提案手法は, 強い微調整法と比較して, 競争性能を向上できることを示す。
論文 参考訳(メタデータ) (2024-08-23T13:00:10Z) - DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding [51.32965203977845]
本稿では,連続的な音声エンコーダ出力の代わりに離散音声単位(DSU)を用いることを提案する。
提案モデルでは, 未知領域からの音声入力に対する頑健な性能と, 音声質問応答における指示追従能力を示す。
この結果から,ASRタスクとデータセットは,音声質問応答タスクの指導訓練に必須ではないことが示唆された。
論文 参考訳(メタデータ) (2024-06-13T17:28:13Z) - Improving Activation Steering in Language Models with Mean-Centring [10.101141087916133]
目標データセットに関連付けられたアクティベーションの平均値と、トレーニングアクティベーションの平均値を減じることで、効果的なステアリングベクトルが得られることがわかった。
また、関数ベクトルを抽出するために平均セントリングを適用し、より効果的に自然言語タスクの実行を顕著なマージンでトリガーする。
論文 参考訳(メタデータ) (2023-12-06T18:27:07Z) - Instruction-Following Speech Recognition [21.591086644665197]
本稿では,命令追従音声認識を導入し,多様な自由形式のテキスト命令の理解と実行を行うリステン・アテンド・スペルモデルを訓練する。
注目すべきは、我々のモデルは、Librispeechでゼロから訓練され、大規模言語モデルや事前訓練された音声モジュールを必要とせずに、簡単な命令を解釈し、実行します。
論文 参考訳(メタデータ) (2023-09-18T14:59:10Z) - Steering Language Models With Activation Engineering [40.04138190785384]
アクティベーションエンジニアリングを導入し、モデル出力を制御(またはステア)するためにアクティベーションの推論時間を変更する。
LLaMA-3 や OPT などのモデルを用いて, 負対正の感情変化と解毒を行う。
ActAddは、ターゲット外のタスクのパフォーマンスを維持しながら、高レベルの出力特性(トピックや感情など)を推論時間で制御する。
論文 参考訳(メタデータ) (2023-08-20T12:21:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。