Fugu-MT 論文翻訳(概要): In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads

論文の概要: In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads

arxiv url: http://arxiv.org/abs/2604.06356v1
Date: Tue, 07 Apr 2026 18:35:47 GMT
ステータス: 翻訳完了
システム内更新日: 2026-04-09 17:30:51.183802
Title: In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads
Title（参考訳）: 言語モデルにおけるインテクスト学習:音響特徴,言語構造,誘導頭部の役割の分析
Authors: Charlotte Pouw, Hosein Mohebbi, Afra Alishahi, Willem Zuidema,
Abstract要約: In-Context Learning (ICL) はテキストのみの言語モデルで広く研究されている。言語モデルにおける言語的特徴と音響的特徴がICLに与える影響について検討する。
参考スコア（独自算出の注目度）: 3.6248657646376716
License: http://creativecommons.org/licenses/by/4.0/
Abstract: In-Context Learning (ICL) has been extensively studied in text-only Language Models, but remains largely unexplored in the speech domain. Here, we investigate how linguistic and acoustic features affect ICL in Speech Language Models. We focus on the Text-to-Speech (TTS) task, which allows us to analyze ICL from two angles: (1) how accurately the model infers the task from the demonstrations (i.e., generating the correct spoken content), and (2) to what extent the model mimics the acoustic characteristics of the demonstration speech in its output. We find that speaking rate strongly affects ICL performance and is also mimicked in the output, whereas pitch range and intensity have little impact on performance and are not consistently reproduced. Finally, we investigate the role of induction heads in speech-based ICL and show that these heads play a causal role: ablating the top-k induction heads completely removes the model's ICL ability, mirroring findings from text-based ICL.
Abstract（参考訳）: In-Context Learning (ICL) はテキストのみの言語モデルで広く研究されてきたが、音声領域ではほとんど研究されていない。本稿では,言語モデルにおける言語的特徴と音響的特徴がICLに与える影響について検討する。本研究は,(1) モデルが実演音声からどの程度正確にタスクを推測するか,(2) モデルが実演音声の音響特性をどの程度模倣するか,という2つの角度からICLを解析できるTTSタスクに着目した。発話速度はICLの性能に強く影響し,出力に模倣されるのに対して,ピッチ範囲と強度は性能にほとんど影響を与えず,連続的に再生されない。最後に、音声ベースのICLにおける誘導頭部の役割について検討し、これらの頭部が因果的役割を担っていることを示す。

関連論文リスト

TICL+: A Case Study On Speech In-Context Learning for Children's Speech Recognition [27.013776992438086]
音声基礎モデルは、音声インテクスト学習(SICL)を通してこれらの課題に対処できる我々は,既存の検索手法であるテキスト埋め込みKNN for SICL (TICL)を拡張し,TICL+を作成する音響再構成ステップを導入する。 4人の子どもの音声コーパスの実験では、TICL+はゼロショット性能よりも53.3%の単語誤り率の低下を達成している。
論文参考訳（メタデータ） (2025-12-20T08:03:07Z)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction [88.41471266579333]
本稿では,大規模言語モデル(LLM)からの言語知識をAV-TSEモデルに組み込む新しいフレームワークであるELEGANCEを提案する。 2つのAV-TSEバックボーン上でのRoBERTa、Qwen3-0.6B、Qwen3-4Bによる総合的な実験は大幅に改善された。
論文参考訳（メタデータ） (2025-11-09T08:50:11Z)
TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models [27.013776992438086]
SICL(TICL)のためのテキスト埋め込みKNNを提案する。提案手法により, 最大84.7%のWER削減率でゼロショット性能を超えることができる。
論文参考訳（メタデータ） (2025-09-16T17:07:23Z)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data [84.01401439030265]
最近のエンドツーエンド言語モデル(SLM)は、大規模言語モデル(LLM)の機能に拡張されている。音声とテキストのペアデータを生成するための,シンプルで効果的な自動処理手法を提案する。本モデルでは,音声教育データを必要としない音声関連タスクの汎用性を示す。
論文参考訳（メタデータ） (2024-09-30T07:01:21Z)
The Interpreter Understands Your Meaning: End-to-end Spoken Language Understanding Aided by Speech Translation [13.352795145385645]
音声翻訳(ST)は、エンドツーエンドの音声言語理解のために、音声モデルを事前訓練する良い方法である。我々は,本モデルが単言語および多言語意図分類に基づくベースラインよりも高い性能を達成することを示す。また、音声要約のための新しいベンチマークデータセットを作成し、低リソース/ゼロショットを英語からフランス語またはスペイン語に転送する。
論文参考訳（メタデータ） (2023-05-16T17:53:03Z)
M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for Multilingual Speech to Image Retrieval [56.49878599920353]
本研究は,多言語画像音声検索におけるCLIPとHuBERTの大規模,英語のみの事前学習モデル(CLIPとHuBERT)の利用について検討する。非英語画像音声検索では、各言語毎に個別のモデルを訓練する場合と、3言語すべてで音声を処理する1つのモデルの両方において、最先端のパフォーマンスを幅広いマージンで上回ります。
論文参考訳（メタデータ） (2022-11-02T14:54:45Z)
Towards Language Modelling in the Speech Domain Using Sub-word Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文参考訳（メタデータ） (2021-10-31T22:48:30Z)
SPLAT: Speech-Language Joint Pre-Training for Spoken Language Understanding [61.02342238771685]
音声理解には、入力音響信号を解析してその言語内容を理解し、予測するモデルが必要である。大規模無注釈音声やテキストからリッチな表現を学習するために,様々な事前学習手法が提案されている。音声と言語モジュールを協調的に事前学習するための,新しい半教師付き学習フレームワークであるSPLATを提案する。
論文参考訳（メタデータ） (2020-10-05T19:29:49Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。