論文の概要: Structure Across Voices: Comparing acoustic-event type accumulation and sequence dependence across four vocal repertoires using frozen audio encoders
- arxiv url: http://arxiv.org/abs/2609.16612v1
- Date: Tue, 15 Sep 2026 04:19:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.339195
- Title: Structure Across Voices: Comparing acoustic-event type accumulation and sequence dependence across four vocal repertoires using frozen audio encoders
- Title(参考訳): 構造的アクロス音声:凍結型オーディオエンコーダを用いた4つの音声レパートリー間の音響イベント型蓄積とシーケンス依存性の比較
- Abstract要約: 私たちは、クジラのコダ、人間の音声電話、ベンガルのフィンチ音節、一般的なマーモセット通話を比較します。
クジラは最も速いタイプの蓄積を示し、フィンチは最も強い即時依存と繰り返し続く再発を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Vocal repertoires can differ in acoustic-event type accumulation and temporal organization, yet direct comparison is difficult because corpora use different native events and unequal amounts of sequence. We compare sperm whale codas, human speech phones, Bengalese finch syllables, and common marmoset calls using the same frozen-audio-encoder procedure while matching event count and local sequence opportunity. Whale shows the fastest type accumulation; Finch shows the strongest immediate dependence and repeated-subsequence recurrence. Physically interpretable acoustics recover complementary parts of this profile, continuous analyses without clustering support broad Whale acoustic coverage, and source- and position-preserving nulls retain both Finch order effects. Extending predictive context shifts the comparison toward Whale. Thus repertoire differences depend on the acoustic property and temporal scale measured rather than forming a single hierarchy.
- Abstract(参考訳): 声道レパートリーは, 音響イベント型蓄積と時間的構造の違いがあるが, コーパスは異なるネイティブイベントと不平等なシーケンスを使用するため, 直接比較は困難である。
我々は,クジラのコダ,ヒトの音声電話,ベンガルのフィンチ音節,および同じ凍結オーディオエンコーダを用いた一般的なマーモセット通話を,事象数と局所的なシーケンス機会に一致させながら比較した。
クジラは最も速いタイプの蓄積を示し、フィンチは最も強い即時依存と繰り返し続く再発を示す。
物理的に解釈可能な音響は、このプロファイルの相補的な部分を復元し、クラスタリングなしの連続解析はワイドホイル音響カバレッジをサポートし、ソース保存と位置保存のヌルはフィンチ順序効果の両方を保持する。
予測コンテキストの拡張は、比較をWhaleにシフトさせる。
したがって、レパートリーの違いは、単一の階層を形成するのではなく、測定された音響特性と時間スケールに依存する。
関連論文リスト
- Rhythm of the Deep: A Computational-Linguistic Test of Duality of Patterning in Sperm Whale Codas [0.0]
我々は,ドミニカ・スペルム捕鯨計画の1,483コダを用いて,クジラ捕鯨コダにおけるパターンの二重性について検討した。
音響的類似性は記号構造を模倣できるため,連続音声からの計算言語構造として扱う。
私たちは言語、意味論、知覚、あるいは人間のような音素を主張しません。
論文 参考訳(メタデータ) (2026-06-15T00:49:18Z) - Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation [28.732587811107777]
既存の評価プロトコルは主に、生成されたビデオと参照ビデオの間の厳密な時間対応を前提としたフレーム単位のメトリクスに依存している。
我々は、Soft Dynamic Time Warpingを確立された評価パイプラインに統合する統合シーケンスレベルの再構成を導入する。
フレームワイド評価は、厳密なアライメントの下では特別なケースとみなすことができ、一方、シーケンスレベルのアライメントは、安定性の向上、タイミング差に対する感度の低下、モデリングパラダイム間のより明確な分離を提供する。
論文 参考訳(メタデータ) (2026-05-31T05:44:42Z) - TS-Haystack: A Multi-Scale Retrieval Benchmark for Time Series Language Models [4.387988928531881]
時系列言語モデル(TSLM)は、自然言語における連続的な信号の推論のための統一モデルとして登場している。
既存のモデルは通常、短いシーケンスでトレーニングされ、評価されるが、現実の時系列センサーストリームは数百万のデータポイントにまたがる。
TS-Haystackは4つのカテゴリにまたがる10のタスクタイプからなる長期コンテキストの時間的評価ベンチマークである。
論文 参考訳(メタデータ) (2026-02-15T15:50:02Z) - Towards Leveraging Sequential Structure in Animal Vocalizations [29.151583875937927]
本稿では,ベクトル量子化とガムベル・ソフトマックスベクトル量子化によって導出される離散音響トークン列が,時間情報を効果的に捕捉・活用できるかどうかを考察する。
その目的のために、HuBERT埋め込みから生成されるトークンシーケンスのペアワイズ距離分析により、4つのバイオ音響データセットでコールタイプと呼び出し元を識別できることが示されている。
論文 参考訳(メタデータ) (2025-11-13T11:00:38Z) - Beyond Semantics: How Temporal Biases Shape Retrieval in Transformer and State-Space Models [4.69761138328817]
文脈内学習は時間的関係と意味的関係の両方によって支配される。
この研究は、様々な事前訓練された大規模言語モデル(LLM)が、時間的に分離されたイベントを識別し、検索する能力について調査する。
本研究は、文脈内学習における時間的偏見の理解を深め、これらの偏見が時間的分離と韻律的検索をいかに可能かを示すものである。
論文 参考訳(メタデータ) (2025-10-26T17:01:41Z) - Towards Low-Latency Tracking of Multiple Speakers With Short-Context Speaker Embeddings [52.985061676464554]
短文脈話者埋め込み抽出のための知識蒸留に基づく学習手法を提案する。
我々は、ビームフォーミングを用いて興味ある話者の空間情報を活用し、重複を低減する。
以上の結果から,本モデルは短文埋め込み抽出に有効であり,重なりやすいことが示唆された。
論文 参考訳(メタデータ) (2025-08-18T11:32:13Z) - TimeSiam: A Pre-Training Framework for Siamese Time-Series Modeling [67.02157180089573]
時系列事前トレーニングは、最近、ラベルのコストを削減し、下流の様々なタスクに利益をもたらす可能性があるとして、広く注目を集めている。
本稿では,シームズネットワークに基づく時系列の簡易かつ効果的な自己教師型事前学習フレームワークとしてTimeSiamを提案する。
論文 参考訳(メタデータ) (2024-02-04T13:10:51Z) - Improved disentangled speech representations using contrastive learning
in factorized hierarchical variational autoencoder [16.043725024443596]
acrlongfhvae (acrshortfhvae) は、話者のアイデンティティと内容を象徴するために異なる潜伏変数を使用する。
我々は、同じ話者を表現する際に話者識別変数を集合させるために、対照的な学習をフレームワークに導入する。
提案手法は,acrshortfhvaeに比べて話者識別とコンテンツ特徴抽出の両面で改善し,変換のベースラインよりも優れた性能を示した。
論文 参考訳(メタデータ) (2022-11-15T14:55:28Z) - Once-for-All Sequence Compression for Self-Supervised Speech Models [62.60723685118747]
自己教師型音声モデルのための一括圧縮フレームワークを提案する。
このフレームワークは様々なタスクで評価され、固定圧縮率の変種と比較して限界劣化を示す。
また、適応圧縮率学習についても検討し、グリッド探索を必要とせず、タスク固有の好ましいフレーム期間を選択する能力を示す。
論文 参考訳(メタデータ) (2022-11-04T09:19:13Z) - Play It Back: Iterative Attention for Audio Recognition [104.628661890361]
聴覚認知の重要な機能は、特徴音とそれに対応する意味を時間とともに関連付けることである。
本稿では,最も識別性の高い音に対して選択的な繰り返しを通し,終端から終端までの注意に基づくアーキテクチャを提案する。
提案手法は,3つのオーディオ分類ベンチマークにおいて常に最先端の性能を達成可能であることを示す。
論文 参考訳(メタデータ) (2022-10-20T15:03:22Z) - Multi-view Temporal Alignment for Non-parallel Articulatory-to-Acoustic
Speech Synthesis [59.623780036359655]
A2A(Articulatory-to-Aoustic)合成は、音声刺激器のキャプチャされた動きから可聴音声の生成を指します。
この手法には、病気や怪我のためにもはや話せない人々への口頭コミュニケーションの回復など、多くの応用がある。
本稿では,多視点学習の理論に基づく問題解決法を提案する。
論文 参考訳(メタデータ) (2020-12-30T15:09:02Z) - Context-aware and Scale-insensitive Temporal Repetition Counting [60.40438811580856]
時間的反復カウントは、与えられた反復行動のサイクル数を推定することを目的としている。
既存のディープラーニング手法は、実生活における複雑な反復行動に対して無効である固定された時間スケールで繰り返し動作が実行されると仮定する。
本稿では,未知かつ多様なサイクル長による繰り返しカウントの課題に対処するための文脈認識・スケール非感性フレームワークを提案する。
論文 参考訳(メタデータ) (2020-05-18T05:49:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。