論文の概要: Reusing Latent Speech Representations for Query-Conditioned Topic Localization in Transcripts
- arxiv url: http://arxiv.org/abs/2609.21844v1
- Date: Fri, 18 Sep 2026 14:41:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:17.152012
- Title: Reusing Latent Speech Representations for Query-Conditioned Topic Localization in Transcripts
- Title(参考訳): トランスクリプトにおける問合せ付きトピックの局所化のための潜在音声表現の再利用
- Abstract要約: 長い書き起こしは、下流のNLPシステムのための高価な入力である。
問合せ条件付きトピックのローカライゼーションについて検討する。
ASRエンコーダステートを文レベルの表現として再利用し,テキスト埋め込みで融合する。
- 参考スコア(独自算出の注目度): 16.692915208235764
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long transcripts are costly inputs for downstream NLP systems and often contain irrelevant context. We study query-conditioned topic localization: predicting the sentence span in a transcript that best addresses a topic-title query. To improve span localization, we reuse ASR encoder states as sentence-level representations and fuse them with textual embeddings. This lets lightweight span locators exploit speech information without running a separate audio encoder. Experiments on two public datasets show consistent gains over text-only baselines, especially under strict boundary-matching criteria. Cross-dataset experiments further indicate that the benefits are strongest for structured or semi-structured speech, while gains on spontaneous speech are limited and mixed.
- Abstract(参考訳): 長い書き起こしは、下流のNLPシステムのための高価な入力であり、しばしば無関係なコンテキストを含む。
問合せ条件付きトピックのローカライゼーションについて検討する。
局所的ローカライゼーションを改善するため,ASRエンコーダ状態を文レベルの表現として再利用し,テキスト埋め込みで融合する。
これにより、軽量なスパンロケータは、別のオーディオエンコーダを実行することなく、音声情報を利用することができる。
2つの公開データセットの実験は、特に厳密な境界マッチング基準の下で、テキストのみのベースラインよりも一貫した利得を示している。
クロスデータセット実験は、その利点が構造化された音声や半構造化された音声に対して最強であることを示し、一方、自然発話における利得は限定的かつ混合的であることを示している。
関連論文リスト
- Topic Matching in the Wild: Benchmark and Lessons from Real-World ASR Transcripts [1.0732935873226022]
コンタクトセンターでは、リアルタイムエージェントアシストツールが、事前に定義されたトピックのそれぞれについて、実際の顧客発話が関連しているかを判断し、エージェントにコーチングカードを表示する。
実世界の課題を体系的に研究するために,実際のコールセンタの書き起こしから得られた人手による話題発話判定データセットをキュレートする。
論文 参考訳(メタデータ) (2026-08-27T21:55:50Z) - Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text [3.1208668217678355]
音声言語モデルは、音声から直接テキスト応答を生成する。
既存のSLMは、より弱い命令追従挙動と限定的な一般化を示す。
意味的アライメントから長さミスマッチを分離する単純なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-24T07:41:28Z) - Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving [54.66679099886108]
音声-LLM統合は、広範囲なテキスト事前学習を活用することで有望な結果を示しているが、自動音声認識(ASR)の具体的な利点はいまだ不明である。
本稿では,単語レベルとセグメントレベルのインターリーブ付き音声テキストシーケンスを構成するASR指向の事前学習戦略であるJSTIPを提案する。
ASRデータの38k時間の実験では、ASRのみのトレーニングベースラインと共同音声テキストトレーニングベースラインと比較して、一貫したエンティティ精度が向上した。
論文 参考訳(メタデータ) (2026-07-02T05:42:01Z) - A Practical Evaluation Method for Long-Form Simultaneous Speech-to-Speech Translation [9.807543197382016]
シマルS2ST (SimulS2ST) はリアルタイム言語間通信を実現する。
長文SimulS2STの実用的評価法を提案する。
論文 参考訳(メタデータ) (2026-06-13T02:20:49Z) - ATIR: Towards Audio-Text Interleaved Contextual Retrieval [63.68521448682396]
本稿では,Audio-Text Interleaved contextual Retrieval (ATIR)タスクを導入する。
このベンチマークは、意味検索における既存の音声検索データセットの限界を実質的に解決する。
論文 参考訳(メタデータ) (2026-04-22T07:11:58Z) - Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR [14.082117520000873]
複数モーダルコンテキストがLLMベースのASRを改善するかどうかを考察する。
マルチターン学習を指導した後、会話のコンテキストは、主に文脈的実体の認識に役立ちます。
本稿では,先行するターンの音声部分を,対応するテキストを明示的に保持しつつ,一定の数の学習潜在トークンに置き換える抽象圧縮を提案する。
論文 参考訳(メタデータ) (2026-03-27T10:09:30Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Paragraph Segmentation Revisited: Towards a Standard Task for Structuring Speech [61.00008468914252]
本稿では,音声処理とテキストセグメンテーションの交点における3つのギャップを埋める,欠落した構造化ステップとして,段落セグメンテーションを再考する。
ベンチマークは、伝統的に段落のセグメンテーションが後処理の一部ではない未調査の音声領域に焦点を当てている。
第二に、制約付き復号法を提案し、大言語モデルが原文を保存しながら段落を挿入できるようにする。
第三に、コンパクトモデル(MiniSeg)が最先端の精度を実現し、階層的に拡張されると、最小計算コストで章や段落を共同で予測できることが示される。
論文 参考訳(メタデータ) (2025-12-30T23:29:51Z) - PROFASR-BENCH: A Benchmark for Context-Conditioned ASR in High-Stakes Professional Speech [0.0]
ProfASR-Benchは、金融、医療、法律、技術全般にわたる高度な応用のためのプロフェッショナルトーク評価スイートである。
それぞれの例は、自然言語プロンプトとエンティティリッチなターゲット発話をペアリングし、コンテキスト条件認識の制御された計測を可能にする。
論文 参考訳(メタデータ) (2025-12-29T18:43:23Z) - Hierarchical Context Tagging for Utterance Rewriting [51.251400047377324]
配列を線形に生成するのではなくタグ付けする方法は、ドメイン内および外部の書き直し設定においてより強力であることが証明されている。
本稿では,スロット付きルールを予測してこの問題を緩和する階層型コンテキストタグを提案する。
いくつかのベンチマーク実験により、HCTは2つのBLEUポイントで最先端の書き換えシステムより優れていることが示された。
論文 参考訳(メタデータ) (2022-06-22T17:09:34Z) - Continuous speech separation: dataset and analysis [52.10378896407332]
自然な会話では、音声信号は連続的であり、重複成分と重複成分の両方を含む。
本稿では,連続音声分離アルゴリズムを評価するためのデータセットとプロトコルについて述べる。
論文 参考訳(メタデータ) (2020-01-30T18:01:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。