論文の概要: SEAR: Segment-Evidence-Aware Routing for Weak-to-Strong Multilingual Speech MCQ
- arxiv url: http://arxiv.org/abs/2609.11355v1
- Date: Thu, 10 Sep 2026 10:38:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.30552
- Title: SEAR: Segment-Evidence-Aware Routing for Weak-to-Strong Multilingual Speech MCQ
- Title(参考訳): SEAR: Wak-to-Strong Multilingual Speech MCQのためのセグメンテーション・エビデンス・アウェア・ルーティング
- Abstract要約: 本稿では,第2回MLC-SLMチャレンジのタスク2について述べる。
言語モデルは、タイムスタンプ付きASRをコヒーレントなイベントスパンに変換する。
テキストのみのプローブは、データを教師付き微調整や強化学習に用いられる強い音声依存アイテムに分割する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: This paper describes our system for Task~2 of the second Multilingual Conversational Speech Language Model (MLC-SLM) Challenge. We adapt Qwen3-Omni-30B-A3B-Instruct with a segment-evidence-aware data and post-training pipeline. A language model converts timestamped ASR into coherent event spans, which are expanded by a boundary margin and cropped from the original recording. We then synthesize complementary semantic MCQs with Qwen3.6-27B and acoustic MCQs with Gemini~3.1 Flash-Lite, followed by structural, grounding, answer-consistency, and target-model trainability checks, yielding 359,825 verified MCQs across 21 language and accent variants. A text-only probe partitions the data into weak, text-answerable items used for supervised fine-tuning and strong, audio-dependent items used for reinforcement learning with Group Sequence Policy Optimization (GSPO), stabilized by debiased advantages, sequence-level importance correction, and dynamic filtering. Our system obtains 90.92% accuracy on the final official evaluation set.
- Abstract(参考訳): 本稿では,MLC-SLM(Multilingual Conversational Speech Language Model)チャレンジのタスク~2について述べる。
我々は,Qwen3-Omni-30B-A3B-Instructにセグメントエビデンス対応データと後学習パイプラインを適用した。
言語モデルは、タイムスタンプ付きASRをコヒーレントなイベントスパンに変換する。
次に、Qwen3.6-27Bと、Gemini~3.1 Flash-Liteで音響MCQを合成し、続いて構造、接地、応答整合性、目標モデルのトレーニング性チェックを行い、21言語およびアクセント変種で359,825の認証MCQを出力する。
テキストのみのプローブは、データを、グループシーケンスポリシー最適化(GSPO: Group Sequence Policy Optimization)を用いて強化学習に使用する教師付き微調整および強い音声依存アイテムに分割し、デバイアスド・アドバンテージ、シーケンスレベルの重要度補正、動的フィルタリングによって安定化する。
本システムでは,最終公式評価セットに対して90.92%の精度が得られる。
関連論文リスト
- Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models [51.75139461584678]
最近の音声合成モデルは高品質な音声を生成するが、複数の音声イベントと時間順を含む指示に従わないことが多い。
本稿では,音声対応の大規模言語モデルを用いた指示レベルフレームワークを提案する。
実験の結果,既存のベンチマークやS3Benchにおける事象完全性,時間的順序付け,共同指示追従の精度が向上し,音質の維持が図られた。
論文 参考訳(メタデータ) (2026-07-15T03:13:06Z) - OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains [50.186434778589415]
音声-視覚的質問回答(QA)のための現在の自動パイプラインは、一般的にビデオキャプション-QA'のパラダイムを採用している。
textbfEntity-Anchored Video Scripting' と textbfClue-Guided QA Generation' という2つのメカニズムを備えた自動データエンジンを提案する。
論文 参考訳(メタデータ) (2026-06-12T17:59:55Z) - Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization [0.0]
KSAA-2026 音声自動発音によるアラビア語発音における共有課題の第2タスクの入賞システムについて述べる。
本システムでは、事前訓練したCATTテキストエンコーダと凍結したWhisper音声エンコーダを組み合わせた文字レベルのマルチモーダルモデルであるCATT-Whisperを微調整する。
このシステムは、主要なリーダーボードの基準で23.26%のWERを達成し、全参加者の1位となった。
論文 参考訳(メタデータ) (2026-05-25T15:07:48Z) - ATIR: Towards Audio-Text Interleaved Contextual Retrieval [63.68521448682396]
本稿では,Audio-Text Interleaved contextual Retrieval (ATIR)タスクを導入する。
このベンチマークは、意味検索における既存の音声検索データセットの限界を実質的に解決する。
論文 参考訳(メタデータ) (2026-04-22T07:11:58Z) - Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use [1.851890212523342]
本稿では,スマートカー,スマートホーム,ウェアラブルの3つの主要領域にわたるSpeechLMのツールコール機能を評価するためのAudio2Toolを紹介する。
我々のベンチマークでは、単純な直接コマンドから複雑なマルチインテントやニードル・イン・ア・ヘイスタック抽出から、独立した障害モードまで、多層的な複雑性階層が特徴的である。
現状のSpeechLMとASR-LLMパイプラインの評価は、単純なコマンドでは高い性能を示すが、構成的および音響的課題では著しく低下する。
論文 参考訳(メタデータ) (2026-04-17T16:41:25Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model [76.06585781346601]
音声言語モデル(Speech LMs)は、単一のモデル内でエンドツーエンドの音声テキストモデリングを可能にする。
音声テキストの共同復号パラダイムの選択は、性能、効率、アライメント品質において重要な役割を担っている。
論文 参考訳(メタデータ) (2025-06-04T23:53:49Z) - Retrieval-Enhanced Few-Shot Prompting for Speech Event Extraction [0.0]
音声イベント抽出(SpeechEE)は、音声認識(ASR)と自然言語処理(NLP)の交差点に位置する課題である。
本稿では,Large Language Models (LLM) のセマンティック検索強化プロンプトと高性能ASRを統合したモジュール型パイプラインベースのSpeechEEフレームワークを提案する。
この結果から,LLMに強化されたパイプラインアプローチは,エンド・ツー・エンドのシステムに匹敵する,あるいは超越できることを示した。
論文 参考訳(メタデータ) (2025-04-30T07:10:10Z) - Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision [83.0622534215881]
本研究は, 聴覚, 視覚, 言語的モダリティを統合した, 産業レベルのOmni-Modal Large Language Model (LLM) パイプラインを提案する。
まず、様々なエンコーダ-LLM-デコーダアーキテクチャの柔軟な構成を可能にするモジュラーフレームワークです。
第二に、最先端のビジョン言語モデルであるQwen2.5-VLのオーディオ言語アライメントを事前訓練する軽量なトレーニング戦略である。
第三に、様々な現実世界のシナリオから高品質な音声テキストデータを生成するオーディオ合成パイプライン。
論文 参考訳(メタデータ) (2025-02-26T17:26:36Z) - VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing [81.32613443072441]
テキスト音声(TTS)、音声変換(VC)、自動音声認識(ASR)などのタスクでは、クロスモーダルな粒度(フレームレベル)シーケンス表現が望まれる。
本稿では,テキストと音声を共同空間に組み込むために,クロスモーダルシーケンストランスコーダを用いた量子コントラスト・トーケン・音響事前学習(VQ-CTAP)手法を提案する。
論文 参考訳(メタデータ) (2024-08-11T12:24:23Z) - COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning [45.282468928830056]
大規模言語モデル(LLM)に音声を統合するコスト効率のよい手法を提案する。
教師あり指導のための音声書き起こしから音声テスト質問応答(SQA)ペアを生成する。
3000万以上のトレーニング可能なパラメータで、COSMICは命令追従およびコンテキスト内学習の新たな能力を示す。
論文 参考訳(メタデータ) (2023-11-03T21:47:03Z) - Audio-text Retrieval in Context [24.38055340045366]
そこで本研究では,音声・テキストのアライメントを改善するために,複数のオーディオ機能とシーケンスアグリゲーション手法について検討する。
我々は,事前学習した音声特徴と記述子に基づくアグリゲーション法を用いた文脈音声テキスト検索システムを構築した。
提案システムでは、リコール、中央値、平均値を含むすべての指標において、双方向音声テキスト検索において顕著な改善が達成されている。
論文 参考訳(メタデータ) (2022-03-25T13:41:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。