論文の概要: Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models
- arxiv url: http://arxiv.org/abs/2608.05126v1
- Date: Wed, 05 Aug 2026 17:50:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.068833
- Title: Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models
- Title(参考訳): 音声機能呼び出し:大規模音声言語モデルのための音声言語理解の新しい視点
- Authors: Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen,
- Abstract要約: Spoken Language Understanding (SLU) はタスク指向対話システムの中核となるコンポーネントである。
本研究では,従来の閉集合SLUを超えて進化するスポンク言語関数呼び出し(SFC)を提案する。
- 参考スコア(独自算出の注目度): 14.282205541707699
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spoken Language Understanding (SLU) is the core component of task-oriented dialogue systems and a pivotal link in achieving seamless human-agent interaction. While traditional SLU can effectively extract user semantics for closed-set tasks after in-domain supervised fine-tuning, it faces significant challenges in leveraging in-context learning for open-domain tasks due to its ambiguous rule definitions. This work proposes Spoken Function Calling (SFC), a novel semantic understanding perspective that optimizes semantic understanding with structured rule definitions, to evolve beyond traditional closed-set SLU. Specifically, we curate and extend a suite of spoken functions based on traditional SLU datasets, construct a multi-agent system to synthesize the SFC-Bench dataset, evaluate the performance of Large Language Models (LLMs) and Large Audio Language Models (LALMs), and enhance the SFC capabilities of LALMs through post-training. Experiments demonstrate that SFC outperforms traditional SLU, substantially enhancing the semantic extraction accuracy for LLMs and LALMs.
- Abstract(参考訳): Spoken Language Understanding (SLU) はタスク指向対話システムの中核的なコンポーネントであり、シームレスなヒューマンエージェントインタラクションを実現する上で重要なリンクである。
従来のSLUは、ドメイン内教師付き微調整後のクローズドセットタスクのユーザセマンティクスを効果的に抽出できるが、あいまいなルール定義のため、オープンドメインタスクのコンテキスト内学習を活用する上で大きな課題に直面している。
本研究では、従来の閉集合SLUを超えて進化するために、構造化規則定義による意味理解を最適化する新しい意味理解の視点であるスポケン関数呼び出し(SFC)を提案する。
具体的には、従来のSLUデータセットをベースとした音声機能のスイートのキュレートと拡張、SFC-Benchデータセットの合成のためのマルチエージェントシステムの構築、Large Language Models(LLM)とLarge Audio Language Models(LALM)の性能評価、ポストトレーニングによるLALMのSFC機能の向上などを行う。
実験により、SFCは従来のSLUよりも優れており、LLMやLALMのセマンティック抽出精度を大幅に向上することが示された。
関連論文リスト
- Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models [53.06230963851451]
JARVISは、MLLMの自己教師型視覚強調のためのJEPAにインスパイアされたフレームワークである。
JARVISは,MLLMの自己教師型視覚強調のためのJEPAに着想を得たフレームワークである。
論文 参考訳(メタデータ) (2025-12-17T19:01:34Z) - MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark [44.95801048019833]
Spoken Language Understanding (SLU)は、ダウンストリームタスクを実行するためのユーザセマンティクスを抽出することを目的としている。
最新のLarge Language Models (LLM) とLarge Audio Language Models (LALM) の統一ベンチマークがない。
MAC-SLUは、新しいマルチインテント自動車キャビンスポット言語理解データセットである。
論文 参考訳(メタデータ) (2025-12-01T12:23:19Z) - Uni-Sign: Toward Unified Sign Language Understanding at Scale [90.76641997060513]
本稿では,事前学習と下流SLUタスクのギャップを解消する統合事前学習フレームワークを提案する。
Uni-Signは、複数の下流SLUタスクにまたがる最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-01-25T11:51:23Z) - Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series [3.453940014682793]
本研究では,Large Language Models (LLMs) に習熟した言語環境において,時系列(TS)データを言語成分と整合させるコンテキストアライメントを提案する。
このようなコンテキストレベルのアライメントは、DSCA-GNN(Dual-Scale Context-Alignment GNN)によって達成される構造的アライメントと論理的アライメントを含む。
大規模な実験は、特に少数ショットおよびゼロショット予測において、DeCAの有効性とタスク間のコンテキストアライメントの重要性を示している。
論文 参考訳(メタデータ) (2025-01-07T12:40:35Z) - SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization [70.11167263638562]
社会的関係推論は、友人、配偶者、同僚などの関係カテゴリを画像から識別することを目的としている。
まず、VFM(Vision Foundation Models)の知覚能力と、モジュラーフレームワーク内でのLLM(Large Language Models)の推論能力を組み合わせた、シンプルだが巧妙な名前のフレームワークを提示する。
論文 参考訳(メタデータ) (2024-10-28T18:10:26Z) - Large Language Models are Interpretable Learners [53.56735770834617]
本稿では,Large Language Models(LLM)とシンボルプログラムの組み合わせによって,表現性と解釈可能性のギャップを埋めることができることを示す。
自然言語プロンプトを持つ事前訓練されたLLMは、生の入力を自然言語の概念に変換することができる解釈可能な膨大なモジュールセットを提供する。
LSPが学んだ知識は自然言語の記述と記号規則の組み合わせであり、人間(解釈可能)や他のLLMに容易に転送できる。
論文 参考訳(メタデータ) (2024-06-25T02:18:15Z) - ECLM: Entity Level Language Model for Spoken Language Understanding with Chain of Intent [20.3491383818583]
大きな言語モデル(LLM)は、言語生成と一般的なタスクパフォーマンスにおいて印象的な能力を示している。
本稿では,エンティティ認識タスクとしてスロットフィリングを再構成するエンティティレベル言語モデル(ECLM)フレームワークを提案する。
ECLMはUni-MISのような強力なベースラインをはるかに上回り、MixATISでは3.7%、MixSNIPSでは3.1%を達成している。
論文 参考訳(メタデータ) (2024-03-07T13:30:52Z) - Towards ASR Robust Spoken Language Understanding Through In-Context
Learning With Word Confusion Networks [68.79880423713597]
本稿では,トップ仮説のみに頼るのではなく,ASRシステムの格子出力を利用する手法を提案する。
音声質問応答と意図分類を網羅した文脈内学習実験により,LLMの音声書き起こしに対する弾力性について明らかにした。
論文 参考訳(メタデータ) (2024-01-05T17:58:10Z) - FederatedScope-LLM: A Comprehensive Package for Fine-tuning Large
Language Models in Federated Learning [70.38817963253034]
本稿では, ファインチューニング LLM のこれらの課題について論じ, 本パッケージ FS-LLM を主な貢献として紹介する。
我々は、FLシナリオにおける将来の拡張のために、包括的フェデレーションパラメータ効率の良い微調整アルゴリズムの実装と汎用プログラミングインタフェースを提供する。
本研究では, FS-LLM の有効性を検証し, FL 設定におけるパラメータ効率の高いパラメータ調整アルゴリズムを用いて, 高度な LLM のベンチマークを行う。
論文 参考訳(メタデータ) (2023-09-01T09:40:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。