論文の概要: SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding
- arxiv url: http://arxiv.org/abs/2606.25552v1
- Date: Wed, 24 Jun 2026 08:28:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.279539
- Title: SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding
- Title(参考訳): SFL-MTSC:ロバストなマルチインテント音声言語理解のためのセマンティックフレームレベルマルチタスク自己整合性を活用する
- Authors: Po-Yen Chen, Berlin Chen,
- Abstract要約: 本稿では,セマンティックフレームレベルで動作可能な新しい構造化集約フレームワークを提案する。
SFL-MTSCは、予測をインテント固有のフレームに分解し、ドメインインテントのグルーピングとスロットレベルのクラスタリングを適用し、クラスタの信頼性を評価する。
MAC-SLUベンチマークデータセットのゼロショット実験では、スロットF1が改善され、シングルパス推論よりも全体的な精度が向上した。
- 参考スコア(独自算出の注目度): 12.724852251982604
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt-based spoken language understanding (SLU) with large language models (LLMs) often suffers from inconsistent intent--slot structures due to decoding stochasticity, particularly in multi-intent scenarios. In view of this, we propose Semantic Frame-Level Multi-Task Self-Consistency (SFL-MTSC), a novel structured aggregation framework operating at the semantic frame level. Instead of output-level majority voting, SFL-MTSC decomposes predictions into intent-specific frames, applies domain--intent grouping and slot-level clustering, and evaluates cluster reliability using path support scoring. Reliable frames are retained and re-integrated to form the final prediction. Zero-shot experiments on the MAC-SLU benchmark dataset show improved slot F1 and overall accuracy over single-path inference, while intent accuracy remains largely stable across most settings.
- Abstract(参考訳): 大規模言語モデル (LLM) を持つプロンプトベースの音声言語理解 (SLU) は、特に多言語シナリオにおいて、確率性の復号化による不整合な意図-スロット構造に悩まされることが多い。
そこで本研究では,セマンティックフレームレベル多タスク自己整合性(SFL-MTSC)を提案する。
出力レベルの多数決に代えて、SFL-MTSCは、予測をインテント固有のフレームに分解し、ドメインレベルのグループ化とスロットレベルのクラスタリングを適用し、パスサポートスコアリングを使用してクラスタの信頼性を評価する。
信頼性のあるフレームは保持され、最終的な予測を形成するために再統合される。
MAC-SLUベンチマークデータセットのゼロショット実験では、スロットF1が改善し、シングルパス推論よりも全体的な精度が向上した。
関連論文リスト
- HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding [1.8482679687103294]
HAVENは階層的に整列したマルチモーダル・ベンチマークである。
この統一アノテーションパラダイムに基づいて,要約,時間的推論,マルチモーダルグラウンド,サリエンシランキングにまたがる総合評価スイートを提案する。
論文 参考訳(メタデータ) (2026-05-19T00:48:14Z) - Every Preference Has Its Strength: Injecting Ordinal Semantics into LLM-Based Recommenders [5.600161718503259]
我々は,対話レベルのユーザフィードバックをモデル化することによって,好みの強さを明示的に組み込んだハイブリッドCF-LLMフレームワークであるOrdinal Semantic Anchoring (OSA)を提案する。
複数の実世界のデータセットの実験は、OSAが既存のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-11T10:21:36Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - Cluster Workload Allocation: Semantic Soft Affinity Using Natural Language Processing [0.0]
本稿では,自然言語処理を用いたクラスタシステムのためのセマンティックな意図駆動型スケジューリングパラダイムを提案する。
このシステムは、スケジューラ拡張子を介して統合されたLarge Language Cluster Model (LLM)を使用して、ソフトアフィニティの好みに対する自然言語アロケーションヒントアノテーションを解釈する。
論文 参考訳(メタデータ) (2026-01-14T08:36:21Z) - Semantic Frame Interpolation [66.81586538775366]
従来のフレームタスクは、主に少数のフレーム、テキストコントロールなし、第1フレームと第2フレームの最小差のシナリオに焦点を当てていた。
最近のコミュニティ開発者は、フレーム・ツー・フレーム機能を実現するために、Wanによって表現された大きなビデオモデルを利用している。
本稿では、まず、上記の2つの設定を網羅し、複数のフレームレートでの推論をサポートする、学術的定義の観点から、新しい実用的意味フレーム補間(SFI)タスクを提案する。
論文 参考訳(メタデータ) (2025-07-07T16:25:47Z) - Multi-Scale Manifold Alignment for Interpreting Large Language Models: A Unified Information-Geometric Framework [4.935224714809964]
我々は,LLM表現を局所的,中間的,大域的多様体に分解する情報幾何学的フレームワークであるマルチスケールマニフォールドアライメント(MSMA)を提案する。
我々は一貫した階層パターンを観察し、MSMAが複数の推定値の下でアライメントの指標を改善することを発見した。
異なるスケールでの制御された介入は、語彙の多様性、文構造、談話のコヒーレンスに区別され、アーキテクチャに依存した効果をもたらす。
論文 参考訳(メタデータ) (2025-05-24T10:25:58Z) - Towards Realistic Zero-Shot Classification via Self Structural Semantic
Alignment [53.2701026843921]
大規模事前訓練型視覚言語モデル(VLM)はゼロショット分類に有効であることが証明されている。
本稿では,アノテーションではなく,より広い語彙を前提とした,より難易度の高いゼロショット分類(Realistic Zero-Shot Classification)を提案する。
本稿では,ラベルのないデータから構造意味情報を抽出し,同時に自己学習を行う自己構造意味アライメント(S3A)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-24T17:56:46Z) - Knowledge-augmented Frame Semantic Parsing with Hybrid Prompt-tuning [17.6573121083417]
本稿では,意味表現を強化するための知識強化フレーム意味解析アーキテクチャ(KAF-SPA)を提案する。
メモリベースの知識抽出モジュール(MKEM)は、正確なフレーム知識を選択し、連続的なテンプレートを構築するために考案された。
我々はまた、選択した知識をPLMに組み込むハイブリッドプロンプトを用いてタスク指向知識探索モジュール(TKPM)を設計し、フレームおよび引数識別のタスクにPLMを適用する。
論文 参考訳(メタデータ) (2023-03-25T06:41:19Z) - Token-level Sequence Labeling for Spoken Language Understanding using
Compositional End-to-End Models [94.30953696090758]
音声合成言語理解システムを構築した。
ASRのために訓練された中間デコーダを頼りにすることで、私たちのエンドツーエンドシステムは、入力モダリティを音声からトークンレベルの表現に変換する。
我々のモデルは、名前付きエンティティ認識のラベル付けタスクにおいて、カスケードモデルと直接エンド・ツー・エンドモデルの両方より優れている。
論文 参考訳(メタデータ) (2022-10-27T19:33:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。