論文の概要: Aslema at NADI 2026: Data Augmentation for Intent Recognition and Slot Filling
- arxiv url: http://arxiv.org/abs/2608.18689v2
- Date: Sun, 23 Aug 2026 08:22:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:42.850829
- Title: Aslema at NADI 2026: Data Augmentation for Intent Recognition and Slot Filling
- Title(参考訳): Alema at NADI 2026: Data Augmentation for Intent Recognition and Slot Filling
- Authors: Tajwaar Shafiq, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury,
- Abstract要約: NADI 2026共有タスク5のAslemaについて述べる。
意図認識とスロットフィリングの2つのサブタスクで構成されている。
ゼロショット設定で4つのOmni LLMを評価し、微調整モデルと比較した。
その結果、微調整はゼロショット推論よりも一貫して優れていた。
- 参考スコア(独自算出の注目度): 14.507818958266865
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present Aslema, our system for NADI 2026 Shared Task 5, which consists of two subtasks: intent recognition and slot filling. We evaluate four omni LLMs in a zero-shot setting and compare them with fine-tuned models. Our results show that fine-tuning consistently outperforms zero-shot inference. We further explore synthetic data augmentation by using an LLM to generate culturally grounded Tunisian Derja utterances, followed by voice cloning to generate synthetic speech. Incorporating this synthetic data improves performance on both tasks. Our final submitted system, based on Qwen3-Omni-30B and trained with a mixture of original and synthetic data, achieves 86.8% intent accuracy and 34.7 WER on the devtest split. On the official test set it ranks 1st in slot filling (59.5 CoER) and 4th among 8 teams in intent recognition (66.1% accuracy). We release our experimental scripts and will soon share the synthetic dataset to support further research in this area.
- Abstract(参考訳): AslemaはNADI 2026共有タスク5の2つのサブタスク、インテント認識とスロットフィリングからなるシステムである。
ゼロショット設定で4つのOmni LLMを評価し、微調整モデルと比較した。
その結果、微調整はゼロショット推論よりも一貫して優れていた。
さらに、LLMを用いて、文化的基盤を持つチュニジア・デルジャ発話を生成し、次いで音声のクローニングを行い、合成音声を生成する合成データ拡張について検討する。
この合成データを組み込むことで、両方のタスクのパフォーマンスが向上する。
最終提出システムはQwen3-Omni-30Bをベースとして,オリジナルデータと合成データを混合して学習し,テストスプリットにおける86.8%の意図精度と34.7 WERを実現した。
公式テストではスロットフィリング(59.5 CoER)で1位、意図認識(66.1%の精度)で8チーム中4位となった。
実験用スクリプトをリリースし、間もなく合成データセットを共有して、この分野のさらなる研究を支援します。
関連論文リスト
- FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction [0.0017904458681854366]
SemEval-2026タスク11(Subtask 1)のハイブリッド型ニューロシンボリックシステムであるFregeLogicについて紹介する。
本システムでは,2.85のコンテンツ効果と41.88の総合スコアで94.3%の精度を実現した。
本研究は,アンサンブルコンセンサスが最も低い形式的手法を適用した目的のニューロシンボリックな統合が,本課題で用いられる精度+コンテント・エフェクト・エフェクト・メトリクスの組合せを改善することを示唆している。
論文 参考訳(メタデータ) (2026-04-20T14:31:00Z) - From Memorization to Creativity: LLM as a Designer of Novel Neural-Architectures [48.83701310501069]
大規模言語モデル(LLM)は、プログラム合成において優れているが、ニューラルネットワーク設計(信頼性、性能、構造的ノベルティ)を自律的にナビゲートする能力は、未調査のままである。
コード指向LLMをクローズドループ合成フレームワークに配置し、22の教師付き微調整サイクルの進化を解析することによって、この問題に対処する。
論文 参考訳(メタデータ) (2026-01-06T13:20:28Z) - DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data [65.5290035371111]
本稿では,高校・学部レベルの数学競争問題から得られたリーン4証明データを生成する手法を提案する。
この合成データセットでDeepSeekMath 7Bモデルを微調整します。
我々のモデルは、Lean 4 Formalized International Mathematical Olympiad (FIMO)ベンチマークで148の問題を5つ証明しましたが、GPT-4は証明できませんでした。
論文 参考訳(メタデータ) (2024-05-23T09:03:42Z) - TarGEN: Targeted Data Generation with Large Language Models [51.87504111286201]
TarGENは、高品質な合成データセットを生成するための、多段階のプロンプト戦略である。
我々は,LLMが不正確なラベル付きインスタンスを修正できるようにする自己補正法により,TarGENを増強する。
合成データセットを元のデータセットと比較した包括的な分析により、データセットの複雑さと多様性の類似または高いレベルが明らかになる。
論文 参考訳(メタデータ) (2023-10-27T03:32:17Z) - Improving End-to-End Speech Processing by Efficient Text Data
Utilization with Latent Synthesis [17.604583337593677]
高性能エンドツーエンド音声(E2E)処理モデルの訓練には,大量のラベル付き音声データが必要となる。
E2E音声処理モデルのための効率的なテキストデータ利用フレームワークLaSynを提案する。
論文 参考訳(メタデータ) (2023-10-09T03:10:49Z) - Shape of synth to come: Why we should use synthetic data for English
surface realization [72.62356061765976]
2018年の共有タスクでは、追加で合成されたデータを使用してトレーニングされたシステムの絶対的なパフォーマンスにはほとんど差がなかった。
我々は、2018年の英語データセットの実験において、合成データの使用はかなりの効果があることを示した。
我々は、こうしたデータを活用するシステムについて、今後の研究努力が引き続き探求されるよう、禁止されるのではなく、その使用を奨励すべきであると主張している。
論文 参考訳(メタデータ) (2020-05-06T10:00:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。