論文の概要: Live Gurbani Tracking: A Benchmark and Reference System for Captioning Sikh Kirtan
- arxiv url: http://arxiv.org/abs/2607.13457v1
- Date: Wed, 15 Jul 2026 05:33:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.661436
- Title: Live Gurbani Tracking: A Benchmark and Reference System for Captioning Sikh Kirtan
- Title(参考訳): Live Gurbani Tracking:Sikh Kirtanのキャプションのためのベンチマークとリファレンスシステム
- Abstract要約: 本稿では,Sikh Kirtanのライブキャプションのためのベンチマークと参照システムを提案する。
キルタン字幕はクローズド・ボキャブラリの問題であり、全ての表示された行は正典からの正確なワード・フォー・ワードの行でなければならない。
タスクをt,ペア (shabad_id, line_idx) あるいはnull の予測として形式化し,問題空間を2x2行列に整理する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a benchmark and reference system for live captioning of Sikh Kirtan - the continuous, sung recitation of verses from the Sri Guru Granth Sahib Ji (SGGS). Unlike open-vocabulary lyrics transcription, Kirtan captioning is a closed-vocabulary problem: every displayed line must be an exact, word-for-word line from the canonical scripture, because displaying misspelled Gurmukhi is considered religiously inappropriate. We formalize the task as predicting, at every time t, a pair (shabad_id, line_idx) or null, and organize the problem space into a 2x2 matrix along two orthogonal axes: live vs. offline (causal vs. full-audio access) and blind vs. oracle (shabad identity discovered vs. given). We release v1 of the benchmark - 4 hand-annotated Kirtan recordings x 3 cold-start offsets = 12 evaluation cases, ~57 minutes of scored audio - together with a scorer that computes frame accuracy at 1s resolution over a scored region, with a 1s collar and gap-tolerant scoring at segment boundaries. We describe a reference system (fine-tuned 120M IndicConformer -> fuzzy matcher -> state machine; INT8 ONNX; RTF ~0.05 on one Apple Silicon core) that achieves 57.9% overall frame accuracy across all 12 cases (10/12 correct shabad locks) on the hardest variant (live x blind). We compare against three trivial baselines (empty, shifted-5s, perfect) and discuss why standard ASR metrics (WER/CER) measure transcription accuracy rather than the display accuracy this task requires. The benchmark, reference system, and a live deployment are released under permissive licenses to facilitate further improvements.
- Abstract(参考訳): 本稿では,Sri Guru Granth Sahib Ji(SGGS)の詩の連続的,歌唱的引用であるSikh Kirtanのライブキャプションのためのベンチマークと参照システムについて述べる。
すべての表示された行は、正典からの正確なワード・フォー・ワードの行でなければならない。
t, 対(shabad_id, line_idx) または null の予測としてタスクを形式化し、問題空間を2x2行列に整理する: ライブ対オフライン(causal vs. full-audio access)とブラインド対オラクル(shabad identity vs. given)である。
ベンチマーク v1 - 手書きのKirtanレコード x 3 コールドスタートオフセット x 3 コールドスタートオフセット = 12 評価ケース 〜57分 スコアオーディオ - スコア領域上の1s解像度でフレーム精度を計算するスコアラ、セグメント境界における1sカラーとギャップ耐性スコア – をリリースする。
IndicConformer -> fuzzy matcher -> state machine; INT8 ONNX; RTF ~0.05 on one Apple Silicon core) は、最も難しい変種(5 x blind)の12ケースすべてで57.9%のフレーム精度を実現している。
我々は,3つの自明なベースライン(空白,シフト-5s,完全)を比較し,標準ASRメトリクス(WER/CER)が,このタスクに必要な表示精度よりも転写精度を測る理由について議論する。
ベンチマーク、リファレンスシステム、ライブデプロイメントはパーミッシブライセンスの下でリリースされ、さらなる改善が促進される。
関連論文リスト
- LangStreet: Persistent Language Fields for Anchor-Decoded Street Gaussians [49.81964802805499]
言語ガウスの分野は、プリミティブがビュー間で識別可能であると暗黙的に仮定している。
このような構成されたガウスシーンのための永続的な言語分野であるOursを紹介する。
その結果,ビューコンディショニングされたスプレート上の言語フィールドには,永続的なセマンティックオーナシップ,保存されたエビデンス,安定性,詳細性,表現コストといった階層が要求されることがわかった。
論文 参考訳(メタデータ) (2026-09-10T14:31:02Z) - KhatianDoc: A Human-Verified Benchmark Diagnosing Multimodal LLM Failure on Bengali Legal Land Records [0.0]
バングラデシュの土地所有権は、Unicodeグリフ、メインストリームフォント、OCRパイプラインやトークンーザのない、ベース16の位置割当システムで記録されている。
KhatianDocはバングラデシュのムンシガンジのヴミ(土地)オフィスから107のリアルRS Khatianレコードから構築されたベンチマークである。
論文 参考訳(メタデータ) (2026-09-03T09:46:41Z) - Can Scene Text Recognition Read Rare Compositions? [1.7844382164707184]
6つの標準ベンチマークにおいて、シーンテキスト認識は89-97%正確であると報告され、その問題が飽和として広く扱われている。
私たちは代替の読書を提示する。
同じテスト画像が、基準コーパスに対して、接地的単語の規則性と文字n-gramの新規性によって共同で成層されると、結果の5x5グリッドのレアワードxレアトリグラムコーナーでの精度は、q3/q3センタより10〜18pt下方に低下する。
論文 参考訳(メタデータ) (2026-09-01T07:16:42Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning [73.56343820592399]
本稿では,視覚的タスクセマンティックス(VTS, Visualized Task Semantics)について紹介する。
6つのMLLMと4つのベンチマークで、24のモデルとタスクのペアの精度は平均17.8ポイント低下した。
本稿では,質問領域を型付きセマンティクスと整合させ,そのクリーンな表現をマスクビューから復元するプロンプト領域グラウンドを提案する。
論文 参考訳(メタデータ) (2026-08-05T11:46:15Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin [0.0]
本稿では,NVIDIA Nemotron 3.5 ASR Streaming 0.6Bを応用したエンドツーエンドのエンジニアリングスタディを,菊湯,ドリオ,カレンジンに提示する。
この研究は、コーパス監査、Unicode正規化、分割チェック、期間フィルタリング、低レート継続、検証に基づくチェックポイント選択、真のストリーミング評価、アーティファクト保存、孤立したサービスについてカバーしている。
論文 参考訳(メタデータ) (2026-07-21T09:52:57Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories [0.0]
LLM-as-a-judgeは、NLPパイプラインのスケーラビリティ評価において、主要なアプローチとなっている。
オープンソースのベンチマークと信頼性監査フレームワークであるBabelJudgeを紹介します。
位置バイアス、冗長性バイアス、順序の不整合、言語間の劣化の4つの障害モードを計測します。
論文 参考訳(メタデータ) (2026-06-21T04:35:43Z) - AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents [7.158614088800619]
AURAは、シーン認識とIntentFrameを生成するツール使用の間の推論ステップを挿入する。
AURAはReActスタイルの探索よりも暗黙的なカバレッジを改善している。
このコントローラーは、プライバシに敏感なスライスでプローブを82%減らし、禁じられたツール違反をゼロにする。
論文 参考訳(メタデータ) (2026-06-04T01:11:06Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech [0.0]
音素置換プロファイル(Phonme Substitution Profile)は、Indic TTSの音素単位のアクセントベンチマークである。
PSPはアクセントを6つの相補的次元に分解する: 反射崩壊率(RR)、吸入フィデリティ(AF)、母音長フィデリティ(ZF)、フレシェオーディオ距離(FAD)、韻律的シグネチャディペンデンス(PSD)。
論文 参考訳(メタデータ) (2026-04-28T10:28:32Z) - Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India [13.263260192783195]
Voice of India(ボイス・オブ・インディア)は、139の地域クラスタにわたる15の主要なインドの言語をカバーする、未記述の電話会話から構築されたクローズドソースベンチマークである。
データセットには306230の発話が含まれており、スペルのバリエーションを考慮した36691人の話者から合計536時間の音声が含まれている。
論文 参考訳(メタデータ) (2026-04-21T07:02:01Z) - What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification [60.36003327686732]
Curryは適応的な損失であり、Sub-center ArcFace経由でオンラインのサンプルの難しさを見積もる。
カレーはEERを86.8%減らし、サブセンターのArcFaceベースラインを60.0%減らした。
論文 参考訳(メタデータ) (2026-03-25T15:41:21Z) - Automatic Pronunciation Error Detection and Correction of the Holy Quran's Learners Using Deep Learning [0.0]
高品質なQuranicデータセットを生成するために、98%の自動パイプラインを構築しています。
私たちはカスタムのQuran Phonetic Scriptを使ってTajweedルールをエンコードしています。
すべてのコード、データ、モデルをオープンソースとしてリリースしています。
論文 参考訳(メタデータ) (2025-08-27T15:28:46Z) - GRACE: Discriminator-Guided Chain-of-Thought Reasoning [75.35436025709049]
本稿では, 正しい推論手順を導出するために, GRACE (CorrectnEss Discriminator) を用いたチェーン・オブ・シークレット・リAsoningを提案する。
GRACEは、正しいステップと間違ったステップに対して対照的な損失で訓練された判別器を採用しており、復号時に次のステップ候補を採点するために使用される。
論文 参考訳(メタデータ) (2023-05-24T09:16:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。