論文の概要: Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities
- arxiv url: http://arxiv.org/abs/2607.03201v1
- Date: Fri, 03 Jul 2026 11:14:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.553341
- Title: Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities
- Title(参考訳): 長期記録からのベンチマークデータセットの導出:課題と機会
- Abstract要約: 子ども中心の音声の長期録音は、初期の言語発達を研究する上で生態学的に有効な情報源であるが、3つの問題はそれらの使用を制限する。
まず、LFRコーパスは異質なフォーマットと同意構造を持つ部位にまたがって収集され、クロスコーパスは非自明である。
第二に、標準化されたベンチマークなしでは、ツールが言語や条件をまたいで一般化するかどうかを評価することは難しい。
第3に、MLは繊細な子言を統制するプライバシーの制約をほとんど尊重しない。
- 参考スコア(独自算出の注目度): 36.048420615870064
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Long-form recordings (LFRs) of child-centered audio are ecologically valid sources for studying early language development, but three problems limit their use. First, LFR corpora are collected across sites with heterogeneous formats and consent structures, making cross-corpus use non-trivial. Second, without standardized benchmarks, assessing whether tools generalize across languages and conditions is hard. Third, ML workflows rarely respect privacy constraints governing sensitive child speech. This paper presents a framework addressing all three: a standardized collection of 27 child-centered datasets built with open-source tools (S1); a replicable pipeline for four speech-processing benchmarks (S2); and ELSI, a role-based ecosystem embedding ethical governance into the ML workflow (S3). We demonstrate the framework via a voice type classification case study and show the three solutions are mutually dependent.
- Abstract(参考訳): 幼児中心オーディオのLFR(Long-form Records)は、初期の言語発達を研究する上で生態学的に有効な情報源であるが、3つの問題がある。
まず、LFRコーパスは異質なフォーマットと同意構造を持つ部位にまたがって収集され、クロスコーパスは非自明である。
第二に、標準化されたベンチマークなしでは、ツールが言語や条件をまたいで一般化するかどうかを評価することは難しい。
第3に、MLワークフローは、敏感な子スピーチを管理するプライバシー制約をほとんど尊重しない。
本稿では,オープンソースツールで構築された27の子供中心データセットの標準化されたコレクション(S1),4つの音声処理ベンチマークのレプリカ可能なパイプライン(S2),MLワークフローにガバナンスガバナンスを組み込んだロールベースのエコシステム(ELSI)の3つに対処するフレームワークを提案する。
音声型分類ケーススタディを用いて,この枠組みを実演し,これら3つの解が相互に依存していることを示す。
関連論文リスト
- From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding [15.376371030121094]
ReceiptBenchは10万の多様なレシートからなる、大規模で人間による注釈付きベンチマークである。
ReceiptBenchは10万の多様なレシートからなる大規模で人手による注釈付きベンチマークである。
論文 参考訳(メタデータ) (2026-05-21T12:37:03Z) - How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities [75.10343190811592]
大規模言語モデル(LLM)は、社会的に敏感なドメインにますますデプロイされる。
私たちのベンチマークでは、安全で制御可能な振る舞いのための原則的で解釈可能なフレームワークを提供しています。
論文 参考訳(メタデータ) (2026-03-03T03:50:13Z) - NormCode: A Semi-Formal Language for Context-Isolated AI Planning [7.3226942109207895]
推論計画を構築するための半形式言語であるNormCodeを提示する。
各ステップはデータ分離で動作し、明示的に渡された入力のみを受け取り、設計によるクロスステップ汚染を排除します。
我々は,(1)任意の長さの入力に対して100%の精度を達成するベースX加算アルゴリズム,(2)NormCode自身の5フェーズコンパイラパイプラインの自己ホスト実行の2つのデモを通じて,NormCodeを検証する。
論文 参考訳(メタデータ) (2025-12-11T11:50:50Z) - Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice [18.222990693059756]
ContextCRBenchは、コードレビューにおける詳細なLCM評価のためのベンチマークである。
153.7Kのイシューとトップレベルのリポジトリからのプルリクエストを収集する。
レビューワークフローに沿った3つの評価シナリオをサポートする。
論文 参考訳(メタデータ) (2025-11-10T12:06:35Z) - PLSemanticsBench: Large Language Models As Programming Language Interpreters [31.611330217819713]
大規模言語モデル(LLMs)がコード推論に長けているため、自然な疑問が生じる: LLMはプログラム(つまり、インタプリタとして振舞う)を純粋にプログラミング言語の形式的意味論に基づいて実行できるか?
本稿では, 命令型言語IMPを用いて, 小ステップ操作意味論 (SOS) と書き直しに基づく操作意味論 (K-semantics) によって定式化されている問題について検討する。
本稿では,Human-Written,LLM-Translated,Fuzzer-Generatedの3つの評価セットを提案する。
論文 参考訳(メタデータ) (2025-10-03T18:23:26Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams [4.917265821383127]
実世界のシナリオの冗長性に富む会話の性質を反映した,ライブストリームから派生した最初の音声長文データセットを構築した。
我々は、これらのタスクにおける長文理解能力を評価するために、人気のあるLLMと特殊手法の両方を評価した。
本研究は,現在の手法の限界を浮き彫りにし,長文理解の改善に向けた今後の方向性を示唆するものである。
論文 参考訳(メタデータ) (2025-04-24T08:27:48Z) - Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision [83.0622534215881]
本研究は, 聴覚, 視覚, 言語的モダリティを統合した, 産業レベルのOmni-Modal Large Language Model (LLM) パイプラインを提案する。
まず、様々なエンコーダ-LLM-デコーダアーキテクチャの柔軟な構成を可能にするモジュラーフレームワークです。
第二に、最先端のビジョン言語モデルであるQwen2.5-VLのオーディオ言語アライメントを事前訓練する軽量なトレーニング戦略である。
第三に、様々な現実世界のシナリオから高品質な音声テキストデータを生成するオーディオ合成パイプライン。
論文 参考訳(メタデータ) (2025-02-26T17:26:36Z) - TriSum: Learning Summarization Ability from Large Language Models with Structured Rationale [66.01943465390548]
本稿では,大規模言語モデルのテキスト要約能力を,コンパクトで局所的なモデルに抽出するフレームワークであるTriSumを紹介する。
本手法は,様々なベンチマーク上での局所モデル性能を向上させる。
また、要約の合理性に関する洞察を提供することで、解釈可能性も向上する。
論文 参考訳(メタデータ) (2024-03-15T14:36:38Z) - IXA/Cogcomp at SemEval-2023 Task 2: Context-enriched Multilingual Named
Entity Recognition using Knowledge Bases [53.054598423181844]
3つのステップからなる新しいNERカスケードアプローチを提案する。
我々は、細粒度および新興物質を正確に分類する上で、外部知識基盤の重要性を実証的に示す。
本システムは,低リソース言語設定においても,マルチコネラ2共有タスクにおいて頑健な性能を示す。
論文 参考訳(メタデータ) (2023-04-20T20:30:34Z) - SLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding
Tasks [88.4408774253634]
音声言語理解(SLU)タスクは、音声研究コミュニティで何十年にもわたって研究されてきた。
SLUタスクベンチマークはそれほど多くはなく、既存のベンチマークの多くは、すべての研究者が自由に利用できないデータを使っている。
最近の研究は、いくつかのタスクにそのようなベンチマークを導入し始めている。
論文 参考訳(メタデータ) (2022-12-20T18:39:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。