論文の概要: Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark
- arxiv url: http://arxiv.org/abs/2607.00710v1
- Date: Wed, 01 Jul 2026 09:58:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.837431
- Title: Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark
- Title(参考訳): インパクトのある自律運転データセットの作成:リサーチギャップからベンチマークへの戦略ガイド
- Abstract要約: 影響のあるデータセットの作成は診断から始まります。
ギャップ識別,演算子選択,センサスイート設計,アノテーション戦略にまたがる戦略的枠組みを精査する。
- 参考スコア(独自算出の注目度): 36.20617487466348
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Well-designed autonomous driving datasets have fundamentally shaped research progress, yet existing literature primarily describes what datasets contain rather than how to strategically design impactful ones. This is especially limiting for small and medium-sized labs and startups that cannot afford to misallocate scarce resources. We argue that impactful dataset creation begins with a diagnosis: whether a research question is blocked by a data problem or an evaluation problem, and proceeds by selecting the minimal data operator(s) that closes the resulting gap, recording new data only when no cheaper operator(s) suffices. We analyze the evolution of major autonomous driving (AD) datasets through this lens and distill a strategic framework spanning gap identification, operator choice, sensor suite design, and annotation strategy. We ground the framework in a running case study of our KITScenes dataset family. The datasets are available at: https://kitscenes.com/
- Abstract(参考訳): 十分に設計された自律走行データセットは、基本的に研究の進展を形作っているが、既存の文献では、影響のあるデータセットを戦略的に設計するよりも、データセットが含んでいるものを主に記述している。
これは特に、不足する資源を配置する余裕のない、中小規模のラボやスタートアップに限られている。
我々は、影響のあるデータセットの作成は、データ問題や評価問題によって研究課題がブロックされているかどうかの診断から始まり、結果のギャップを埋める最小のデータ演算子を選択して、より安価な演算子(s)が十分でない場合にのみ新しいデータを記録する。
我々は、このレンズを通して、主要な自律運転(AD)データセットの進化を分析し、ギャップ識別、オペレータの選択、センサースイートの設計、アノテーション戦略にまたがる戦略的枠組みを精査する。
このフレームワークは、KITScenesデータセットファミリーの実行ケーススタディに基づいています。
データセットは、https://kitscenes.com/で公開されている。
関連論文リスト
- A Differentiable Adversarial Framework for Task-Aware Data Subsampling [0.5371337604556311]
本稿では,データ削減を識別可能なエンドツーエンド学習問題に再構成する新しいパラダイムとして,ASSS(Antagonistic soft selection subsampling)フレームワークを紹介する。
この研究は、学習可能なコンポーネントとしてタスク認識データサブサンプリングを確立し、大規模なデータ学習を効果的に行うための原則的なソリューションを提供する。
論文 参考訳(メタデータ) (2026-01-05T13:10:09Z) - How Much Data are Enough? Investigating Dataset Requirements for Patch-Based Brain MRI Segmentation Tasks [74.21484375019334]
ディープニューラルネットワークを確実にトレーニングするには、大規模なデータセットへのアクセスが必要である。
モデル開発に関連する時間的・経済的コストを緩和するためには,満足度の高いモデルをトレーニングするために必要なデータの量を明確に理解することが重要である。
本稿では,パッチベースのセグメンテーションネットワークのトレーニングに必要なアノテートデータの量を推定するための戦略的枠組みを提案する。
論文 参考訳(メタデータ) (2024-04-04T13:55:06Z) - Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models [81.27391252152199]
大規模言語モデル(LLM)は、さまざまな自然言語ベンチマークで素晴らしいパフォーマンスを実現している。
本稿では、データセットの自動更新と、その有効性に関する体系的な分析を提案する。
1) 類似したサンプルを生成するための戦略を模倣すること,2) 既存のサンプルをさらに拡張する戦略を拡張すること,である。
論文 参考訳(メタデータ) (2024-02-19T07:15:59Z) - A Survey on Autonomous Driving Datasets: Statistics, Annotation Quality, and a Future Outlook [24.691922611156937]
複数の視点から265個の自律走行データセットを網羅的に検討した。
我々は、新しいデータセットを作成するためのガイドとしても使えるデータセットの影響を評価するための新しい指標を紹介します。
我々は、将来の自動運転データセットの現在の課題と開発動向について論じる。
論文 参考訳(メタデータ) (2024-01-02T22:35:33Z) - The PetShop Dataset -- Finding Causes of Performance Issues across Microservices [3.87228935312714]
本稿では,マイクロサービスベースのアプリケーションにおける根本原因分析を評価するためのデータセットを提案する。
データセットは、分散アプリケーションから5分間隔で出力されるレイテンシ、リクエスト、可用性メトリクスを含んでいる。
通常の運用メトリクスに加えて、データセットには68のインジェクトされたパフォーマンス問題が含まれており、レイテンシが増加し、システム全体の可用性が低下する。
論文 参考訳(メタデータ) (2023-11-08T16:30:12Z) - On Responsible Machine Learning Datasets with Fairness, Privacy, and Regulatory Norms [56.119374302685934]
AI技術の信頼性に関する深刻な懸念があった。
機械学習とディープラーニングのアルゴリズムは、開発に使用されるデータに大きく依存する。
本稿では,責任あるルーブリックを用いてデータセットを評価するフレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-24T14:01:53Z) - LargeST: A Benchmark Dataset for Large-Scale Traffic Forecasting [65.71129509623587]
道路交通予測はスマートシティのイニシアチブにおいて重要な役割を担い、ディープラーニングの力によって大きな進歩を遂げている。
しかし、現在の公開データセットで達成される有望な結果は、現実的なシナリオには適用できないかもしれない。
カリフォルニアで合計8,600のセンサーと5年間の時間カバレッジを含む、LargeSTベンチマークデータセットを紹介します。
論文 参考訳(メタデータ) (2023-06-14T05:48:36Z) - Going beyond research datasets: Novel intent discovery in the industry
setting [60.90117614762879]
本稿では,大規模なeコマースプラットフォームに展開する意図発見パイプラインを改善する手法を提案する。
ドメイン内データに基づく事前学習型言語モデルの利点を示す。
また,クラスタリングタスクの微調整中に,実生活データセットの会話構造(質問と回答)を利用するための最善の方法も考案した。
論文 参考訳(メタデータ) (2023-05-09T14:21:29Z) - A Survey of Learning on Small Data: Generalization, Optimization, and
Challenge [101.27154181792567]
ビッグデータの一般化能力を近似した小さなデータについて学ぶことは、AIの究極の目的の1つである。
この調査はPACフレームワークの下でのアクティブサンプリング理論に従い、小さなデータにおける学習の一般化誤差とラベルの複雑さを分析した。
効率的な小さなデータ表現の恩恵を受けるかもしれない複数のデータアプリケーションについて調査する。
論文 参考訳(メタデータ) (2022-07-29T02:34:19Z) - The Stanford Drone Dataset is More Complex than We Think: An Analysis of
Key Characteristics [2.064612766965483]
スタンフォード・ドローン・データセット(SDD)の特徴について論じる。
この不便さがユーザに提供する情報を減らし,パフォーマンスに与える影響を実証する。
私たちの意図は、今後このデータセットに適用されるパフォーマンスとメソッドを向上させると同時に、新しいユーザのためのデータセットの明らかでない特徴を明確化することにあります。
論文 参考訳(メタデータ) (2022-03-22T13:58:14Z) - Online Coreset Selection for Rehearsal-based Continual Learning [65.85595842458882]
継続的な学習では、後に再生されるトレーニング例(コアセット)のサブセットを格納し、破滅的な忘れを軽減します。
提案するオンラインコアセット選択(OCS, Online Coreset Selection)は, 各イテレーションにおいて最も代表的で情報性の高いコアセットを選択するシンプルで効果的な方法である。
提案手法は,過去のタスクに対して高親和性サンプルを選択しながら,目標データセットへのモデル適応を最大化し,破滅的忘れを直接的に抑制する。
論文 参考訳(メタデータ) (2021-06-02T11:39:25Z) - Differentially Private Simple Linear Regression [2.614403183902121]
差分プライバシーを満たす単純な線形回帰のアルゴリズムについて検討する。
小データセットに対する単純な線形回帰のための微分プライベートアルゴリズムの設計を考察する。
設定に適応するアルゴリズムのスペクトルの性能について検討する。
論文 参考訳(メタデータ) (2020-07-10T04:28:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。