論文の概要: Multi-Task Multi-Frame Visual Piano Transcription
- arxiv url: http://arxiv.org/abs/2608.03419v1
- Date: Tue, 04 Aug 2026 10:11:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.123235
- Title: Multi-Task Multi-Frame Visual Piano Transcription
- Title(参考訳): マルチタスクマルチフレームヴィジュアルピアノ転写
- Authors: Yonghyun Kim, Hoyeol Sohn, Juhan Nam, Alexander Lerch,
- Abstract要約: 本稿では,最初の完全なVisual Piano TranscriptionシステムであるV2N(Video to Notes)を紹介する。
共有時間バックボーンは、タスク固有のヘッドをオンセット、オフセット、キーホールド、ベロシティに供給する。
アブレーションは、マルチタスクの監視により、オフセット精度を改善しつつ、オフセットとベロシティの予測が可能になることを示している。
- 参考スコア(独自算出の注目度): 57.32059378506694
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-based piano transcription performs well on onset, pitch, and velocity, but the sustain pedal lets sound persist long after key release, so audio systems predict pedal-extended offsets rather than physical key release. Yet existing Visual Piano Transcription (VPT) systems focus on onset detection from short video windows, offset accuracy lags onset by a wide margin, and note-level velocity has not been reported. To address these gaps, we present V2N (Video to Notes), the first complete VPT system: a shared temporal backbone feeds task-specific heads for onset, offset, key hold, and velocity, jointly trained with per-frame supervision rather than only at the window center. Ablations show that multi-task supervision enables offset and velocity prediction while improving onset accuracy; longer temporal context yields further improvements. V2N sets new state-of-the-art results on PianoVAM and R3.
- Abstract(参考訳): オーディオベースのピアノの書き起こしは、オンセット、ピッチ、ベロシティでうまく機能するが、持続ペダルはキーリリース後ずっと音が持続するので、オーディオシステムは物理キーリリースではなくペダル拡張オフセットを予測する。
しかし、既存のVisual Piano Transcription (VPT)システムは、短いビデオウィンドウからのオンセット検出、オフセット精度のラグを広いマージンでオンセットし、ノートレベルの速度を報告していない。
これらのギャップに対処するために、最初の完全なVPTシステムであるV2N(Video to Notes)を提示する:共有の時間的バックボーンは、ウィンドウセンターだけでなく、フレーム単位の監督と共同で訓練された、オンセット、オフセット、キーホールド、ベロシティのためにタスク固有のヘッドを供給します。
アブレーションは、マルチタスクの監視により、オフセット精度を向上しつつ、オフセットとベロシティの予測が可能であることを示している。
V2N は PianoVAM と R3 に新しい最先端の結果をセットする。
関連論文リスト
- VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies [58.65913948991329]
正確な低レイテンシVLAポリシーのためのビジュアル中間推論フレームワークであるVISUALTHINK-VLAを提案する。
私たちのブートストラップ哲学は、効果的な視覚的思考でアクションを導くことです。
これは、デコードオーバーヘッドを回避しながら空間的精度を保った、コンパクトなビジュアル・エビデンスインターフェースを通じてアクション予測をブートストラップする。
論文 参考訳(メタデータ) (2026-05-28T14:36:53Z) - Fine-Tuning MIDI-to-Audio Alignment using a Neural Network on Piano Roll and CQT Representations [2.3249139042158853]
本稿では,人間のピアノ演奏の音声録音と,それに対応するゆるやかなMIDIファイルとを同期させるニューラルネットワーク手法を提案する。
提案手法は,業界標準の動的時間ワープ法(DTW)よりも最大20%高いアライメント精度を実現する。
論文 参考訳(メタデータ) (2025-06-27T13:59:50Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - Exploring Temporally-Aware Features for Point Tracking [58.63091479730935]
Chronoは、時間的認識を組み込んだポイントトラッキング用に特別に設計された機能バックボーンである。
Chronoは、TAP-Vid-DAVISとTAP-Vid-Kineticsデータセットの洗練されたフリー設定で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-01-21T15:39:40Z) - FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding [25.21011724370177]
テキスト誘導ビデオ時間グラウンド(VTG)は、テキスト記述に基づいて、関連セグメントを未編集ビデオにローカライズすることを目的としている。
本稿では,TFL(Temporal Feature Layering)モジュールとASR(Adaptive Score Refinement)モジュールを備えたフレームワークであるFlashVTGを紹介する。
FlashVTGは、Moment Retrieval(MR)とHighlight Detection(HD)の両方で広く採用されている4つのデータセット上で、最先端のパフォーマンスを達成する
論文 参考訳(メタデータ) (2024-12-18T02:23:33Z) - Pay Attention to the Keys: Visual Piano Transcription Using Transformers [0.0]
視覚ピアノ文字起こし(VPT)は、視覚情報のみからピアノ演奏の記号表現を得るタスクである。
本稿では、畳み込みニューラルネットワーク(CNN)に基づく従来の手法を超越した視覚変換器(ViT)に基づくVPTシステムを提案する。
提案システムは,PanoYTデータセットのオンセット予測とR3データセットのオンセットとオフセットの両方において,最先端の処理性能に優れることを示す。
論文 参考訳(メタデータ) (2024-11-13T21:31:12Z) - Temporal Pyramid Network for Action Recognition [129.12076009042622]
本稿では,2次元あるいは3次元のバックボーンネットワークに柔軟に統合可能な汎用時間ピラミッドネットワーク(TPN)を提案する。
TPNは、いくつかのアクション認識データセット上で、他の困難なベースラインよりも一貫して改善されている。
論文 参考訳(メタデータ) (2020-04-07T17:17:23Z) - Video Saliency Prediction Using Enhanced Spatiotemporal Alignment
Network [35.932447204088845]
ビデオ・サリエンシ予測に適した効果的な機能アライメント・ネットワーク(V)を開発した。
ネットワークは、隣接するフレームの特徴を粗い方法で参照フレームに整列させることを学ぶ。
提案したモデルはポスト処理なしでエンドツーエンドで訓練される。
論文 参考訳(メタデータ) (2020-01-02T02:05:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。