論文の概要: Sparse-View Interpretable 3D Animal Behavior Representations for Neural Encoding and Decoding
- arxiv url: http://arxiv.org/abs/2609.36217v2
- Date: Wed, 30 Sep 2026 02:10:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.110211
- Title: Sparse-View Interpretable 3D Animal Behavior Representations for Neural Encoding and Decoding
- Title(参考訳): ニューラルエンコーディングとデコードのためのスパースビュー解釈可能な3次元動物行動表現
- Abstract要約: 本稿では,映像から行動表現を抽出するフレームワークであるSABLEを提案する。
SABLEは、明示的な3D潜伏構造を学習しながら、非常にまばらな視点から3D動物の行動を再構築する。
本手法では,脳と行動の関係を研究するために,複雑な動作を捉えた3次元映像埋め込みを構築した。
- 参考スコア(独自算出の注目度): 4.787850102536708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A deeper understanding of brain function requires a precise, structured characterization of behavior. Yet, extracting behavioral representations from video in a form suitable for scientific analysis remains a fundamental challenge. Many prior studies represent behavior via pose estimation or nonlinear video embeddings. However, pose tracking discards rich information beyond predefined keypoints, while nonlinear video embeddings lack interpretability. We address this limitation with SABLE (Sparse-view Animal Behavior Latent Embeddings), a self-supervised framework that leverages a geometric inductive bias to learn behavior representations. By augmenting a multi-view transformer with priors from monocular depth and pose estimation, SABLE reconstructs 3D animal behavior from extremely sparse views while learning explicit 3D latent structure. Without ground-truth 3D labels, it reliably recovers 3D behavior from two-view videos, whereas state-of-the-art (SOTA) methods fail or yield degenerate solutions. Across the International Brain Lab and Cheese3D datasets, we demonstrate that SABLE learns 3D representations that match or exceed prior SOTA performance in neural encoding and decoding. Once pretrained across animals, SABLE serves as an off-the-shelf model that generalizes zero-shot to unseen animals without animal-specific calibration or retraining. Our method establishes 3D-aware video embeddings that capture complex behavior, opening new avenues for studying brain-behavior relationships.
- Abstract(参考訳): 脳機能のより深い理解には、行動の正確で構造化された特徴づけが必要である。
しかし、科学的分析に適した形で動画から行動表現を抽出することは、依然として根本的な課題である。
多くの先行研究は、ポーズ推定や非線形ビデオ埋め込みによる振る舞いを表現している。
しかし、ポーズトラッキングは、予め定義されたキーポイントを超えてリッチな情報を破棄する一方で、非線形ビデオ埋め込みは解釈可能性に欠ける。
SABLE(Sparse-view Animal Behavior Latent Embeddings)は,幾何学的帰納バイアスを利用して行動表現を学習する自己教師型フレームワークである。
SABLEは、単眼深度から先行した多視点変圧器を増設し、ポーズ推定を行うことにより、明示的な3D潜伏構造を学習しながら、極めてスパースな視点から3D動物の行動を再構築する。
地上の3Dラベルがなければ、2次元ビデオから確実に3Dの挙動を回復するが、最先端のSOTA(State-of-the-art)手法では解が得られない。
国際脳研究所とCheese3Dデータセット全体で、SABLEはニューラルエンコーディングとデコードにおいて、以前のSOTAのパフォーマンスと一致するか、あるいは超える3D表現を学習していることを実証した。
動物間で事前訓練されたSABLEは、動物固有のキャリブレーションや再訓練なしに、ゼロショットから見えない動物に一般化するオフ・ザ・シェルフモデルとして機能する。
本手法では,脳と行動の関係を研究するために,複雑な動作を捉えた3次元映像埋め込みを構築した。
関連論文リスト
- BEAST3D: Animal behavioral analysis and neural encoding from multi-view video via Gaussian splatting [6.870390707295292]
BEAST3Dは、ラベルなし、校正されたマルチビュービデオから3D視覚表現を学ぶ、自己教師付き事前学習フレームワークである。
BEAST3Dは、既知のカメラパラメータを直接条件付けすることで、4つのビューで3D構造を再構築する。
論文 参考訳(メタデータ) (2026-06-01T22:34:14Z) - BigMaQ: A Big Macaque Motion and Animation Dataset Bridging Image and 3D Pose Representations [38.868479054644354]
動物における動的・社会的行動の認識は、民族学、生態学、医学、神経科学の進歩に不可欠である。
近年のディープラーニングの進歩により、ビデオからの自動行動認識が可能になったが、3次元のポーズと形状を正確に再現することは、このプロセスには組み込まれていない。
$texttBigMaQ$は、動的な3Dポーズの表現を動物行動認識の学習タスクに統合する最初のデータセットを確立する。
論文 参考訳(メタデータ) (2026-02-23T14:21:15Z) - Advances and Trends in the 3D Reconstruction of the Shape and Motion of Animals [11.906309087751609]
動物の3D形状、ポーズ、動きを再構築することは、長年の課題である。
深層学習に基づく技術は、動的物体の形状と動きを非侵襲的に3D再構成することができる。
本稿は、この新興・成長研究分野の最新動向について調査する。
論文 参考訳(メタデータ) (2025-08-22T03:30:12Z) - 4D-Animal: Freely Reconstructing Animatable 3D Animals from Videos [15.063635374924209]
本報告では,ビデオからアニマタブルな3D動物を疎いキーポイントアノテーションを必要とせずに再構成する新しいフレームワークである4D-Animalを提案する。
提案手法では,2次元表現をSMALパラメータにマッピングする高密度特徴ネットワークを導入し,フィッティングプロセスの効率性と安定性を両立させる。
論文 参考訳(メタデータ) (2025-07-14T16:24:31Z) - UVRM: A Scalable 3D Reconstruction Model from Unposed Videos [68.34221167200259]
従来の2次元視覚データを用いた3D再構成モデルのトレーニングには、トレーニングサンプルのカメラポーズに関する事前知識が必要である。
UVRMは、ポーズに関する情報を必要とせず、単眼ビデオでトレーニングし、評価できる新しい3D再構成モデルである。
論文 参考訳(メタデータ) (2025-01-16T08:00:17Z) - Two-stage Synthetic Supervising and Multi-view Consistency
Self-supervising based Animal 3D Reconstruction by Single Image [30.997936022365018]
本研究では,2段階指導と自己監督訓練を組み合わせることで,動物による3Dスキャンの課題に対処する。
本研究は,鳥の3次元ディジタル化の定量的・定性的側面において,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-11-22T07:06:38Z) - Gait Recognition in the Wild with Dense 3D Representations and A
Benchmark [86.68648536257588]
既存の歩行認識の研究は、制約されたシーンにおける人間の体のシルエットや骨格のような2D表現によって支配されている。
本稿では,野生における歩行認識のための高密度な3次元表現の探索を目的とする。
大規模な3D表現に基づく歩行認識データセットGait3Dを構築した。
論文 参考訳(メタデータ) (2022-04-06T03:54:06Z) - Overcoming the Domain Gap in Neural Action Representations [60.47807856873544]
3Dポーズデータは、手動で介入することなく、マルチビュービデオシーケンスから確実に抽出できる。
本稿では,ニューラルアクション表現の符号化を,ニューラルアクションと行動拡張のセットと共に導くために使用することを提案する。
ドメインギャップを減らすために、トレーニングの間、同様の行動をしているように見える動物間で神経と行動のデータを取り替える。
論文 参考訳(メタデータ) (2021-12-02T12:45:46Z) - Unsupervised 3D Human Pose Representation with Viewpoint and Pose
Disentanglement [63.853412753242615]
優れた3次元ポーズ表現を学習することは、人間のポーズ関連タスクにとって重要である。
本稿では,3次元ポーズ表現を学習するために,新しいシームズ・デノナイズドオートエンコーダを提案する。
提案手法は,2つの本質的に異なるタスクに対して,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2020-07-14T14:25:22Z) - Chained Representation Cycling: Learning to Estimate 3D Human Pose and
Shape by Cycling Between Representations [73.11883464562895]
本稿では,教師なし,あるいは教師なしの学習を容易にする新しいアーキテクチャを提案する。
本研究では,非ペア画像と無注釈画像から3次元人物のポーズと形状を学習することにより,その手法を実証する。
人間をモデル化するための結果を示す一方で、私たちの定式化は一般的であり、他の視覚問題にも適用できる。
論文 参考訳(メタデータ) (2020-01-06T14:54:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。