論文の概要: Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates
- arxiv url: http://arxiv.org/abs/2608.21160v1
- Date: Fri, 21 Aug 2026 14:32:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.583436
- Title: Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates
- Title(参考訳): Human-JEPA: 知覚と予測を行う人間中心視覚モデル
- Abstract要約: 本稿では,人間中心の視覚モデルであるHuman-JEPAについて述べる。
凍結したプローブの下で、Human-JEPAは2.7倍のパラメータでポーズと人物の再識別を行う。
- 参考スコア(独自算出の注目度): 23.543882501644898
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machines that understand humans should perceive the present and anticipate the future. Existing human-centric vision model are pretrained on human images, set the state of the art in static dense perception, so motion and anticipation are out of reach. Here we present Human-JEPA, a human-centric vision model trained on video by anchored forecasting: dense targets are pinned to a frozen copy of the initialization, preventing a silent collapse of dense perception, and block masks are replaced by a pure past-to-future split, avoiding a five-point action tax and a seventeen-point re-identification collapse. Under frozen probes, Human-JEPA leads the pixel-anchored specialists on pose and person re-identification at 2.7 times fewer parameters, conceding high-resolution dense parsing, and its released predictor head is the first that does not degrade anticipation. A single safely adapted model thus serves both halves of understanding humans.
- Abstract(参考訳): 人間を理解する機械は、現在を理解し、未来を予測すべきである。
既存の人間中心の視覚モデルは、人間のイメージに基づいて事前訓練され、静的な密集感に最先端を設定できるため、動きと予測は到達できない。
密集したターゲットを凍結した初期化のコピーに固定し、密集した認識の静かな崩壊を防ぎ、ブロックマスクを純粋な過去から未来への分割に置き換え、五地点の行動税や17地点の再識別の崩壊を避ける。
凍結プローブの下で、Human-JEPAはピクセルアンコールの専門家を2.7倍のパラメータでポーズと人物を再同定し、高解像度の高密度解析を許し、放出された予測ヘッドは予想を下方修正しない最初のものである。
したがって、安全に適応された単一のモデルが、人間の理解のハーフとなる。
関連論文リスト
- WonderHuman: Hallucinating Unseen Parts in Dynamic 3D Human Reconstruction [63.666166249633385]
我々はWonderHumanをモノクラービデオから再構成し、高忠実なノベルビューの合成を行う。
提案手法は,与えられたモノクロ映像からフォトリアリスティックなレンダリングを生成する場合のSOTA性能を実現する。
論文 参考訳(メタデータ) (2025-02-03T04:43:41Z) - HINT: Learning Complete Human Neural Representations from Limited Viewpoints [69.76947323932107]
我々は、限られた視野角から詳細な人間のモデルを学習できるNeRFベースのアルゴリズムを提案する。
その結果,数個の視角からでも完全な人間の再構築が可能となり,性能は15%以上向上した。
論文 参考訳(メタデータ) (2024-05-30T05:43:09Z) - Multimodal Sense-Informed Prediction of 3D Human Motions [16.71099574742631]
本研究は,2つのモーダル情報に対して高忠実度を生成するマルチモーダル・インフォームド・モーション・予測手法を提案する。
視線情報は人間の意図と見なされ、動きとシーンの特徴が組み合わさって、世代を監督するために第3の意図に注意を向ける。
実世界の2つのベンチマークにおいて,提案手法は3次元人間のポーズと軌道予測の両方において最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-05-05T12:38:10Z) - Closely Interactive Human Reconstruction with Proxemics and Physics-Guided Adaption [64.07607726562841]
既存の人間再建アプローチは主に、正確なポーズの回復や侵入を避けることに焦点を当てている。
本研究では,モノクロ映像から密に対話的な人間を再構築する作業に取り組む。
本稿では,視覚情報の欠如を補うために,確率的行動や物理からの知識を活用することを提案する。
論文 参考訳(メタデータ) (2024-04-17T11:55:45Z) - EgoNav: Egocentric Scene-aware Human Trajectory Prediction [15.346096596482857]
ウェアラブルなコラボレーティブロボットは、転倒防止支援を必要とする人や、外骨格を装着する人を助ける。
このようなロボットは、自我中心の視覚に基づいて周囲のシーンに常に適応し、着用者の自我の動きを予測する必要がある。
本研究では、身体に装着したカメラとセンサーを利用して、複雑な環境下での人間の着用者の軌道を予測した。
論文 参考訳(メタデータ) (2024-03-27T21:43:12Z) - AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation [55.179287851188036]
人間のポーズと形状の復元のための新しいオールインワンステージフレームワークであるAiOSを、追加の人間検出ステップなしで導入する。
まず、画像中の人間の位置を探索し、各インスタンスのグローバルな機能をエンコードするために、人間のトークンを使用します。
そして、画像中の人間の関節を探索し、きめ細かい局所的特徴を符号化するジョイント関連トークンを導入する。
論文 参考訳(メタデータ) (2024-03-26T17:59:23Z) - HAP: Structure-Aware Masked Image Modeling for Human-Centric Perception [97.55089867970874]
本稿では,この課題に対する事前学習手法として,マスク付き画像モデリング(MIM)を導入する。
この知見に触発され、人間の前部である直感的な人体構造を事前学習に組み込む。
これにより、モデルが事前トレーニング中に身体構造情報に集中し、さまざまな人間中心の知覚タスクに実質的な利益をもたらす。
論文 参考訳(メタデータ) (2023-10-31T17:56:11Z) - Scene-aware Human Motion Forecasting via Mutual Distance Prediction [13.067687949642641]
本研究では,人体とシーン間の相互距離による人間とシーンの相互作用をモデル化する。
このような相互距離は局所的な動きと大域的な動きの両方を制約し、結果として全身的な動きは予測される。
2つのステップでパイプラインを構築し、まず将来の相互距離を予測し、次に将来の人間の動きを予測する。
論文 参考訳(メタデータ) (2023-10-01T08:32:46Z) - Robots That Can See: Leveraging Human Pose for Trajectory Prediction [30.919756497223343]
本研究では,人間中心環境における未来の軌道を予測するためのトランスフォーマーアーキテクチャを提案する。
結果として得られたモデルは、将来の人間の軌道予測に固有の不確実性を捉えている。
我々は,限られた履歴データを持つ新しいエージェントを誤りの主な要因として同定し,予測誤差を低減するために3次元骨格ポーズの相補的な性質を実証する。
論文 参考訳(メタデータ) (2023-09-29T13:02:56Z) - Intention-Conditioned Long-Term Human Egocentric Action Forecasting [14.347147051922175]
我々は、エゴセントリックビデオにおける長期的な行動予測タスクに対処する。
人間の意図を高レベルな情報として活用することで、我々のモデルは長期的により時間的な行動を予測することができると主張している。
この作品はCVPR@2022とECVV@2022 EGO4D LTA Challengeにランクインした。
論文 参考訳(メタデータ) (2022-07-25T11:57:01Z) - Long-term Human Motion Prediction with Scene Context [60.096118270451974]
人間の動きを予測するための新しい3段階フレームワークを提案する。
提案手法はまず,まず複数の人間の動作目標を抽出し,各目標に向けて3次元人間の動作経路を計画し,最後に各経路に続く3次元人間のポーズシーケンスを予測する。
論文 参考訳(メタデータ) (2020-07-07T17:59:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。