論文の概要: Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images
- arxiv url: http://arxiv.org/abs/2608.01276v1
- Date: Sun, 02 Aug 2026 14:41:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.146601
- Title: Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images
- Title(参考訳): Astrolabe:非拘束画像からのフルボディーキャプチャのための球面マップ誘導拡散管
- Abstract要約: emphAstrolabeは、凍結した視点誘導マップ上に構築されたホスト可搬型アダプタである。
これは、ホストとすべてのペア化されたPuzzle-IOIジオメトリの両方で、報告されたすべてのイメージメトリクスを改善します。
また、4D-Dressの幾何学は全体として安定している。
- 参考スコア(独自算出の注目度): 9.119417883557547
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Full-body capture from unconstrained photographs requires global correspondence across arbitrary views, poses, crops, and occlusions. Yet pose, geometry, and foundation features estimated in this setting are too unreliable for dense matching or appearance transfer, while diffusion rectifiers and optimization pipelines expose no common interface for consuming such uncertain correspondence. Our insight is that correspondence need not be locally accurate: its coarse viewpoint and body layout can still organize how a diffusion prior adapts and guides reconstruction. We introduce \emph{Astrolabe}, a host-portable adapter built on frozen viewpoint-guided spherical maps (SPH). A fixed bounded transform converts SPH into a spatial noise shift, which is matched during prior adaptation and reused during downstream denoising or score-distillation guidance in both pipeline categories. When a rectifier exposes a reference router, the same target/reference SPH additionally supplies coarse compatibility scores to select native appearance features; router-free optimization uses only the shared shift path. Astrolabe therefore follows one SPH--shift--adapt--guide process without dense warping or a learned control branch. Across Puzzle-IOI and 4D-Dress, it improves all reported image metrics in both hosts and all paired Puzzle-IOI geometry metrics; image gains extend to rear views, while 4D-Dress geometry remains stable overall.
- Abstract(参考訳): 拘束されていない写真からフルボディで撮影するには、任意のビュー、ポーズ、作物、オクルージョンのグローバルな対応が必要である。
しかし、この設定で推定されるポーズ、幾何学、基礎的特徴は密集したマッチングや外観伝達には信頼できないが、拡散整合器や最適化パイプラインはそのような不確実な対応を消費する共通のインターフェースを公開しない。
我々の洞察では、対応は局所的に正確ではない:その粗い視点と身体のレイアウトは、拡散前の変化がどのように適応し、再構成を導くかを組織化することができる。
本稿では,凍結した視点誘導球面写像 (SPH) 上に構築されたホスト可搬型アダプタである \emph{Astrolabe} を紹介する。
固定有界変換は、SPHを空間ノイズシフトに変換するが、これは事前適応時に一致し、両方のパイプラインカテゴリにおいて下流の復調またはスコア蒸留誘導時に再利用される。
整流器が基準ルータを公開すると、同一のターゲット/参照SPHは、選択されたネイティブな外観特徴に対して粗い互換性スコアを供給し、ルータフリー最適化は共有シフトパスのみを使用する。
したがって、Astrolabeは高密度のワープや学習制御分岐を伴わない1つのSPHシフト-アダプティブ-ガイドプロセスに従う。
Puzzle-IOIと4D-Dress全体では、ホストとすべてのペアのPuzzle-IOIジオメトリで報告されたすべてのイメージメトリクスを改善している。
関連論文リスト
- FlexSplat: Flexible Feed-Forward 3D Gaussian Splatting without Point Cloud Correspondence [9.30167648098673]
我々は、新しいビュー合成(NVS)のためのフィードフォワードフレームワークであるFlexSplatを紹介した。
幾何学変換器はガウスデコーダと共同で訓練され、画像当たりのカメラパラメータと深さを予測する。
ShapeNet-SRN と Google Scanned Objects (GSO) では、FlexSplat のマッチングやアプローチが最先端のコンストラクタとして提案されている。
論文 参考訳(メタデータ) (2026-08-08T05:52:26Z) - SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept [0.0]
sasは、永続的な構造を通して環境を表現するセマンティックマップローカライゼーションフレームワークである。
sasは意味的アライメント、グラフのエビデンス、特徴安定性と地理的特異性、明示的な肯定的/矛盾的/未知の観察、曖昧な修正の完全性を無視する。
予備実験は実飛行航法を検証せず、むしろ、構造的意味幾何学が制御された横方向の摂動の下で位置を識別できることを実証している。
論文 参考訳(メタデータ) (2026-07-07T16:57:43Z) - Flow Map Denoisers: Traversing the Distortion-Perception Plane for Inverse Problems [48.501415601682815]
画像復元は基本的なトレードオフに直面している: エラーを最小限に抑える手法はぼやけた再構成を生み出し、知覚的品質を最大化する手法はシャープだが忠実でない画像を生み出す。
フローマップモデルは、歪み知覚フロンティアを連続的に分散する1パラメータのデノイザ群を暗黙的に定義する。
Plug-and-Playソルバ内では、同じメカニズムが一般的な逆問題にまで拡張され、知覚的アライメントとデータの一貫性のトレードオフを制御する。
論文 参考訳(メタデータ) (2026-06-18T05:15:43Z) - Surflo: Consistent 3D Surface Flow Model with Global State [57.57234680235885]
Surfloは、方向付けられた3次元表面点を、ノイズからフローマッチングを通じて独立して表面へ輸送することでデコードする。
独立なポイント単位の復号化に固有の局所的不整合を抑制するために、光度勾配を注入することにより、推定時間誘導項が近傍の点と相関する。
Surfloは、サーフェスメトリクスのフィードフォワードベースラインにマッチし、数百のビューを必要とする最適化ベースのメソッドよりも桁違いに高速に動作し、グローバルなラテントと任意の解像度のデコーディングを組み合わせた唯一のフィードフォワードアプローチである。
論文 参考訳(メタデータ) (2026-06-11T17:48:38Z) - Aligning Latent Geometry for Spherical Flow Matching in Image Generation [15.899488263212442]
知覚的内容と意味的内容は、主に方向によって運ばれ、半径がはるかに少ないことが示される。
一致したトレーニングでは、異なる画像トークンー間でクラス条件のImageNet-256 FIDを一貫して改善する。
論文 参考訳(メタデータ) (2026-05-14T17:59:37Z) - U-HNO: A U-shaped Hybrid Neural Operator with Sparse-Point Adaptive Routing for Non-stationary PDE Dynamics [7.23685260715089]
中心設計はスパースポイント適応ルーティング(SPAR)であるU字型ハイブリッドニューラル演算子U-HNOを提案する。
SPARは階層的なエンコーダ・ブートネック・デコーダのバックボーンに埋め込まれており、スキップ接続により両分岐とゲートが全ての解像度で動作する。
U-HNOは、相対的なL2とH1メトリクスの両方のタスクの大多数において、最先端のロールアウト精度を達成する。
論文 参考訳(メタデータ) (2026-05-13T04:00:43Z) - MoCapAnything V2: End-to-End Motion Capture for Arbitrary Skeletons [56.68975315643491]
本稿では,ビデオ・ツー・ローテーションとビデオ・ツー・ローテーションを共同で学習し,最適化する,最初のエンドツーエンドフレームワークを提案する。
本手法は, メッシュベースパイプラインの20倍の速度で, 回転誤差を17度から10度, 見えない骨格では6.54度に低減する。
論文 参考訳(メタデータ) (2026-04-30T17:16:38Z) - Keep It CALM: Toward Calibration-Free Kilometer-Level SLAM with Visual Geometry Foundation Models via an Assistant Eye [34.902300948471314]
CAL2Mは任意のVGFMと互換性のあるプラグイン・アンド・プレイのフレームワークである。
一定の物理的間隔の先行を利用するためだけに「補助眼」を使用する。
不正確な内因論による回転と翻訳の誤りを効果的に正すことができる。
論文 参考訳(メタデータ) (2026-04-16T08:58:57Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - IUP-Pose: Decoupled Iterative Uncertainty Propagation for Real-time Relative Pose Regression via Implicit Dense Alignment v1 [4.987163446489143]
相対的なポーズ推定は、SLAM、視覚的位置決め、および3D再構成に基本となる。
既存のRPR(Relative Pose Regression)メソッドでは,機能マッチングパイプラインの精度は向上するが,非微分可能なRANSACによるブロック勾配フローが実現されている。
IUP-Poseは、幾何駆動の分離された反復的フレームワークであり、暗黙の密接なアライメントを持つ。
論文 参考訳(メタデータ) (2026-03-20T04:04:52Z) - Geometry OR Tracker: Universal Geometric Operating Room Tracking [61.399734016038614]
手術室(OR)では、世界規模のマルチビュー3Dトラッキングは、外科医の行動認識のような下流のアプリケーションをサポートする。
カメラのキャリブレーションとRGB-Dの登録は常に信頼性が低く、幾何学的不整合が生じる。
我々は、不正確なキャリブレーションをスケール一貫性と幾何学的に整合したカメラ設定に修正する2段階パイプラインであるGeometry OR Trackerを紹介する。
論文 参考訳(メタデータ) (2026-02-28T09:21:21Z) - Loc$^2$: Interpretable Cross-View Localization via Depth-Lifted Local Feature Matching [80.57282092735991]
本稿では,高精度かつ解釈可能なクロスビューローカライズ手法を提案する。
地上画像の3自由度(DoF)のポーズを、その局所的な特徴と基準空中画像とをマッチングすることによって推定する。
実験では、クロスエリアテストや未知の向きといった挑戦的なシナリオにおいて、最先端の精度を示す。
論文 参考訳(メタデータ) (2025-09-11T18:52:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。