論文の概要: GOLF: Global Observation with Local Focus for Calibration-Aware Stereo Interaction Field Estimation
- arxiv url: http://arxiv.org/abs/2609.08607v1
- Date: Tue, 08 Sep 2026 11:42:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 16:11:08.304177
- Title: GOLF: Global Observation with Local Focus for Calibration-Aware Stereo Interaction Field Estimation
- Title(参考訳): GOLF: キャリブレーションを考慮したステレオ相互作用場推定のための局所焦点による地球観測
- Abstract要約: GOLFはHANDS@ECCV 2026におけるSHOW3Dインタラクションフィールド推定チャレンジの1位となるソリューションである。
同期型自我中心ステレオビューでは、21個の手関節のそれぞれから操作対象の最も近い点までの3Dベクトルを予測する。
GOLFは、密集したグローバルコンテキスト、局所的な手/オブジェクトのエビデンス、およびコモンフレームチャンカー線幾何学を組み合わせたものである。
- 参考スコア(独自算出の注目度): 27.294123089710038
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present GOLF, the first-place solution to the SHOW3D Interaction Field Estimation Challenge at HANDS@ECCV 2026. Given synchronized egocentric stereo views, the task is to predict a 3D vector from each of 21 hand joints to the closest point on the manipulated object. GOLF combines dense global context, locally sampled hand/object evidence, and common-frame Plücker-ray geometry. We adapt DINOv3 ViT-H+/16 with LoRA and trainable LayerNorm parameters, then jointly decode both interaction fields. Our primary model achieves an official score of 27.61 and a mean ADE of 27.96 mm on the hidden test set. An equal-weight ensemble with a complementary directly fine-tuned variant improves these results to an official score of 27.47 and a mean ADE of 27.82 mm, securing first place.
- Abstract(参考訳): GOLFはHANDS@ECCV 2026におけるSHOW3Dインタラクションフィールド推定チャレンジの1位となるソリューションである。
同期型自我中心ステレオビューでは、21個の手関節のそれぞれから操作対象の最も近い点までの3Dベクトルを予測する。
GOLFは、密集したグローバルコンテキスト、局所的な手/物証拠、およびコモンフレームのプルッカー線幾何学を組み合わせたものである。
我々は、DINOv3 ViT-H+/16をLoRAおよびトレーニング可能なLayerNormパラメータで適用し、その後、両方の相互作用場を共同でデコードする。
本モデルでは, 隠れテストセットの平均値が27.61, ADEが27.96mmであった。
補足的な微調整による等重量アンサンブルは、これらの結果を公式スコア27.47と平均ADE27.82mmに改善し、第1位を確保している。
関連論文リスト
- One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding [23.58705585303581]
クロス層エビデンスブリッジのための単一フォワードフレームワークであるInnerZoomを提案する。
結果は、InnerZoomがOSWorld-Gで64.7、UI-Visionで40.2、OSWorld-GRで73.1、MMBench-GUIで87.6を達成したことを示唆している。
論文 参考訳(メタデータ) (2026-06-29T10:20:39Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - SECOND-Grasp: Semantic Contact-guided Dexterous Grasping [60.1519218638742]
Second-Grasp (Semantic Contact-guided Dexterous Grasping) は、ロボットハンドが意味論的推論に基づいて把握戦略を調整できる統合されたフレームワークである。
我々のアプローチは、目に見えるカテゴリーと目に見えないカテゴリの両方で成功率を上げるために、一貫してベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-13T07:37:00Z) - Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas [0.0]
応用/専門的な知識は、最も簡単に監視できるベンチマークドメインでした。
形式的推論と自然科学は間違いなく最も難しいものだった。
Anthropic、Google-Gemini、Qwenでは、家族内プロファイルのクラスタリングが重要である。
論文 参考訳(メタデータ) (2026-04-21T12:44:47Z) - DICE: End-to-end Deformation Capture of Hand-Face Interactions from a Single Image [98.29284902879652]
DICEは1枚の画像から変形認識による手と顔のインタラクションを再現する最初のエンドツーエンド手法である。
ローカルな変形場とグローバルなメッシュ位置の回帰を2つのネットワークブランチに切り離すことが特徴である。
標準的なベンチマークと、精度と物理的妥当性の点から見れば、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-06-26T00:08:29Z) - G-HOP: Generative Hand-Object Prior for Interaction Reconstruction and Grasp Synthesis [57.07638884476174]
G-HOPは手-対象相互作用の前駆体である。
人手は骨格距離場を介して表現し、物体の符号付き距離場と整合した表現を得る。
この手動物体は、対話クリップからの再構成や人間のつかみ合成など、他の作業を容易にするための汎用的なガイダンスとして機能することを示す。
論文 参考訳(メタデータ) (2024-04-18T17:59:28Z) - EgoPoseFormer: A Simple Baseline for Stereo Egocentric 3D Human Pose Estimation [15.590340765703893]
ステレオ・エゴセントリックな人物ポーズ推定のためのトランスフォーマーモデルであるEgoPoseFormerを提案する。
本手法は,ヘッドマウントカメラの自己閉塞性や視野制限(FOV)による関節視認性を克服する主な課題を克服する。
本手法をステレオUnrealEgoデータセット上で評価し,従来の手法よりも大幅に優れていたことを示す。
論文 参考訳(メタデータ) (2024-03-26T20:02:48Z) - Spectrum AUC Difference (SAUCD): Human-aligned 3D Shape Evaluation [65.14552608167054]
既存の3Dメッシュ形状評価メトリクスは主に全体形状に焦点を当てるが、通常は局所的な詳細に敏感ではない。
これは、人間の知覚が全体像と詳細な形状の両方に注意を払っているため、人間の評価と矛盾する。
本研究では, スペクトル領域を曲線差下(SAUCD)と命名し, 人間の評価との整合性を示す分析指標を提案する。
論文 参考訳(メタデータ) (2024-03-03T21:35:00Z) - GliTr: Glimpse Transformers with Spatiotemporal Consistency for Online
Action Prediction [26.184988507662535]
多くのオンライン行動予測モデルは、完全なフレームを観察し、スニースと呼ばれるフレーム内の情報的サブリージョンを特定し、参加する。
本稿では,Glimpse Transformers (GliTr) を開発した。
論文 参考訳(メタデータ) (2022-10-24T21:10:34Z) - HandsFormer: Keypoint Transformer for Monocular 3D Pose Estimation
ofHands and Object in Interaction [33.661745138578596]
単色画像からの密接な相互作用で両手の3次元ポーズを推定する頑健で正確な手法を提案する。
本手法は, 両手関節の電位2d位置をヒートマップの極値として抽出することから始まる。
これらの位置の外観と空間エンコーディングを変圧器への入力として使用し、注意メカニズムを利用して関節の正しい構成を整理します。
論文 参考訳(メタデータ) (2021-04-29T20:19:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。