論文の概要: GeminiPainter's sequence-formed pipeline comprised of perception, cognition, planning, and action stages
- arxiv url: http://arxiv.org/abs/2608.00829v1
- Date: Sat, 01 Aug 2026 19:11:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.950699
- Title: GeminiPainter's sequence-formed pipeline comprised of perception, cognition, planning, and action stages
- Title(参考訳): GeminiPainterの配列形成パイプラインは知覚、認知、計画、行動段階から構成される
- Abstract要約: 本稿では、リアルタイム顔検出、AIベースのスケッチ生成、ロボット描画を組み合わせた自律型ロボット肖像画生成システムを提案する。
このシステムはビデオフレームをキャプチャし、顔領域を抽出し、Gemini Vision APIを使用して最小限の単行スケッチに変換し、グラフベースの経路計画を通じてストロークオーダーを最適化し、6-DoF協調マニピュレータ上でスムーズな軌跡を実行する。
- 参考スコア(独自算出の注目度): 2.460614761319643
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present an autonomous robotic portrait-generation system combining real-time face detection, AI-based sketch generation, and robotic drawing. The system captures video frames, extracts facial regions, converts them into minimalist single-line sketches using the Gemini Vision API, optimizes stroke order through graph-based path planning, and executes smooth trajectories on a 6-DoF collaborative manipulator. This perception-cognition-action pipeline integrates computer vision, neural artistic abstraction, motion optimization, and robot control. User ratings on a 5-point scale were high for sketch quality 4.33, perceived execution 4.53, and user experience 4.65, indicating recognizable, appealing, and engaging robotic portraits.
- Abstract(参考訳): 本稿では、リアルタイム顔検出、AIベースのスケッチ生成、ロボット描画を組み合わせた自律型ロボット肖像画生成システムを提案する。
このシステムはビデオフレームをキャプチャし、顔領域を抽出し、Gemini Vision APIを使用して最小限の単行スケッチに変換し、グラフベースの経路計画を通じてストロークオーダーを最適化し、6-DoF協調マニピュレータ上でスムーズな軌跡を実行する。
この知覚認識アクションパイプラインは、コンピュータビジョン、神経芸術的抽象化、運動最適化、ロボット制御を統合している。
5点スケールでのユーザ評価は、スケッチ品質4.33、実行4.53、ユーザエクスペリエンス4.65で高く、認識しやすく、魅力的で、ロボットの肖像画を魅力的なものにしている。
関連論文リスト
- Robot Learning to Communicate through Projected Visual Abstractions [4.725793709831403]
人間は、影、人形、反射など、身体の抽象を通して日常的にコミュニケーションする。
ソフトスキンに適合した21自由度手と学習されたシャドウ自己モデルを用いて,ダイナミックなシャドウ表現が可能なロボットシステムを提案する。
その結果、ロボットが自身の投影された視覚的抽象化を制御し、コミュニケーションやビジュアルなストーリーテリングを行うためのフレームワークが確立された。
論文 参考訳(メタデータ) (2026-07-24T15:52:36Z) - IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction [49.85080754272514]
ISTOMPAは、学習されたピクセルのダイナミックスモデルとモデルベースの計画を統合する、ロボット油彩画システムである。
ISTOMPAは低レベルの力制御、学習力学モデル、高レベルのクローズドループ計画を統合し、ロボットのセルフプレイから学習する。
論文 参考訳(メタデータ) (2026-03-31T06:33:59Z) - Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation [46.24300848525144]
Kinema4Dは、ロボットと世界の相互作用を、ロボットの正確な4D表現、すなわち環境反応の生成4Dモデリングに分解する、アクションコンディショナブルな新しい4D生成ロボットシミュレータである。
初めてゼロショット転送能力を示し、次世代のエンボディドシミュレーションを進めるための高忠実度基盤を提供する。
論文 参考訳(メタデータ) (2026-03-17T15:36:38Z) - Robotic Grasping and Placement Controlled by EEG-Based Hybrid Visual and Motor Imagery [64.82869118243723]
本稿では,脳波に基づく視覚・運動画像(VI/MI)とロボット制御を統合し,リアルタイム・意図駆動型把握・配置を実現するフレームワークを提案する。
このシステムは、BCI駆動のロボット工学の約束に感銘を受けて、オフラインで事前訓練されたデコーダをゼロショットで展開することによって、ニューラルネットワークを物理的制御でブリッジする。
論文 参考訳(メタデータ) (2026-03-03T17:41:42Z) - VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation [54.81449795163812]
時間的コヒーレントなロボット操作のための4次元認識型汎用VLAモデルを開発した。
視覚的特徴を抽出し, 4次元埋め込みのための3次元位置への1次元時間埋め込みを行い, クロスアテンション機構による統一視覚表現に融合する。
この枠組みの中で、デザインされた視覚アクションは、空間的に滑らかで時間的に一貫したロボット操作を共同で行う。
論文 参考訳(メタデータ) (2025-11-21T12:26:30Z) - 4-Doodle: Text to 3D Sketches that Move! [60.89021458068987]
4-Doodleは、テキストから動的3Dスケッチを生成するための、最初のトレーニング不要のフレームワークである。
提案手法は時間的にリアルかつ構造的に安定な3次元スケッチアニメーションを生成し,忠実度と可制御性の両方において既存のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-29T09:33:29Z) - UMA: Ultra-detailed Human Avatars via Multi-level Surface Alignment [63.772978308636006]
多視点ビデオから鮮明なダイナミック性とフォトリアリスティックな外観を持つアニマタブルな人間のアバターモデルを学ぶことは、コンピュータグラフィックスとビジョンにおいて重要な基礎研究課題である。
本稿では,基本的な2次元ビデオポイントトラッカーからのガイダンスを用いて,潜時変形モデルを提案し,アニマタブルキャラクタの3次元変形を監督する。
提案手法は,先行技術に比べてレンダリング品質と幾何学的精度が大幅に向上したことを示す。
論文 参考訳(メタデータ) (2025-06-02T15:42:33Z) - SketcherX: AI-Driven Interactive Robotic drawing with Diffusion model and Vectorization Techniques [26.240518216121487]
SketcherXは、対話型人間ロボットエンゲージメントによる人物像のパーソナライズのための新しいロボットシステムである。
アナログ印刷技術に頼っている従来のロボットアートシステムとは異なり、SketcherXは顔画像をキャプチャして処理し、独特な人間のような芸術スタイルでベクター化された描画を生成する。
論文 参考訳(メタデータ) (2024-09-04T02:20:22Z) - Learning Orbitally Stable Systems for Diagrammatically Teaching [14.839036866911089]
ダイアグラム教育はロボットが新しいスキルを身につけるためのパラダイムであり、ユーザーはロボットの動きを形作るシーンの画像に2Dスケッチを提供する。
本研究では,ロボットに表面への接近を指示し,その上でサイクリック動作を追従する問題に取り組む。ロボットのカメラからの画像に対して,ユーザが提供する1つのスケッチによって,動きのサイクルを任意に指定することができる。
論文 参考訳(メタデータ) (2023-09-19T04:03:42Z) - From Scratch to Sketch: Deep Decoupled Hierarchical Reinforcement
Learning for Robotic Sketching Agent [20.406075470956065]
我々は,ロボットスケッチの問題を階層的強化学習の深層化として定式化する。
脳卒中ベースのレンダリングと運動制御の2つのポリシーを独立に学習し、描画のサブタスクを実現する。
実験の結果,2つの政策がサブタスクの学習に成功し,目標画像のスケッチに協力することが確認された。
論文 参考訳(メタデータ) (2022-08-09T15:18:55Z) - Neural Scene Representation for Locomotion on Structured Terrain [56.48607865960868]
本研究では,都市環境を横断する移動ロボットの局所的な地形を再構築する学習手法を提案する。
搭載されたカメラとロボットの軌道からの深度測定のストリームを用いて、ロボットの近傍の地形を推定する。
ノイズ測定とカメラ配置の盲点からの大量の欠落データにもかかわらず,シーンを忠実に再構築する3次元再構成モデルを提案する。
論文 参考訳(メタデータ) (2022-06-16T10:45:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。