論文の概要: Let RGB Be the Language of Vision
- arxiv url: http://arxiv.org/abs/2607.12450v1
- Date: Tue, 14 Jul 2026 07:25:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.075963
- Title: Let RGB Be the Language of Vision
- Title(参考訳): RGBをビジョン言語にしよう
- Abstract要約: この研究は視覚モデルに統一的な定式化を導入し、自然画像以外の様々な視覚情報をRGB画像として表現する。
一般的な視覚タスクは、一般的なRGBからRGBまでの画像編集問題に変換できる。
RINOは、タスク固有の微調整なしで、一般的な画像編集バックボーンに基づいており、堅牢で競争力のあるゼロショットパフォーマンスを示している。
- 参考スコア(独自算出の注目度): 62.25975815664782
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work introduces a unified formulation for vision models, where diverse forms of visual information beyond natural images, such as masks, depth maps, and other structured visual signals, are all represented as RGB images, while general visual tasks can be converted into a common RGB-to-RGB image editing problem. In this paradigm, different types of visual information internally share the same encoding and decoding architecture and parameters as natural images, enabling a single model to transfer across tasks through a unified visual interface, in a way analogous to how language models operate over text. We refer to this formulation as RGB In and RGB Out (RINO). Built upon a generic image editing backbone without task-specific fine-tuning, RINO demonstrates robust and competitive zero-shot performance on both dense understanding tasks such as segmentation and depth estimation (where we unify outputs as RGB), and dense-conditioned generation tasks such as pose-to-image generation (where we unify inputs as RGB). We hope this study provides useful insights toward general unified vision-language systems, where diverse visual tasks can be expressed, interpreted, and solved through a shared visual language. Code is available at https://github.com/yangtiming/RINO.
- Abstract(参考訳): マスク,奥行きマップ,その他の構造化された視覚信号など,自然画像以外の多様な視覚情報をすべてRGB画像として表現し,一般的な視覚タスクをRGBからRGBへの共通画像編集問題に変換する。
このパラダイムでは、異なる種類の視覚情報が内部的に、自然言語と同じエンコーディングとデコードアーキテクチャとパラメータを共有し、単一のモデルが統一されたビジュアルインターフェースを介してタスクを移動できるようにする。
この定式化を RGB In と RGB Out (RINO) と呼ぶ。
RINOは、タスク固有の微調整なしで、一般的な画像編集バックボーンに基づいて、セグメンテーションや深さ推定(RGBとして出力を統一する)のような高密度な理解タスクと、ポーズ・ツー・イメージ生成(RGBとして入力を統一する)のような高密度な条件付き生成タスクの両方において、堅牢で競争力のあるゼロショット性能を示す。
本研究は,多種多様な視覚タスクを共通視覚言語で表現し,解釈し,解決できる汎用視覚言語システムに対する有用な洞察を提供することを願っている。
コードはhttps://github.com/yangtiming/RINO.comで入手できる。
関連論文リスト
- Vision as Unified Multimodal Generation [73.31482353559736]
SenseNova-Visionは、テキスト、画像、混合ターゲットにまたがるコンピュータビジョンの命令応答コーパスである。
このモデルは、検出、OCR、キーポイント推定、セグメンテーション、深さ推定、表面正規予測、ポイントマップ、カメラポーズ推定を含む幅広い視覚タスクをカバーする。
実験により、単一の統一モデルが、構造化された視覚的理解、密集した幾何学的予測、セグメンテーション、多視点視覚幾何学にわたる主要なタスク特殊化システムと一致できることが示されている。
論文 参考訳(メタデータ) (2026-07-07T17:58:33Z) - UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation [51.31795451147935]
本稿では,単一のピクセル間拡散フレームワーク内での視覚的理解と視覚的生成を支援する統合生成モデルを提案する。
私たちのゴールは、モデル、タスク、表現の3つの軸に沿った統一を達成することです。
画像間合成と画像間理解の実験は、強いモーダルアライメントを示す。
論文 参考訳(メタデータ) (2025-11-21T03:02:10Z) - HDBFormer: Efficient RGB-D Semantic Segmentation with A Heterogeneous Dual-Branch Framework [0.0]
屋内シーンのRGB-Dセマンティックセグメンテーションにおいて、RGB画像からのリッチな色情報と奥行き画像からの空間的距離情報とを効果的に統合することが重要な課題である。
本稿では,HDBFormerと呼ばれる新しい異種二分岐フレームワークを提案する。
リッチディテールを含むRGB画像に対しては,局所的特徴とグローバルな特徴を抽出するために,基本および詳細エンコーダを併用する。
より単純な深度画像に対して,より少ないパラメータで効率的に深度特徴を抽出する軽量階層エンコーダLDFormerを提案する。
論文 参考訳(メタデータ) (2025-04-18T09:29:46Z) - Diffusion-based RGB-D Semantic Segmentation with Deformable Attention Transformer [11.648973329789973]
本稿では,RGB-Dセマンティックセグメンテーション問題に対処する拡散型フレームワークを提案する。
本研究では,デフォルマブルアテンション変換器をエンコーダとして利用し,奥行き画像から特徴を抽出することにより,デフォルマブルアテンション変換器の特性を効果的に把握できることを実証する。
論文 参考訳(メタデータ) (2024-09-23T15:23:01Z) - SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval [82.51117533271517]
以前はRGBビデオをエンコードするだけで高レベルのセマンティックな特徴が得られていた。
既存のRGBベースの手話検索作業は、エンドツーエンドのトレーニングに埋め込まれた濃密な視覚データによる膨大なメモリコストに悩まされる。
本稿では,Semantically Enhanced Dual-Streamという手話表現フレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-23T11:31:11Z) - In-Context Translation: Towards Unifying Image Recognition, Processing, and Generation [44.26537443476901]
視覚認識,低レベル画像処理,条件付き画像生成を統合化するためのICT(In-Context Translation)を提案する。
ICTは、異なるタスクのトレーニングを一般的なインコンテキスト学習に標準化する。
実験では、ICTは10の視覚タスクを統一し、それぞれのベンチマークで印象的なパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-04-15T10:05:36Z) - DFormer: Rethinking RGBD Representation Learning for Semantic
Segmentation [76.81628995237058]
DFormerは、RGB-Dセグメンテーションタスクの転送可能な表現を学ぶための新しいフレームワークである。
ImageNet-1Kから画像深度ペアを使用してバックボーンを事前トレーニングする。
DFormerは2つのRGB-Dタスクで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-09-18T11:09:11Z) - Semantic RGB-D Image Synthesis [22.137419841504908]
この問題に対処するために,意味的RGB-D画像合成を導入する。
しかし、現在のアプローチはユニモーダルであり、マルチモーダルデータには対応できない。
意味的レイアウトのモーダル非依存情報とモーダル依存情報とを分離したマルチモーダルデータのジェネレータを提案する。
論文 参考訳(メタデータ) (2023-08-22T11:16:24Z) - GeoVLN: Learning Geometry-Enhanced Visual Representation with Slot
Attention for Vision-and-Language Navigation [52.65506307440127]
我々は,ロバストなビジュアル・アンド・ランゲージナビゲーションのためのスロットアテンションに基づく幾何学的視覚表現を学習するGeoVLNを提案する。
我々はV&L BERTを用いて言語情報と視覚情報の両方を組み込んだクロスモーダル表現を学習する。
論文 参考訳(メタデータ) (2023-05-26T17:15:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。