論文の概要: From Pixels to Words -- Towards Native One-Vision Models at Scale
- arxiv url: http://arxiv.org/abs/2605.28820v1
- Date: Wed, 27 May 2026 17:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:56.273588
- Title: From Pixels to Words -- Towards Native One-Vision Models at Scale
- Title(参考訳): ピクセルからワードへ - スケールでのネイティブなワンビジョンモデルに向けて
- Authors: Haiwen Diao, Jiahao Wang, Penghao Wu, Yuhao Dong, Yuwei Niu, Yue Zhu, Zhongang Cai, Weichen Fan, Linjun Dai, Silei Wu, Xuanyu Zheng, Mingxuan Li, Yuanhan Zhang, Bo Li, Hanming Deng, Huchuan Lu, Quan Wang, Lei Yang, Lewei Lu, Dahua Lin, Ziwei Liu,
- Abstract要約: 現在の視覚モデル(VLM)は、通常、複数の段階のアライメントを通して別々の画像エンコーダと言語デコーダを縫合する。
我々は,クロスフレームとピクセルワード対応をエンドツーエンドに学習するネイティブ基盤モデルNEO-ovを紹介する。
NEO-ovは、細粒度の視覚知覚に優れながら、モジュラーとのギャップをかなり狭めている。
- 参考スコア(独自算出の注目度): 122.87026673966544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current vision-language models (VLMs) typically stitch together separate image encoders and language decoders via multi-stage alignment, a modular framework that inevitably fragments pixel-level signals across frames and scatters early pixel-word interactions. In parallel, native VLMs, despite impressive performance on single images, remain largely unexplored in multi-image, video understanding, and spatial intelligence. Hence, we introduce NEO-ov, a native foundation model that learns cross-frame and pixel-word correspondence end-to-end, without any external encoders, auxiliary adapters, or post-hoc fusion. By eliminating module boundaries entirely, NEO-ov enables fine-grained and unified spatiotemporal modeling to emerge natively inside the model. Notably, NEO-ov largely narrows the gap to modular counterparts while excelling at fine-grained visual perception, validating that native "one-vision" architectures are not only feasible but competitive at scale. Beyond empirical performance, we unveil systematic architectural analyses and detailed training recipes to facilitate subsequent native multimodal modeling. Our code and models are publicly available at: https://github.com/EvolvingLMMs-Lab/NEO.
- Abstract(参考訳): 現行の視覚言語モデル(VLM)は、多段階アライメント(多段階アライメント)によって分離された画像エンコーダと言語デコーダを縫い合わせるのが一般的である。
平行して、単一画像上での優れたパフォーマンスにもかかわらず、ネイティブなVLMは、主にマルチイメージ、ビデオ理解、空間知性において探索されていない。
そこで我々は,外部エンコーダや補助アダプタ,あるいはポストホック融合を使わずに,クロスフレームおよびピクセルワード対応をエンドツーエンドに学習するネイティブ基盤モデルNEO-ovを紹介する。
モジュール境界を完全に排除することにより、NEO-ovはモデル内部にネイティブに現れる微細で統一された時空間モデリングを可能にする。
特に、NEO-ovは、モジュラーとのギャップを大幅に狭めながら、きめ細かい視覚的認識に優れており、ネイティブの"ワンビジョン"アーキテクチャは、実現可能であるだけでなく、大規模に競合するものであることを証明している。
経験的性能の他に、アーキテクチャ解析の体系化や、その後のネイティブマルチモーダルモデリングを促進するための詳細なトレーニングレシピも紹介する。
私たちのコードとモデルは、https://github.com/EvolvingLMMs-Lab/NEO.comで公開されています。
関連論文リスト
- Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation [108.23557570345356]
Tuna-2はネイティブな統一マルチモーダルモデルであり、ピクセルの埋め込みに基づいて視覚的理解と生成を行う。
実験により、Tuna-2はマルチモーダルベンチマークで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-04-27T17:59:56Z) - From Pixels to Words -- Towards Native Vision-Language Primitives at Scale [77.93798335498703]
私たちは、第一原理から構築されたVLM(Vision-Language Models)の新たなファミリーであるNEOを立ち上げました。
NEOは、密集したモノリシックモデル内で視覚言語間の衝突を緩和しながら、スクラッチから視覚知覚を効率的に発展させる。
私たちのコードとモデルは、https://github.com/EvolvingLMMs-Lab/NEO.comで公開されています。
論文 参考訳(メタデータ) (2025-10-16T17:59:58Z) - MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer [90.72238747690972]
マルチモーダルな大規模言語モデルのためのシンプルでスケーラブルな統合フレームワークであるManzanoを紹介します。
単一の視覚エンコーダは、画像からテキストへの理解のための連続的な埋め込みを生成する2つのアダプタと、テキストから画像への生成のための離散トークンを提供する。
統合自己回帰LDMはテキストと画像トークンの形式で高レベルのセマンティクスを予測し、補助拡散デコーダで画像トークンをピクセルに変換する。
論文 参考訳(メタデータ) (2025-09-19T17:58:00Z) - Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space [9.327655601475605]
共有画像埋め込み空間における画像理解,生成,編集を統一する新しいアーキテクチャであるNexus-Genを提案する。
自己回帰埋め込み予測における過度なエラーの蓄積を軽減するため,新しい自己回帰戦略を提案する。
Nexus-Genは、画像理解、生成、編集タスクにまたがる評価ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-04-30T06:30:48Z) - Universal Sparse Autoencoders: Interpretable Cross-Model Concept Alignment [6.614005142754584]
ユニバーサルスパースオートエンコーダ(英: Universal Sparse Autoencoders、USAEs)は、複数のディープニューラルネットワークにまたがる解釈可能な概念を明らかにするためのフレームワークである。
USAEは、複数のモデルの内部アクティベーションを一度に再構築し解釈できる普遍的な概念空間を学ぶ。
論文 参考訳(メタデータ) (2025-02-06T02:06:16Z) - Harnessing Frozen Unimodal Encoders for Flexible Multimodal Alignment [16.733970553781887]
最近の知見は、よく訓練された単調エンコーダのセマンティックな類似性が高いことを示唆している。
凍結したユニモーダルエンコーダを用いて視覚と言語を協調する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-28T17:57:32Z) - Mono-ViFI: A Unified Learning Framework for Self-supervised Single- and Multi-frame Monocular Depth Estimation [11.611045114232187]
最近の方法では、既存のカメラビュー間でのみビュー合成が行われており、ガイダンスが不十分である。
フローベースビデオフレーム作成(VFI)により、より仮想的なカメラビューを合成しようと試みる。
多フレーム推論では、MaryDepthのような明示的な幾何ベースのメソッドで発生する動的オブジェクトの問題を横取りするために、機能融合パラダイムに戻ります。
シングルフレームとマルチフレームの奥行きを双方向に接続するために,Mono-ViFIという自己教師型学習フレームワークを構築した。
論文 参考訳(メタデータ) (2024-07-19T08:51:51Z) - Moonshot: Towards Controllable Video Generation and Editing with
Multimodal Conditions [94.03133100056372]
Moonshotは、画像とテキストのマルチモーダル入力を同時に処理する新しいビデオ生成モデルである。
モデルは、パーソナライズされたビデオ生成、画像アニメーション、ビデオ編集など、様々な生成アプリケーションに容易に再利用できる。
論文 参考訳(メタデータ) (2024-01-03T16:43:47Z) - Language Models are General-Purpose Interfaces [109.45478241369655]
本稿では,様々な基礎モデルに対する汎用インタフェースとして言語モデルを提案する。
事前訓練されたエンコーダのコレクションは、様々なモダリティ(ビジョンや言語など)を知覚する
インタフェースとモジュールエンコーダを協調的に事前学習するための半因果言語モデリング手法を提案する。
論文 参考訳(メタデータ) (2022-06-13T17:34:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。