論文の概要: Neural-Driven Image Editing
- arxiv url: http://arxiv.org/abs/2507.05397v2
- Date: Fri, 08 Aug 2025 08:56:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-08-11 18:31:47.150424
- Title: Neural-Driven Image Editing
- Title(参考訳): ニューラル駆動画像編集
- Abstract要約: 従来の画像編集は手動のプロンプトに依存しており、運動制御や言語能力に制限のある個人には労働集約的でアクセスできない。
神経生理学的信号によるハンズフリー画像編集手法であるLoongXを提案する。
LoongXは、23,928の画像編集ペアの包括的なデータセットに基づいてトレーニングされた最先端の拡散モデルを使用している。
- 参考スコア(独自算出の注目度): 51.11173675034121
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Traditional image editing typically relies on manual prompting, making it labor-intensive and inaccessible to individuals with limited motor control or language abilities. Leveraging recent advances in brain-computer interfaces (BCIs) and generative models, we propose LoongX, a hands-free image editing approach driven by multimodal neurophysiological signals. LoongX utilizes state-of-the-art diffusion models trained on a comprehensive dataset of 23,928 image editing pairs, each paired with synchronized electroencephalography (EEG), functional near-infrared spectroscopy (fNIRS), photoplethysmography (PPG), and head motion signals that capture user intent. To effectively address the heterogeneity of these signals, LoongX integrates two key modules. The cross-scale state space (CS3) module encodes informative modality-specific features. The dynamic gated fusion (DGF) module further aggregates these features into a unified latent space, which is then aligned with edit semantics via fine-tuning on a diffusion transformer (DiT). Additionally, we pre-train the encoders using contrastive learning to align cognitive states with semantic intentions from embedded natural language. Extensive experiments demonstrate that LoongX achieves performance comparable to text-driven methods (CLIP-I: 0.6605 vs. 0.6558; DINO: 0.4812 vs. 0.4636) and outperforms them when neural signals are combined with speech (CLIP-T: 0.2588 vs. 0.2549). These results highlight the promise of neural-driven generative models in enabling accessible, intuitive image editing and open new directions for cognitive-driven creative technologies. Datasets and code will be released to support future work and foster progress in this emerging area.
- Abstract(参考訳): 従来の画像編集は手動のプロンプトに依存しており、運動制御や言語能力に制限のある個人には労働集約的でアクセスできない。
脳-コンピュータインタフェース(BCI)と生成モデルにおける最近の進歩を活用して,マルチモーダルな神経生理学的信号によって駆動されるハンズフリーな画像編集手法であるLoongXを提案する。
LoongXは23,928枚の画像編集ペアの包括的なデータセットに基づいてトレーニングされた最先端拡散モデルを使用しており、それぞれに同期脳波(EEG)、機能近赤外分光(fNIRS)、光胸腺撮影(PPG)、ユーザーの意図を捉えるヘッドモーション信号が組み合わされている。
これらの信号の不均一性に効果的に対処するために、LoongXは2つの重要なモジュールを統合する。
クロススケール状態空間(CS3)モジュールは情報モダリティ固有の特徴を符号化する。
動的ゲート融合(DGF)モジュールはこれらの機能を統一潜在空間に集約し、拡散変圧器(DiT)の微調整によってセマンティクスを編集する。
さらに、コントラスト学習を用いてエンコーダを事前訓練し、認識状態を組み込み自然言語からの意味的意図と整合させる。
広汎な実験により、LoongXはテキスト駆動手法(CLIP-I: 0.6605 vs. 0.6558; DINO: 0.4812 vs. 0.4636)に匹敵する性能を達成し、音声(CLIP-T: 0.2588 vs. 0.2549)と組み合わせると、それらを上回る性能を発揮する。
これらの結果は、アクセシブルで直感的な画像編集を可能にし、認知駆動型創造技術のための新しい方向を開くことにおける、ニューラル駆動生成モデルの約束を強調している。
データセットとコードは、将来の作業をサポートし、この新興領域の進歩を促進するためにリリースされます。
関連論文リスト
- MindAlign: Bridging EEG, Vision, and Language for Zero-Shot Visual Decoding [36.958608375007124]
脳信号からの視覚的復号化は、コンピュータビジョンと神経科学の交差において重要な課題である。
本稿では,脳波,視覚,テキスト表現の整合性を考慮した,脳波に基づく視覚的デコーディングのための3モーダルコントラストフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-23T11:23:21Z) - Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling? [18.529904812096024]
TABLeTは、事前訓練された2D自然言語オートエンコーダを用いてfMRIボリュームをトークン化する新しいアプローチである。
大規模なベンチマークでは、TABLeTは既存のモデルを複数のタスクで上回っている。
脳活動のスケーラブルで解釈可能な時間的モデリングのための,有望なアプローチが示唆された。
論文 参考訳(メタデータ) (2026-04-04T07:30:29Z) - End-to-End Training for Unified Tokenization and Latent Denoising [82.91537591286554]
統一トークン化と潜伏拡散のためのオートエンコーダアーキテクチャUNITEを提案する。
UNITEは、画像トークン化器と重量共有による潜伏ジェネレータの両方として機能するジェネレータで構成されている。
トークン化とスクラッチ生成の単一段階共同訓練が実現可能であることを示す。
論文 参考訳(メタデータ) (2026-03-23T17:59:49Z) - NOIR: Neural Operator mapping for Implicit Representations [0.2399911126932526]
NOIRは、連続関数空間間の演算子学習として、コア医療画像タスクを再構成する。
我々は,複数の2次元および3次元下流タスク(セグメント化,形状補完,画像間変換,画像合成など)におけるNOIRの評価を行った。
ネイティブの解像度で競争力を発揮すると同時に、目に見えない離散化に対して強い堅牢性を示す。
論文 参考訳(メタデータ) (2026-03-13T16:13:05Z) - Diffusion Model-Based Data Augmentation for Enhanced Neuron Segmentation [7.83854380301501]
現在のディープラーニングベースの手法は、大規模なトレーニングデータと、広範囲で時間を要するマニュアルアノテーションに依存しているため、制限されている。
本稿では,多種多様かつ構造的に妥当な画像ラベルペアを生成することができる拡散型データ拡張フレームワークを提案する。
提案手法は, 2つの異なる後処理法と組み合わせることで, それぞれ32.1%, 30.7%向上する。
論文 参考訳(メタデータ) (2026-01-22T09:12:05Z) - Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers [6.311754400490674]
ニューラル信号駆動画像生成と編集のための統合フレームワークUni-Neur2Imgを提案する。
Uni-Neur2Imgは、統合され、効率的で効率的な、神経信号と視覚コンテンツ生成のためのソリューションを提供する。
論文 参考訳(メタデータ) (2025-12-21T08:12:38Z) - Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks [28.895073514108088]
拡散モデルは、そのU字型アーキテクチャと畳み込みニューラルネットワーク(CNN)を基本ブロックとして、画像合成において顕著な能力を示している。
本研究では,Swin-transformerを用いたテキスト条件拡散モデルを提案する。
Yuan-TecSwinはImageNet生成ベンチマークで1.37の最先端のFIDスコアを達成している。
論文 参考訳(メタデータ) (2025-12-18T14:32:06Z) - SynBrain: Enhancing Visual-to-fMRI Synthesis via Probabilistic Representation Learning [54.390403684665834]
視覚刺激が皮質反応にどのように変換されるかを理解することは、計算神経科学の基本的な課題である。
視覚的意味論から神経反応への変換を確率的かつ生物学的に解釈可能な方法でシミュレートする生成フレームワークであるSynBrainを提案する。
実験結果から,SynBrainは被写体特異的視覚-fMRI符号化性能において最先端の手法を超越していることが示された。
論文 参考訳(メタデータ) (2025-08-14T03:01:05Z) - Neuro2Semantic: A Transfer Learning Framework for Semantic Reconstruction of Continuous Language from Human Intracranial EEG [11.531598524209969]
頭蓋内脳波(iEEG)記録から知覚音声の意味内容を再構築する新しい枠組みであるNeuro2Semanticを紹介する。
まず、LSTMベースのアダプタが、トレーニング済みのテキスト埋め込みとニューラルネットワークをアライメントし、次に、修正モジュールがこれらのアライメントされた埋め込みから直接、連続した自然なテキストを生成する。
Neuro2Semanticは、30分以内のニューラルデータで強力なパフォーマンスを達成し、ローデータ設定における最新の最先端メソッドよりも優れています。
論文 参考訳(メタデータ) (2025-05-31T04:17:19Z) - MedVKAN: Efficient Feature Extraction with Mamba and KAN for Medical Image Segmentation [1.376408511310322]
医用画像セグメンテーションは、伝統的に畳み込みニューラルネットワーク(CNN)とトランスフォーマーベースのモデルに依存してきた。
トランスフォーマーモジュールの代替として,VSSと拡張フィールド畳み込みKAN(EFC-KAN)を統合したVSS拡張KAN(VKAN)モジュールを提案する。
さらに,VKANをU-Netフレームワークに組み込むことで,医用画像の効率的な分割モデルであるMedVKANを実現する。
論文 参考訳(メタデータ) (2025-05-17T02:56:58Z) - Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models [92.18057318458528]
Token-ShuffleはTransformerにおける画像トークンの数を減らす新しい方法である。
我々の戦略は、事前訓練されたテキストエンコーダを必要とせず、MLLMが超高解像度画像合成をサポートできるようにする。
GenAIベンチマークでは、2.7Bモデルがハードプロンプトで0.77点、ARモデルLlamaGenが0.18点、拡散モデルLDMが0.15点である。
論文 参考訳(メタデータ) (2025-04-24T17:59:56Z) - CoSimGen: Controllable Diffusion Model for Simultaneous Image and Mask Generation [1.9393128408121891]
既存の生成モデルは、高品質で同時画像マスク生成の必要性に対処できない。
本稿では,同時画像生成とマスク生成を同時に行うための拡散型フレームワークであるCoSimGenを提案する。
CoSimGenはすべてのデータセットで最先端のパフォーマンスを達成し、データセットで0.11、LPIPSで0.53の最低KIDを達成した。
論文 参考訳(メタデータ) (2025-03-25T13:48:22Z) - Gen-SIS: Generative Self-augmentation Improves Self-supervised Learning [52.170253590364545]
Gen-SISは、ラベルのない画像データにのみ訓練された拡散ベースの拡張技術である。
これらの自己増強、すなわちバニラSSLエンコーダの埋め込みに基づく生成増強は、より強力なSSLエンコーダのトレーニングを促進することを示す。
論文 参考訳(メタデータ) (2024-12-02T16:20:59Z) - Natively neuromorphic LMU architecture for encoding-free SNN-based HAR on commercial edge devices [4.79664336929499]
ニューロモルフィックモデル(Neuromorphic model)は、ヒトの脳からインスピレーションを受ける。
本稿では,L2MUについて述べる。L2MUはLeaky Integrate-and-Fireニューロンに依存している。
L2MUを手動のアクティビティからスマートウォッチの信号にベンチマークし、圧縮されたバージョンで3つの異なる商用エッジデバイスにデプロイしました。
論文 参考訳(メタデータ) (2024-07-04T17:35:12Z) - Mind's Eye: Image Recognition by EEG via Multimodal Similarity-Keeping Contrastive Learning [2.087148326341881]
本稿では,ゼロショット脳波画像分類のためのMUltimodal similarity-keeper contrastivE学習フレームワークを提案する。
我々は、脳波信号に適した多変量時系列エンコーダを開発し、正規化コントラスト脳波画像事前学習の有効性を評価する。
本手法は,200方向ゼロショット画像分類において,トップ1の精度が19.3%,トップ5の精度が48.8%の最先端性能を実現する。
論文 参考訳(メタデータ) (2024-06-05T16:42:23Z) - MindFormer: Semantic Alignment of Multi-Subject fMRI for Brain Decoding [50.55024115943266]
本稿では,MindFormer を用いたマルチオブジェクト fMRI 信号のセマンティックアライメント手法を提案する。
このモデルは、fMRIから画像生成のための安定拡散モデルや、fMRIからテキスト生成のための大規模言語モデル(LLM)の条件付けに使用できるfMRI条件付き特徴ベクトルを生成するように設計されている。
実験の結果,MindFormerは意味的に一貫した画像とテキストを異なる主題にわたって生成することがわかった。
論文 参考訳(メタデータ) (2024-05-28T00:36:25Z) - NeuroPictor: Refining fMRI-to-Image Reconstruction via Multi-individual Pretraining and Multi-level Modulation [55.51412454263856]
本稿では,fMRI信号を用いた拡散モデル生成過程を直接変調することを提案する。
様々な個人から約67,000 fMRI-imageペアのトレーニングを行うことで,fMRI-to-imageデコーディング能力に優れたモデルが得られた。
論文 参考訳(メタデータ) (2024-03-27T02:42:52Z) - Learning Multimodal Volumetric Features for Large-Scale Neuron Tracing [72.45257414889478]
オーバーセグメントニューロン間の接続を予測し,人間の作業量を削減することを目的としている。
最初はFlyTracingという名前のデータセットを構築しました。
本稿では,高密度なボリュームEM画像の埋め込みを生成するための,新しい接続性を考慮したコントラスト学習手法を提案する。
論文 参考訳(メタデータ) (2024-01-05T19:45:12Z) - Joint fMRI Decoding and Encoding with Latent Embedding Alignment [77.66508125297754]
我々はfMRIデコーディングと符号化の両方に対処する統合フレームワークを導入する。
本モデルでは、fMRI信号から視覚刺激を同時に回復し、統合された枠組み内の画像から脳活動を予測する。
論文 参考訳(メタデータ) (2023-03-26T14:14:58Z) - EEG to fMRI Synthesis: Is Deep Learning a candidate? [0.913755431537592]
この研究は、脳波(EEG)ビューデータからfMRIデータを合成するために、Neural Processingから最先端の原理を使用する方法について、初めて包括的な情報を提供する。
オートエンコーダ,ジェネレータネットワーク,ペアワイズラーニングなど,最先端の合成手法の比較を行った。
結果は、fMRI脳画像マッピングに対する脳波の実現可能性を強調し、機械学習における現在の進歩の役割を指摘し、パフォーマンスをさらに向上するために、今後のコントリビューションの関連性を示す。
論文 参考訳(メタデータ) (2020-09-29T16:29:20Z) - Neural Cellular Automata Manifold [84.08170531451006]
ニューラルセルラーオートマタのニューラルネットワークアーキテクチャは、より大きなNNにカプセル化可能であることを示す。
これにより、NAAの多様体を符号化する新しいモデルを提案し、それぞれが異なる画像を生成することができる。
生物学的には、我々のアプローチは転写因子の役割を担い、細胞の分化を促進する特定のタンパク質への遺伝子マッピングを調節する。
論文 参考訳(メタデータ) (2020-06-22T11:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。