論文の概要: TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction
- arxiv url: http://arxiv.org/abs/2608.16100v1
- Date: Mon, 17 Aug 2026 04:45:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.539759
- Title: TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction
- Title(参考訳): TISC: 忠実な再構築のためのテキスト駆動型画像意味コミュニケーションシステム
- Abstract要約: 生成画像意味コミュニケーションは、画像をテキスト記述に変換し、受信側でテキストから画像への再構成を行う。
既存の手法では、送信側で画像からテキストまでのセマンティック抽出(I2T)と受信側でテキストから画像へのセマンティック再構成(T2I)という2つの重要なボトルネックに直面している。
本稿では,忠実な再構築に適したテキスト駆動型画像意味コミュニケーションフレームワークTISCを提案する。
- 参考スコア(独自算出の注目度): 12.535011038876815
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative image semantic communication converts an image into a text description and then performs text-to-image reconstruction at the receiver via diffusion-based generative models. This paradigm has attracted broad attention due to its extremely low bandwidth cost. However, existing methods still face two critical bottlenecks across image-to-text (I2T) semantic extraction at the transmitter and text-to-image (T2I) semantic reconstruction at the receiver: (i) semantic loss and distortion in I2T, where holistic image descriptions may omit fine-grained object attributes and spatial-position information, causing the generated text to deviate from the original image semantics; and (ii) insufficient semantic faithfulness in T2I, where even with the same semantically faithful text description, different initial noise settings may lead diffusion-based reconstruction to produce images with different levels of semantic consistency with the original image. These issues jointly limit the semantic faithfulness of image reconstruction. To address them, we propose TISC, a text-driven image semantic communication framework tailored for faithful reconstruction. TISC incorporates two key designs: (1) Tree-Structured Attribute Semantic Extraction (TSASE), which decomposes semantic extraction into global scene, background, and object-level attribute descriptions, covering spatial position, shape/pose, color, material, and other physical attributes for each detected object; and (2) an Initial Noise Optimization (INO) mechanism, which selects an initial noise seed at the transmitter according to a comprehensive similarity score that jointly considers visual and semantic consistency. Experiments on multiple datasets show that TSASE improves object-position recovery and semantic description faithfulness, while the INO parameter study supports the adopted configuration for noise selection.
- Abstract(参考訳): 生成画像意味コミュニケーションは、画像をテキスト記述に変換し、拡散ベースの生成モデルを介して受信機でテキストから画像への再構成を行う。
このパラダイムは、帯域幅のコストが極端に低いため、広く注目を集めている。
しかし、既存の手法では、送信側で画像からテキストまでのセマンティック抽出(I2T)と受信側でテキストから画像へのセマンティック再構成(T2I)という2つの重要なボトルネックに直面している。
(i)I2Tにおける意味的損失と歪み。そこでは、全体像記述は、細粒度オブジェクト属性と空間配置情報を省略し、生成されたテキストを元の画像意味論から逸脱させる。
(II)T2Iにおける意味的忠実性は不十分であり、同じ意味的忠実なテキスト記述であっても、異なる初期雑音設定は拡散に基づく再構成を誘導し、元の画像と異なる意味的整合性を持つ画像を生成する。
これらの問題は、画像再構成における意味的忠実度を共同で制限する。
そこで本研究では,忠実な再構築に適したテキスト駆動型画像意味コミュニケーションフレームワークTISCを提案する。
TISCは,(1)大域的なシーン,背景,オブジェクトレベルの属性記述に意味的抽出を分解する木構造属性意味抽出(TSASE),(2)視覚的・意味的整合性を考慮した送信機における初期ノイズシードを選択する初期ノイズ最適化(INO)機構を含む。
複数のデータセットの実験では、TSASEはオブジェクト位置の回復と意味的記述の忠実性を改善する一方、INOパラメータスタディはノイズ選択のための採用構成をサポートする。
関連論文リスト
- STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model [4.685207648946472]
STEDiffは、テキスト埋め込み空間内で意味表現を直接拡張するために設計された、トレーニング不要のメソッドである。
本手法は複雑なシナリオにおける意味的一貫性と生成を顕著に改善する。
論文 参考訳(メタデータ) (2026-06-09T09:59:09Z) - Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation [11.925230809051143]
本稿では,Large Language Models (LLM) によって駆動される意味的補償フレームワーク (MVR) を提案する。
マルチビューのセマンティックな再構成と特徴補償によって、クロスモーダルな表現の一貫性を高める。
実験により,本手法はトレーニングを伴わずに元のモデルの精度を向上できることを示すとともに,3つのテキスト対人物検索データセット上でSOTAを実行する。
論文 参考訳(メタデータ) (2026-04-20T15:03:01Z) - Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers [56.76198904599581]
テキストと画像の拡散モデルは、言語翻訳において優れているため、モーダル間の注意機構を通じて暗黙的に概念を基礎づける。
近年のマルチモーダル拡散トランスフォーマーでは, 共用画像とテキストトークンを導入し, よりリッチでスケーラブルなクロスモーダルアライメントを実現している。
MM-DiTの注意構造を分析するための体系的フレームワークであるSeg4Diffを導入し,テキストから画像への意味情報の伝達方法に着目した。
論文 参考訳(メタデータ) (2025-09-22T17:59:54Z) - OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval [59.377821673653436]
Composed Image Retrieval (CIR)は、ユーザの複雑な検索要求を柔軟に表現することができる。
1) 視覚データにおける支配的部分とノイズ的部分の不均一性は無視され、クエリー特徴が劣化する。
本研究は、主部分分割と二重焦点写像という2つのモジュールからなる集中写像に基づく特徴抽出器を提案する。
論文 参考訳(メタデータ) (2025-07-08T03:27:46Z) - ComposeAnything: Composite Object Priors for Text-to-Image Generation [72.98469853839246]
ComposeAnythingは、既存のT2Iモデルを再トレーニングすることなく、合成画像生成を改善するための新しいフレームワークである。
提案手法はまずLLMの連鎖推論能力を活用し,テキストから2.5Dのセマンティックレイアウトを生成する。
本モデルでは,テキストを忠実に反映した合成による高品質な画像を生成する。
論文 参考訳(メタデータ) (2025-05-30T00:13:36Z) - MegaSR: Mining Customized Semantics and Expressive Guidance for Image Super-Resolution [76.30559905769859]
MegaSRは、カスタマイズされたブロックワイドセマンティクスと拡散ベースのISRのための表現的ガイダンスをマイニングする。
我々は,HEDエッジマップ,深度マップ,セグメンテーションマップを最も表現力のあるガイダンスとして実験的に同定した。
大規模な実験は、意味的豊かさと構造的整合性の観点からMegaSRの優位性を示す。
論文 参考訳(メタデータ) (2025-03-11T07:00:20Z) - Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers [58.80845404416028]
データフリー量子化(DFQ)は、実際のデータにアクセスせずにモデル量子化を可能にし、データのセキュリティとプライバシに関する懸念に対処する。
ビジョントランスフォーマー(ViTs)の普及に伴い、ViTsのDFQは大きな注目を集めている。
本稿では,新しいセマンティックアライメントと強化データ自由化手法であるSARDFQを提案する。
論文 参考訳(メタデータ) (2024-12-21T09:30:45Z) - Language-Oriented Semantic Latent Representation for Image Transmission [38.62941652189033]
意味コミュニケーション(SC)の新しいパラダイムは、ビットの背後にある意味の提供に焦点を当てている。
データ・テキスト・モデルの最近の進歩は言語指向のSCを促進する。
テキストと圧縮画像の埋め込みの両方を通信する新しいSCフレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-16T10:41:31Z) - RealignDiff: Boosting Text-to-Image Diffusion Model with Coarse-to-fine Semantic Re-alignment [112.45442468794658]
本稿では,RealignDiffという2段階の粗大なセマンティックアライメント手法を提案する。
粗いセマンティックリアライメントフェーズにおいて、生成された画像キャプションと与えられたテキストプロンプトとのセマンティックな相違を評価するために、新しいキャプション報酬を提案する。
微妙なセマンティックリアライメントステージは、局所的な密集キャプション生成モジュールと再重み付けアテンション変調モジュールを用いて、局所的なセマンティックビューから生成された画像を洗練する。
論文 参考訳(メタデータ) (2023-05-31T06:59:21Z) - Text to Image Generation with Semantic-Spatial Aware GAN [41.73685713621705]
テキストから画像生成(T2I)モデルは、テキスト記述と意味的に一致するフォトリアリズム画像を生成することを目的としている。
本稿では,テキストエンコーダがより良いテキスト情報を活用できるように,エンドツーエンドで訓練された新しいフレームワークSemantic-Spatial Aware GANを提案する。
論文 参考訳(メタデータ) (2021-04-01T15:48:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。