論文の概要: Composed Historical Image Retrieval by Modeling Temporal Representations
- arxiv url: http://arxiv.org/abs/2608.18694v1
- Date: Wed, 19 Aug 2026 08:48:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.348066
- Title: Composed Historical Image Retrieval by Modeling Temporal Representations
- Title(参考訳): 時間表現のモデル化による歴史的画像検索
- Abstract要約: 本稿では,歴史的画像を日付と内容に分割した表現学習アルゴリズムTDIRを提案する。
全ての理論的特性は、歴史的写真におけるコンポジション画像検索の現実問題に基礎を置いて検証されている。
- 参考スコア(独自算出の注目度): 2.0973843981871574
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: While time evolves linearly, the geometry of neural embedding spaces is inherently multi-dimensional, often chaotic, and difficult to interpret. In principle, one could constrain an embedding space to a single temporal dimension; however, such a reduction would sacrifice performance on downstream tasks, as one-dimensional embeddings cannot retain sufficient expressive capacity. This paper asks whether it is possible to learn representations that preserve temporal structure while remaining effective for image and object retrieval, and answers this question by building the mathematical foundations of such a system. We propose Temporally Decomposable Image Representations (TDIR), a representation learning algorithm that decomposes historical photographs into separate date and content components through orthogonal subspaces. We define and prove the conditions under which such a decomposition is achievable, characterize the error incurred when those conditions are only partially met, and show that orthogonality between temporal and categorical subspaces emerges naturally from the joint optimization, without requiring it to be imposed explicitly. Beyond its geometric properties, TDIR enables a class of transitive operations on embedding spaces: the temporal information of one image can be extracted and injected into the representation of another, with no label supervision required. All theoretical properties are grounded and validated in the real-world problem of Composed Image Retrieval on historical photographs, where a query simultaneously specifies object content and a target time period, either through labels or through example images. This in-the-wild setting serves as a concrete backing for the propositions we derive, offering an intuitive and interpretable way to navigate photographic archives while maintaining competitive performance in both date estimation and object retrieval.
- Abstract(参考訳): 時間は線形に進化するが、神経埋め込み空間の幾何学は本質的に多次元であり、しばしばカオスであり、解釈が困難である。
原則として、埋め込み空間を1つの時間次元に制限することができるが、1次元埋め込みは十分な表現能力を保持することができないため、下流タスクのパフォーマンスを犠牲にする。
本稿では,画像やオブジェクトの検索に有効でありながら,時間構造を保った表現を学習できるかどうかを問うとともに,そのようなシステムの数学的基礎を構築することで,この問題に答える。
本稿では,歴史的写真を直交部分空間を通して,時系列分解可能画像表現 (TDIR) に分解する表現学習アルゴリズムを提案する。
このような分解が達成可能な条件を定義して証明し、これらの条件が部分的に満たされた場合に発生する誤差を特徴づけ、時間的およびカテゴリー的な部分空間間の直交が、明示的に課すことなく、共同最適化から自然に現れることを示す。
幾何学的性質の他に、TDIRは埋め込み空間上の推移的な操作のクラスを可能にする:ある画像の時間的情報を抽出し、他の画像の表現に注入することができ、ラベルの監督は不要である。
全ての理論的特性は、歴史的写真に基づくComposeed Image Retrievalの現実問題において、クエリがラベルまたは例画像を通して、対象内容と対象時間とを同時に指定し、検証する。
写真アーカイブをナビゲートし、日付推定とオブジェクト検索の両面での競合性能を維持しながら、直感的で解釈可能な方法を提供する。
関連論文リスト
- Spacetime Formation under Requirements: Contextual Realization and Form-Dependent Probability [0.0]
量子認知はしばしば、古典確率を固定された事象構造上の量子確率に置き換えることで、全確率の法則の順序効果、文脈性、違反を説明する。
量子確率は、有限状態条件下での文脈時空形成の固定時空射影である。
論文 参考訳(メタデータ) (2026-05-01T23:39:57Z) - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation [62.55421542903781]
生成された画像の空間的レイアウトを評価するために明示的に設計された検証可能な報酬モデルである textbfSpatialReward を提案する。
安定拡散とFLUXの実験により、空間的リワードをRLトレーニングに組み込むことで、空間的一貫性と全体的な生成品質が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-03-23T17:26:35Z) - Priors in Time: Missing Inductive Biases for Language Model Interpretability [58.07412640266836]
スパースオートエンコーダは、時間とともに概念の独立を前提としており、定常性を暗示している。
本稿では,時間的帰納バイアスを持つ新たな解釈可能性目標である時間的特徴分析を導入し,その表現を2つの部分に分解する。
私たちの結果は、堅牢な解釈可能性ツールの設計において、データにマッチする帰納的バイアスの必要性を浮き彫りにしています。
論文 参考訳(メタデータ) (2025-11-03T18:43:48Z) - Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models [20.508585767918916]
本研究では,その背景となるシーンについて豊富な情報を提供する固有シーン特性を活用する。
提案手法は,画像とそれに対応する内在性の両方を共同生成し,その基盤となるシーン構造を暗黙的に捉えることを目的としている。
実験により,提案手法は空間的不整合を補正し,より自然なシーンレイアウトを生成することを示した。
論文 参考訳(メタデータ) (2025-08-14T06:26:36Z) - STD-GS: Exploring Frame-Event Interaction for SpatioTemporal-Disentangled Gaussian Splatting to Reconstruct High-Dynamic Scene [54.418259038624406]
既存の手法ではフレームカメラのシーンと直接一致させるために統一表現モデル(例えばガウシアン)を採用している。
しかし、この統一パラダイムは、フレームの特徴と背景とオブジェクト間の不連続な空間的特徴により、オブジェクトの潜在的時間的特徴に失敗する。
本研究では,フレームカメラを補うイベントカメラを導入し,高ダイナミックなシーン再構成のための時分割型ガウススプレイティングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-29T09:32:06Z) - 'Memory States' from Almost Nothing: Representing and Computing in a Non-associative Algebra [0.0]
本稿では,高次元空間における情報項目の表現と計算のための非連想的フレームワークを提案する。
これは空間コンピューティングの原理と、記憶に関する認知科学の実証的な発見と一致している。
論文 参考訳(メタデータ) (2025-05-13T08:43:02Z) - Temporal Embeddings: Scalable Self-Supervised Temporal Representation
Learning from Spatiotemporal Data for Multimodal Computer Vision [1.4127889233510498]
移動活動時系列に基づいて景観を階層化する新しい手法を提案する。
ピクセルワイズ埋め込みは、タスクベースのマルチモーダルモデリングに使用できるイメージライクなチャネルに変換される。
論文 参考訳(メタデータ) (2023-10-16T02:53:29Z) - Recovering Continuous Scene Dynamics from A Single Blurry Image with
Events [58.7185835546638]
インプリシットビデオ関数(IVF)は、同時イベントを伴う単一の動きのぼやけた画像を表現する。
両モードの利点を効果的に活用するために、二重注意変換器を提案する。
提案するネットワークは,限られた参照タイムスタンプの地平線画像の監督のみで訓練される。
論文 参考訳(メタデータ) (2023-04-05T18:44:17Z) - Object-Centric Relational Representations for Image Generation [18.069747511100132]
本稿では,オブジェクト中心のリレーショナル表現に基づく条件画像生成手法を提案する。
このようなアーキテクチャバイアスには,生成過程の操作と条件付けを容易にする特性が伴うことを示す。
また,関係表現と組み合わせた画像の合成データセットからなる画像生成のための新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2023-03-26T11:17:17Z) - Structure-Guided Image Completion with Image-level and Object-level Semantic Discriminators [97.12135238534628]
複雑な意味論やオブジェクトの生成を改善するために,セマンティック・ディミネータとオブジェクトレベル・ディミネータからなる学習パラダイムを提案する。
特に、セマンティック・ディミネーターは、事前学習された視覚的特徴を利用して、生成された視覚概念の現実性を改善する。
提案手法は, 生成品質を著しく向上させ, 各種タスクの最先端化を実現する。
論文 参考訳(メタデータ) (2022-12-13T01:36:56Z) - Where and What? Examining Interpretable Disentangled Representations [96.32813624341833]
解釈可能なバリエーションの獲得は、長い間、絡み合い学習の目標の1つだった。
独立性の仮定と異なり、解釈性は教師なしの設定での絡み合いを促進するために使われることは滅多にない。
本論文では, 解釈対象と解釈対象の2つの質問について検討し, 離散表現の解釈可能性を検討する。
論文 参考訳(メタデータ) (2021-04-07T11:22:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。