論文の概要: PRISM: A Category-Theoretic Framework for Measuring and Refining Multimodal Analogies
- arxiv url: http://arxiv.org/abs/2610.01383v2
- Date: Sun, 04 Oct 2026 11:59:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.516757
- Title: PRISM: A Category-Theoretic Framework for Measuring and Refining Multimodal Analogies
- Title(参考訳): PRISM:マルチモーダルアナロジーの測定と精錬のためのカテゴリー論的フレームワーク
- Abstract要約: 解釈型構造マッピング(英: Interpretable Structure Mapping, PRISM)は、多モード類似のリレーショナルアライメントの測定と改善のためのフレームワークである。
PRISMの最初のコンポーネントであるプルバックスコアは、結果のグラフ表現からリレーショナルアライメントを定量化する。
第2のコンポーネントは、プルバックスコアをコンテキスト内フィードバック信号として使用して、生成された画像を反復的に修正する反復リファインメントループである。
- 参考スコア(独自算出の注目度): 2.5840709738256122
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Analogical reasoning involves identifying and preserving relational structures across domains. However, existing approaches to AI-driven multimodal analogy generation lack an interpretable measure of whether this structure is understood and maintained in the generated output. We address this gap with Pullback Refinement via Interpretable Structural Mapping (PRISM), a modality-agnostic framework for measuring and improving relational alignment in multimodal analogies, evaluated on visual metaphor generation. PRISM represents analogies as explicit relational mappings grounded in category theory and uses VLMs to instantiate these structures across modalities. Its first component, the pullback score, quantifies relational alignment from the resulting graph representation. On the AnaloBench benchmark, selecting the correct analogy purely by pullback score achieves 82.5% accuracy, demonstrating that the score captures meaningful relational information. PRISM's second component is an iterative refinement loop that uses the pullback score as an in-context feedback signal to iteratively revise the generated image towards greater relational depth. VLM-as-a-judge and human evaluations show that PRISM consistently improves metaphor consistency and analogy appropriateness over zero- shot generation, with human participants preferring the refined output in 57.65% of pairwise comparisons. However, a qualitative analysis reveals that refinement can favour visually crowded compositions rather than genuinely deeper relational correspondences.
- Abstract(参考訳): 解析的推論は、ドメイン間の関係構造を特定し保存することを含む。
しかし、AI駆動型マルチモーダルアナログ生成への既存のアプローチでは、この構造が生成された出力で理解され維持されているかどうかの解釈可能な尺度が欠如している。
視覚的メタファー生成に基づき,多モード類似における関係性アライメントの測定と改善のためのモダリティ非依存フレームワークであるPRISMによるプルバックリファインメント(Pullback Refinement)を用いて,このギャップに対処する。
PRISM は圏論に基づく明示的な関係写像として類似を表現し、VLM を用いてこれらの構造を様々にインスタンス化する。
その最初のコンポーネントであるプルバックスコアは、結果のグラフ表現からリレーショナルアライメントを定量化する。
AnaloBenchベンチマークでは、プルバックスコアによって純粋に正しい類似点を選択すると82.5%の精度が得られ、スコアが意味のある関係情報をキャプチャすることを示した。
PRISMの第2のコンポーネントは、プルバックスコアをコンテキスト内フィードバック信号として使用して、生成された画像をより深いリレーショナル深さに向けて反復的に修正する反復リファインメントループである。
VLM-as-a-judgeと人間による評価は、PRISMがゼロショット生成よりも比喩的一貫性と類似性を一貫して改善していることを示している。
しかし、質的な分析により、精製は真に深い関係関係関係よりも、視覚的に混み合った構成を好んでいることが明らかになった。
関連論文リスト
- CAGE: Coherence-Aware Graph Encoding for Retrieval-Augmented Generation [2.3578002163476266]
従来のRetrieval-Augmented Generation (RAG)システムでは、クエリに対して各パスを独立してスコア付けする。
私たちはCoherence-Aware Graph AGE(CAGE)を紹介します。
我々のパイプラインは、取得したパスを向不均一なエンティティグラフに変換する。
論文 参考訳(メタデータ) (2026-09-04T02:27:34Z) - Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry [105.89493240787861]
推論中に露出したセマンティックユニットは、学習が代替品と比較し、クレジットを割り当てる場所を定義する。
我々は,この原理を,ライン順応可能な実行可能コードとして視覚的関係を表すCode-CoTでインスタンス化し,推論を型付きイベントに整理する。
9つの幾何ベンチマークで、CE-GRPOは平均76.04の精度を達成し、Qwen3-VL-8Bと軌跡レベルGRPOをそれぞれ8.09$と3.43ポイント上回る。
論文 参考訳(メタデータ) (2026-08-31T08:44:36Z) - Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs [10.095945693317079]
大きな言語モデル(LLM)を評価することは、その能力を理解し、競合するシステムを比較し、実際に信頼できるモデルのデプロイをサポートするために重要である。
オープンエンドタスクでは、同じプロンプトに対する2つの応答を比較し、その結果の判断を総合的なランキングに集約する、ペアワイズ評価が一般的なパラダイムとなっている。
このパラダイムの中心的な課題は、非推移性(intransitivity)である。
論文 参考訳(メタデータ) (2026-06-16T07:44:45Z) - Domain Generalization through Spatial Relation Induction over Visual Primitives [4.085285915236828]
Primitive-Aware Structure for Domain gEneralization (PARSE) は、視覚的視覚的プリミティブとその関係性を構成する画像分類フレームワークである。
本研究では, ソフトバイナリ, 三項述語, 四項述語を用いて, 端から端まで学習可能な空間アライメント(空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント, 空間アライメント) を表現した。
CUB-DGとDomainBedベンチマークスイート全体で、PARSEはCUB-DGの精度を4.5ポイント以上改善し、DomainBedの既存のDGメソッドと競合し続けている。
論文 参考訳(メタデータ) (2026-05-07T11:31:46Z) - DEPTH: Hallucination-Free Relation Extraction via Dependency-Aware Sentence Simplification and Two-tiered Hierarchical Refinement [22.164114662885652]
DEPTHは、関係抽出パイプラインに依存性を意識したsEntence simPlificationと2階層階層改良を統合するフレームワークである。
以上の結果から,DEPTHは平均幻覚率を7.0%まで下げる一方で,最先端のベースラインよりも平均F1スコアを17.2%向上させることを示した。
論文 参考訳(メタデータ) (2025-08-20T03:35:24Z) - SiReRAG: Indexing Similar and Related Information for Multihop Reasoning [96.60045548116584]
SiReRAGは、類似情報と関連する情報の両方を明示的に考慮する新しいRAGインデックス方式である。
SiReRAGは、3つのマルチホップデータセットの最先端インデックス手法を一貫して上回る。
論文 参考訳(メタデータ) (2024-12-09T04:56:43Z) - Unifying Feature and Cost Aggregation with Transformers for Semantic and Visual Correspondence [51.54175067684008]
本稿では,高密度マッチングタスク用に設計されたTransformerベースの積分機能とコスト集約ネットワークを提案する。
まず, 特徴集約とコスト集約が異なる特徴を示し, 双方の集約プロセスの司法的利用から生じる実質的な利益の可能性を明らかにした。
本フレームワークは意味マッチングのための標準ベンチマークで評価され,また幾何マッチングにも適用された。
論文 参考訳(メタデータ) (2024-03-17T07:02:55Z) - Relational Prior Knowledge Graphs for Detection and Instance
Segmentation [24.360473253478112]
本稿では,先行値を用いたオブジェクト機能拡張グラフを提案する。
COCOの実験的評価は、リレーショナル先行で拡張されたシーングラフの利用は、オブジェクト検出とインスタンスセグメンテーションの利点をもたらすことを示している。
論文 参考訳(メタデータ) (2023-10-11T15:15:05Z) - Learnable Pillar-based Re-ranking for Image-Text Retrieval [119.9979224297237]
画像テキスト検索は、モダリティギャップを埋め、意味的類似性に基づいてモダリティコンテンツを検索することを目的としている。
一般的なポストプロセッシング手法であるリグレードは, 単一モダリティ検索タスクにおいて, 隣り合う関係を捕捉する優位性を明らかにしている。
本稿では,画像テキスト検索のための新しい学習可能な柱型リグレードパラダイムを提案する。
論文 参考訳(メタデータ) (2023-04-25T04:33:27Z) - Counting Like Human: Anthropoid Crowd Counting on Modeling the
Similarity of Objects [92.80955339180119]
メインストリームの群衆計数法は 密度マップを補強して 計数結果を得るために統合する。
これに触発された我々は,合理的かつ人為的な集団カウントフレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-02T07:00:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。