論文の概要: Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning
- arxiv url: http://arxiv.org/abs/2607.07117v1
- Date: Wed, 08 Jul 2026 07:58:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.318516
- Title: Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning
- Title(参考訳): テキストから画像へのインコンテクスト学習のためのトリー・オブ・ソート推論
- Abstract要約: テキスト・トゥ・イメージ・イン・コンテクスト・ラーニング(T2I-ICL)では、クエリ画像を生成するために、スプリットショットのデモから潜在合成パターンを推論する必要がある。
近年の研究では、最先端のマルチモーダルな大規模言語モデルがこの設定に苦慮していることが示されている。
本稿では,T2I-ICLのツリー・オブ・ソート(ToT)推論フレームワークを提案する。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In text-to-image in-context learning (T2I-ICL), a model has to infer a latent compositional pattern from fewshot demonstrations for generating a query image. Recent studies show that state-of-the-art multimodal large language models struggle with this setting, particularly due to limited compositional reasoning and sensitivity to prompt construction. In this work, we propose a Tree-of-Thoughts (ToT) reasoning framework for T2I-ICL that introduces a multi-stage reasoning and selection layer that generates, evaluates, and selects among multiple candidate hypotheses before constructing the final prompt for image synthesis. By exploring alternative reasoning branches and selecting a coherent interpretation, the proposed approach mitigates prompt ambiguity and compositional errors. We implement the proposed approach in a complete ToT-T2IICL inference pipeline and evaluate it on the CoBSAT benchmark. Both qualitative and quantitative results show that structured multi-branch reasoning leads to more consistent and semantically aligned image generation compared to baseline and Chain-of-Thought prompting strategies, without any additional training or fine-tuning.
- Abstract(参考訳): テキスト・トゥ・イメージ・イン・コンテクスト・ラーニング(T2I-ICL)では、クエリ画像を生成するために、スプリットショットのデモから潜在合成パターンを推論する必要がある。
最近の研究によると、最先端のマルチモーダル言語モデルは、特に構成的推論が限られており、建設の迅速化に敏感なため、この設定に苦慮している。
本研究では,T2I-ICLのためのツリー・オブ・ソート(ToT)推論フレームワークを提案し,画像合成の最終プロンプトを構築する前に複数の仮説を生成,評価,選択する多段階推論・選択層を提案する。
代替推論枝を探索し、コヒーレントな解釈を選択することにより、提案手法は曖昧さと構成上の誤りを緩和する。
提案手法を完全なToT-T2IICL推論パイプラインで実装し,CoBSATベンチマークで評価する。
定性的かつ定量的な結果は、構造化されたマルチブランチ推論が、追加のトレーニングや微調整を伴わずに、ベースラインやChain-of-Thoughtのプロンプト戦略よりも一貫性があり、セマンティックに整合した画像生成につながることを示している。
関連論文リスト
- Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval [3.1033110046835457]
ファッション領域では、このタスクは色、パターン、テクスチャといった微妙なバリエーションを理解する必要がある。
既存のアプローチは、注釈付きデータが少なく、単純なネガティブサンプリングのために制限に直面している。
本稿では,多粒大言語モデル (LLaVA) を統合し,属性認識三重項を生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-18T01:19:32Z) - iDiff: Interpretable Difference-aware Framework for Pairwise Image Quality Assessment [10.381055159281823]
画像品質評価のための解釈可能な差分認識フレームワークiDiffを提案する。
NTIRE 2026 RAIM チャレンジでは,本手法が第1位となる。
論文 参考訳(メタデータ) (2026-05-19T08:24:00Z) - Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning [9.529907786822115]
複雑な視覚入力のディジタル双対表現を構築するために,大規模言語モデルを訓練する強化学習フレームワークDT-R1を提案する。
DT-R1は最新のタスク固有モデルよりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2025-11-15T21:57:25Z) - ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection [51.93101033997245]
AI生成画像のリアリズムの増大は、誤情報やプライバシー侵害に対する深刻な懸念を引き起こしている。
我々は、AI生成画像検出のための新しい推論に基づく一般化可能なフレームワークThinkFakeを提案する。
我々は、ThinkFakeがGenImageベンチマークで最先端の手法より優れており、挑戦的なLOKIベンチマークで強力なゼロショットの一般化を示すことを示す。
論文 参考訳(メタデータ) (2025-09-24T07:34:09Z) - Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play? [63.66192651248858]
T2I-CoReBenchは、T2Iモデルの合成能力と推論能力の両方を評価する包括的で複雑なベンチマークである。
実世界の複雑さによって引き起こされる複雑さを増大させるために、我々は各プロンプトをより高い組成密度でキュレートする。
統計学では、我々のベンチマークは1080の挑戦的なプロンプトと約1,500のチェックリスト質問で構成されている。
論文 参考訳(メタデータ) (2025-09-03T17:58:12Z) - Can Generated Images Serve as a Viable Modality for Text-Centric Multimodal Learning? [3.966028515034415]
本研究は,テキスト・トゥ・イメージ(T2I)モデルにより生成した画像が,テキスト中心のタスクにおいて重要な相補的モダリティとして機能するかどうかを体系的に検討する。
論文 参考訳(メタデータ) (2025-06-21T07:32:09Z) - RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning [88.14234949860105]
RePromptは、強化学習による迅速な強化プロセスに明示的な推論を導入する、新しいリプロンプトフレームワークである。
提案手法は,人手による注釈付きデータなしでエンドツーエンドのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-05-23T06:44:26Z) - R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization [26.757458496178437]
視覚知覚と深い推論のギャップを埋めるために設計されたマルチモーダル推論モデルであるR1-Onevisionを紹介する。
我々はR1-Onevisionデータセットを構築し、多様なドメインにまたがる詳細かつステップバイステップのマルチモーダル推論アノテーションを提供する。
先進的推論を育成するために,教師付き微調整と強化学習によりR1-Onevisionモデルをさらに発展させる。
実験結果から,R1-OnevisionはGPT-4oやQwen2.5-VLなど,最先端のモデルよりも優れた性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-03-13T17:56:05Z) - On the Diagram of Thought [20.805936414171892]
大規模言語モデル(LLM)は多くのタスクで優れているが、構造化された多段階の推論を必要とする複雑な問題に悩まされることが多い。
思考のダイアグラム(Diagram of Thought, DoT)は、1つのLCMがその推論のメンタルマップを構築し、ナビゲートすることを可能にする新しいフレームワークである。
論文 参考訳(メタデータ) (2024-09-16T07:01:41Z) - Multimodal Relation Extraction with Cross-Modal Retrieval and Synthesis [89.04041100520881]
本研究は,対象物,文,画像全体に基づいて,テキストおよび視覚的証拠を検索することを提案する。
我々は,オブジェクトレベル,画像レベル,文レベル情報を合成し,同一性と異なるモダリティ間の推論を改善する新しい手法を開発した。
論文 参考訳(メタデータ) (2023-05-25T15:26:13Z) - Linguistic Structure Guided Context Modeling for Referring Image
Segmentation [61.701577239317785]
本稿では,マルチモーダルコンテキストを相互モーダル相互作用によりモデル化する「ガザ・プロパゲート・ディストリビュート」方式を提案する。
我々のLSCMモジュールは依存パーシングツリーワードグラフ(DPT-WG)を構築し、文の有効なマルチモーダルコンテキストを含むようにすべての単語を誘導する。
論文 参考訳(メタデータ) (2020-10-01T16:03:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。