論文の概要: Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- arxiv url: http://arxiv.org/abs/2607.05382v3
- Date: Thu, 09 Jul 2026 06:57:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.257745
- Title: Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- Title(参考訳): 学習できるものを超えた検索:エージェント視覚生成における知識境界の進化
- Abstract要約: ビジュアルジェネレータはレンダリングに優れていますが、彼らが知らないものを確実に作り出します。
我々は、12の障害カテゴリと22のドメインにまたがる20,839のプロンプトを備えたSearchGen-20KとSearchGen-Benchを構築した。
SearchGen-Benchでは、フロンティアのオープンジェネレータは100点中21点から28点に過ぎず、40点の崩壊は既存のベンチマークには見えない。
- 参考スコア(独自算出の注目度): 83.53893718885796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.
- Abstract(参考訳): ビジュアルジェネレータはレンダリングに優れていますが、彼らが知らないものを確実に作り出します。
ユーザリクエストは、新しいキャラクタ、トレンドエンティティ、ポストカットイベントなど、非バウンドで、進化し、深く長い尾を持つ。
ジェネレータは固定コーパスでトレーニングされるが、ビジュアルワールドはオープンエンドである。
我々は、12の障害カテゴリと22のドメインにまたがる20,839のプロンプトを持つSearchGen-20KとSearchGen-Benchを構築し、オフラインで再現可能な研究をサポートするために、事前に実行されたマルチモーダルなSearchGen-Corpus-1Mと組み合わせた。
SearchGen-Benchでは、フロンティアのオープンジェネレータは100点中21点から28点に過ぎず、40点の崩壊は既存のベンチマークには見えない。
自然な治療法は検索ツールを使うことであり、エージェントによる視覚生成を可能にする。
ノイズを注入することで、ジェネレータが既に処理しているノイズを発生させる。
私たちは、根本原因を、ジェネレータ固有の進化する知識境界に辿り着きます。
この境界は事前に特定することは難しいが,本研究のコトレーニングフレームワークを用いて発見可能であることを示す。
この共同学習レシピの最小バージョンでさえ単調な改善をもたらし、世界的知識に基づく要求に応えられる視覚生成における再帰的な自己改善の基礎を築いた。
我々は、ツール拡張された世界知識のビジュアル生成のための再生可能なハーネスとして、完全なデータセット、協調学習コーパス、検索コーパスをリリースする。
関連論文リスト
- Procedural Content Metageneration via Program Search and Continual Abstraction Discovery [3.899863694644006]
高適合性プログラムから再利用可能なプリミティブを,実行時ヘルパーモジュールに抽出するContinuous Abstraction Discovery(CAD)を導入する。
このアプローチをSokoban、Zelda、Dangerous Dave、Lode Runnerで研究している。
論文 参考訳(メタデータ) (2026-08-18T16:03:22Z) - G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution [16.818086150132853]
$textbfG-ReActはディープ検索のための推論フレームワークである。
それは、固定トポロジークエリグラフ上の$textbfstateの進化として推論を整理する。
G-ReActはトレーニングと推論の両方をサポートしている。
論文 参考訳(メタデータ) (2026-08-02T15:43:37Z) - SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation [26.8807904319691]
模擬検索世界のバックボーンとして型付き知識グラフを用いたtextbfSearchEyes を提案する。
Wikidata5Mの視覚的知識交差点上の制約付きマルチホップパスをサンプリングするために,textbfPerception-Knowledge Chains (PKC)を提案する。
6つのマルチモーダルな知識集約型ベンチマーク実験により,SearchEyesはオープンソースのマルチモーダル検索エージェントの最先端性能を実現することが示された。
論文 参考訳(メタデータ) (2026-07-07T07:43:04Z) - Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation [79.31152006811438]
Thinking- While-Generating (TwiG) は、視覚生成プロセスを通してテキスト推論を共進化させる最初のインターリーブドフレームワークである。
このフレームワークの可能性を明らかにするため、ゼロショットプロンプト、教師付き微調整、強化学習の3つの候補戦略について検討する。
論文 参考訳(メタデータ) (2025-11-20T18:59:52Z) - UniSearch: Rethinking Search System with a Unified Generative Architecture [20.448690421956023]
UniSearchはKuaishou Searchのための統合された生成検索フレームワークである。
UniSearchは、カスケードパイプラインを、検索ジェネレータとビデオジェネレータを統合するエンドツーエンドアーキテクチャに置き換える。
産業規模のデータセットに関する大規模な実験と、短いビデオとライブ検索のシナリオにおけるオンラインA/Bテストは、UniSearchの強力な有効性とデプロイメントの可能性を示している。
論文 参考訳(メタデータ) (2025-09-08T17:08:26Z) - Searching for the Fakes: Efficient Neural Architecture Search for
General Face Forgery Detection [4.19882227319634]
我々は、ディープフェイク検出のためのニューラルネットワーク探索(NAS)に基づくエンドツーエンドフレームワークを開発する。
本稿では,より一般的なモデルを選択するための探索プロセスを導く新しい性能推定指標を提案する。
人工的に設計した最先端ネットワークと比較して,本手法は,データベース内シナリオとデータセット間シナリオの両方において,競合性能を実現する。
論文 参考訳(メタデータ) (2023-06-15T03:01:13Z) - Enhancing Retrieval-Augmented Large Language Models with Iterative
Retrieval-Generation Synergy [164.83371924650294]
検索と生成を反復的に同期させるIter-RetGenと呼ばれる手法により,高い性能が得られることを示す。
モデル出力は、タスクを完了するために必要なものを示し、より関連する知識を取得するための情報的コンテキストを提供する。
Iter-RetGenプロセスは、すべての知識を全体として取得し、構造的な制約なしに生成時の柔軟性をほとんど保持します。
論文 参考訳(メタデータ) (2023-05-24T16:17:36Z) - Active Retrieval Augmented Generation [123.68874416084499]
外部知識資源から情報を取得することで、大きな言語モデル(LM)を拡張することは、有望な解決策である。
ほとんどの既存の検索拡張LMは、入力に基づいて一度だけ情報を検索する検索と生成のセットアップを採用している。
本稿では,将来的な内容を予測するために,文の予測を反復的に利用する汎用手法であるフォワード・フォワード・アクティブ・レトリヴァル・ジェネレーション・ジェネレーション(FLARE)を提案する。
論文 参考訳(メタデータ) (2023-05-11T17:13:40Z) - Momentum Decoding: Open-ended Text Generation As Graph Exploration [49.812280360794894]
自動回帰言語モデル(LM)を用いたオープンエンドテキスト生成は、自然言語処理における中核的なタスクの1つである。
我々は、新しい視点から、すなわち、有向グラフ内の探索プロセスとして、オープンエンドテキスト生成を定式化する。
本稿では,新しい復号法であるtextitmomentum decodingを提案する。
論文 参考訳(メタデータ) (2022-12-05T11:16:47Z) - Unsupervised Text Generation by Learning from Search [86.51619839836331]
TGLSは、教師なしテキスト生成のための新しいフレームワークである。
実世界の自然言語生成タスクであるパラフレーズ生成とテキストの形式化におけるTGLSの有効性を示す。
論文 参考訳(メタデータ) (2020-07-09T04:34:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。