論文の概要: MemeMind: Reference-Guided Trace Construction for Offline Context Optimization
- arxiv url: http://arxiv.org/abs/2608.09316v1
- Date: Mon, 10 Aug 2026 08:57:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.173118
- Title: MemeMind: Reference-Guided Trace Construction for Offline Context Optimization
- Title(参考訳): MemeMind: オフラインコンテキスト最適化のための参照ガイド付きトレース構築
- Abstract要約: 私たちはMemeMindを紹介します。これは、オフラインの参照回答を使用して、不足したエクスペリエンスを回復します。
TraceBuilderは、参照が必要とするエビデンスを特定し、テキスト検索、画像検索、ビジュアルグラウンドを実行し、結果のツールトレースを検証する。
専門家が注釈付けした1000のミームのベンチマークである MemeX 上で MemeMind を評価した。
- 参考スコア(独自算出の注目度): 18.19958604521752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline context optimization improves an agent by revising its instructions and examples while keeping the model frozen. This approach learns from rollouts on an adaptation set, but some queries produce only failed rollouts. In these cases, the optimizer sees no successful example of how the available tools can reach the correct answer. We introduce MemeMind, which uses an offline reference answer to recover this missing experience. TraceBuilder identifies the evidence required by the reference, executes text search, image retrieval, and visual grounding, and verifies the resulting tool trace before adding it to the adaptation buffer. ToolGuide then summarizes the collected traces into a shared guide and separate instructions for each tool. The reference answers and constructed traces are used only during adaptation, while inference uses the learned guides with a frozen model. We study this problem through Anime, Comic, and Game meme interpretation. These memes combine edited and ambiguous visual content, overlaid text, long tail franchise knowledge, and culture specific references. Their interpretation can require coordinated visual grounding, image retrieval, and text search, making them a demanding setting in which native rollout groups may fail together. We evaluate MemeMind on MemeX, a benchmark of 1,000 such memes annotated by experts. Across two Qwen3-VL models, two language partitions, and two independent judges, MemeMind improves over the strongest context optimization baseline by 22.0% and 21.1% on Qwen3-VL-30B-A3B, and by 8.1% and 8.0% on Qwen3-VL-235B-A22B under GPT-5 judging. Ablations and held out traces show that constructing successful tool use for failed groups provides the largest component gain and produces more effective evidence acquisition at inference time.
- Abstract(参考訳): オフラインコンテキスト最適化は、モデルを凍結させながら、その命令と例を変更してエージェントを改善する。
このアプローチは適応セットのロールアウトから学習するが、一部のクエリはロールアウトに失敗しただけを生成する。
このような場合、オプティマイザは、利用可能なツールが正しい答えにどのように到達できるかの、成功例を見出さない。
私たちはMemeMindを紹介します。これは、オフラインの参照回答を使用して、この不足したエクスペリエンスを回復します。
TraceBuilderは、参照が必要とするエビデンスを特定し、テキスト検索、画像検索、ビジュアルグラウンドを実行し、その結果のツールトレースをアダプションバッファに追加する前に検証する。
その後、ToolGuideは収集したトレースを共有ガイドにまとめ、ツールごとに個別の指示を出す。
参照回答と構築されたトレースは適応時にのみ使用され、推論はフリーズモデルで学習したガイドを使用する。
我々は、アニメ、コミック、ゲームミームの解釈を通してこの問題を研究する。
これらのミームは、編集された、曖昧な視覚的内容、オーバーレイドテキスト、長い尾のフランチャイズ知識、文化固有の参照を組み合わせる。
それらの解釈には、協調した視覚的接地、画像検索、テキスト検索が必要であるため、ネイティブなロールアウトグループが一緒に失敗する可能性のある、要求の多い設定になっている。
専門家が注釈付けした1000のミームのベンチマークである MemeX 上で MemeMind を評価した。
2つのQwen3-VLモデル、2つの言語分割、2つの独立した裁判官の間で、MemeMindは最強コンテキスト最適化ベースラインを22.0%、Qwen3-VL-30B-A3Bで21.1%、Qwen3-VL-235B-A22Bで8.1%改善している。
失敗するグループに対して成功したツールの使用を構築することは、最大のコンポーネントゲインを提供し、推論時により効果的なエビデンスを取得することを示しています。
関連論文リスト
- Generative Retrieval for Unsupervised Text-Based Person Search [77.46429603553388]
テキストベースの人物検索(TBPS)は,ある自然言語記述に基づいて,大きな画像ギャラリーから対象者の画像を検索することを目的としている。
本稿では,2段階の世代別検索フレームワークであるGTR+を提案する。
また、高品質できめ細かいテキストアノテーションを備えた大規模TBPSデータセットであるLargeFine-Personにもコントリビュートしています。
論文 参考訳(メタデータ) (2026-09-11T15:25:00Z) - Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models [12.293070202366316]
LVLM(Large Vision-Language Models)は多くのマルチモーダルタスクにおいて高いパフォーマンスを達成する。
それらはしばしば、刺激的なオブジェクト背景の堅牢性を利用しており、結果として、オブジェクト関連の視覚的証拠ではなく、文脈的ショートカットによって引き起こされる予測をもたらす。
我々は,LVLMにおけるスプリラス相関による障害を構築,ベンチマーク,緩和するフレームワークであるPURGEを紹介する。
論文 参考訳(メタデータ) (2026-08-30T19:42:47Z) - V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning [59.47823383593251]
視覚サンプルモデルでは、視覚的証拠が不十分な流動的な答えを生み出すことができる。
本稿では,参照応答を原子命題に分解するVisuals-Based Reinforcement Learningを紹介する。
我々は,コンポーネントワイド,プレフィックスローカライズされたルーリッククレジットを用いて,同じSFTチェックポイントに基づいてモデルをトレーニングする。
論文 参考訳(メタデータ) (2026-08-26T09:40:46Z) - DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning [14.841209914774778]
Long Document Visual Question Answering (LongDocVQA)は、複数のページにまたがる異種文書要素を探索し、統合し、推論するために、MLLM(Multimodal Large Language Models)を必要とする。
エンド・ツー・エンドのMLLMを含む既存のアプローチは、しばしば推論中に、根拠となる証拠がどのように徐々に構成されているかを表現し、検証するための明確なメカニズムを欠いている。
本稿では,エビデンスローカライゼーション,構造化文書解析,エビデンスグラフ推論を行う階層的なフレームワークであるDocTraceを提案する。
論文 参考訳(メタデータ) (2026-08-04T08:04:59Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Beyond Detection: A Structure-Aware Framework for Scene Text Tracking [15.940149796254955]
本稿では、この特定のタスクをScene Text Trackingとして定式化する。
そこで我々はSymTrackを提案する。SymTrackは、シナジスティックなデュアルブランチ設計を備えた、一貫した検出不要のフレームワークである。
このタスクに専用のベンチマークがないので、ビデオテキストスポッティングの3つのデータセットを使用して、高品質なアノテーションによるベンチマークを構築する。
論文 参考訳(メタデータ) (2026-05-17T05:40:55Z) - Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation [19.889854990300595]
反復検索拡張生成(iRAG)は、複雑なマルチホップ問題に答える強力なパラダイムとして登場した。
Evidence (CoE) の textbfChain について述べる。
論文 参考訳(メタデータ) (2026-05-02T06:40:42Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization [50.13408999553116]
テキスト2Vis生成のための最初の強化学習フレームワークであるRL-Text2Visを提案する。
本手法では,テキストの精度,コードの有効性,可視化品質を共同で最適化する新しい多目的報酬を用いている。
その結果,GRPOは可視化生成における構造的マルチモーダル推論の効果的な戦略として確立された。
論文 参考訳(メタデータ) (2026-01-08T04:29:07Z) - Feedback Descent: Open-Ended Text Optimization via Pairwise Comparison [48.89195616081196]
Feedback Descentは、構造化されたテキストフィードバックを通じてテキストアーティファクト(プロンプト、コード、分子)を最適化するフレームワークである。
テキスト内学習は、構造化されたフィードバックを勾配のような方向情報に変換し、ターゲットとなる編集を可能にする。
DOCKSTRINGの分子探索ベンチマークにおいて、Feedback Descentは6つのタンパク質標的に対して260,000ドル以上の化合物を持つデータベースの99.9ドルのパーセンタイルを超える新規な薬物様分子を同定した。
論文 参考訳(メタデータ) (2025-11-11T07:14:13Z) - TRACE: Textual Relevance Augmentation and Contextual Encoding for Multimodal Hate Detection [15.240092636523277]
ソーシャルメディアのミームは、文化的にニュアンスのあるメッセージに視覚的およびテキスト的手がかりを織り込むため、ヘイト検出の難しい領域である。
これらの課題に対処するために,視覚的に基盤付けられたコンテキスト拡張を活用する階層型マルチモーダルフレームワークであるTRACEを導入する。
我々のフレームワークは、広く使われているHateful Memesデータセット上で、最先端の精度(0.807)とF1スコア(0.806)を達成する。
論文 参考訳(メタデータ) (2025-04-24T19:27:55Z) - RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning [77.59074909960913]
Retrieval-Enhanced Test-Time Adaptation (RETTA) と呼ばれる新しいゼロショットビデオキャプションフレームワークを提案する。
一般的なビデオテキスト検索モデルXCLIP、一般的な画像テキストマッチングモデルCLIP、テキストアライメントモデルAnglE、テキスト生成モデルGPT-2の4つのキーモデルを用いてビデオとテキストをブリッジする。
そこで本研究では,GPT-2,XCLIP,CLIP,AnglEの4つのフリーズモデルにおいて,学習可能なトークンを通信媒体として用いることを提案する。
論文 参考訳(メタデータ) (2024-05-11T16:22:00Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。