論文の概要: Revisit to Segment: Working Memory Distillation for Reasoning Segmentation
- arxiv url: http://arxiv.org/abs/2609.34863v2
- Date: Wed, 30 Sep 2026 06:25:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.04068
- Title: Revisit to Segment: Working Memory Distillation for Reasoning Segmentation
- Title(参考訳): Revisit to Segment: Reasoning Segmentation のためのワーキングメモリ蒸留
- Abstract要約: マルチモーダル大言語モデル(MLLM)は、視覚的内容の推論とターゲット位置の予測により、画像セグメンテーションにアプローチしている。
生成されたレスポンスには、推論トレースとローカライズ提案が含まれており、同じイメージとクエリを再考する際に作業メモリとして機能する。
セグメンテーションのためのワーキングメモリ蒸留フレームワークであるSWiM(Reasoning Segmenter with Working Memory)を提案する。
- 参考スコア(独自算出の注目度): 15.765317589211314
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) have approached image segmentation by reasoning about visual content and predicting target locations. Their generated responses contain reasoning traces and localization proposals that can serve as working memory when revisiting the same image and query. Our exploration reveals that MLLMs benefit from using this self-generated working memory as context, leading to enhanced reasoning segmentation. Motivated by this finding, we seek to strengthen the backbone model's reasoning segmentation capabilities by distilling the guidance gained from revisiting prior attempts, enabling it to benefit with or without working memory at inference time. To this end, we propose Reasoning Segmenter with Working Memory (SWiM), a working-memory distillation framework for reasoning segmentation. Specifically, SWiM selects rollouts based on segmentation quality to construct working memory and uses the memory-conditioned model as a teacher. The teacher provides token-level distributional supervision along student-generated trajectories, while the student receives only the original image and query. Joint optimization of on-policy self-distillation and outcome-based reinforcement learning combines working-memory guidance with direct feedback on segmentation quality. Extensive experiments on reasoning segmentation benchmarks demonstrate that SWiM achieves state-of-the-art performance, validating the effectiveness of working-memory distillation.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)は、視覚的内容の推論とターゲット位置の予測により、画像セグメンテーションにアプローチしている。
生成されたレスポンスには、推論トレースとローカライズ提案が含まれており、同じイメージとクエリを再検討する際のワーキングメモリとして機能する。
調査の結果,MLLMは,この自己生成ワーキングメモリをコンテキストとして利用することで,推論セグメンテーションの強化につながることがわかった。
本研究の目的は,事前試行の見直しから得られた指導を蒸留し,推論時にメモリを使用せずに動作させることによって,バックボーンモデルの推論セグメンテーション能力を強化することである。
そこで本研究では,SWiM(Reasoning Segmenter with Working Memory)を提案する。
具体的には、セグメンテーション品質に基づいてロールアウトを選択してワーキングメモリを構築し、メモリコンディショニングされたモデルを教師として使用する。
教師は学生が生成した軌跡に沿ってトークンレベルの分布管理を行い、生徒はオリジナルの画像とクエリのみを受け取る。
オンライン自己蒸留と結果に基づく強化学習の協調最適化は、作業記憶指導とセグメント化品質の直接的なフィードバックを組み合わせたものである。
推論セグメンテーションベンチマークの大規模な実験は、SWiMが最先端の性能を達成し、ワークメモリ蒸留の有効性を検証していることを示している。
関連論文リスト
- Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents [51.30250860677378]
本稿では,連想記憶グラフとアクティブな再構成機構を組み合わせたフレームワークであるMRAgentを提案する。
Cue-Tag-Contentグラフ上で実行することで,メモリアクセスに直接推論を統合する。
LoCoMoベンチマークとLongMemEvalベンチマークの実験は、強いベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-04T11:29:46Z) - MemRec: Collaborative Memory-Augmented Agentic Recommender System [57.548438733740504]
我々はメモリ管理から推論をアーキテクチャ的に分離するフレームワークであるMemRecを提案する。
MemRecは動的コラボレーティブメモリグラフを管理する専用のLM_Memを導入した。
4つのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-13T18:51:16Z) - Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management [63.48041801851891]
Fine-Memは、きめ細かいフィードバックアライメントのために設計された統一されたフレームワークである。
MemalphaとMemoryAgentBenchの実験は、Fin-Memが強いベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-01-13T11:06:17Z) - Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation [11.819481846962447]
本研究では,事前訓練された大規模言語モデル上に構築されたエージェントが,パラメータ更新なしでラベル付き例からターゲット分類関数を学習する方法について検討する。
我々のフレームワークは、エピソードメモリを使用して、インスタンスレベルの批判を保存し、それらを再利用可能なタスクレベルのガイダンスに蒸留する。
我々の研究は、より適応的で解釈可能なLLMエージェントを構築するためのメモリ駆動型反射学習の可能性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-10-22T17:58:03Z) - LiSD: An Efficient Multi-Task Learning Framework for LiDAR Segmentation and Detection [6.813145466843275]
LiSDはボクセルベースのエンコーダデコーダフレームワークで、セグメンテーションと検出の両方のタスクに対処する。
これは、ライダーのみの手法のnuScenesセグメンテーションベンチマークにおいて、83.3% mIoUの最先端性能を達成する。
論文 参考訳(メタデータ) (2024-06-11T07:26:54Z) - LLM-Seg: Bridging Image Segmentation and Large Language Model Reasoning [8.379286663107845]
セグメンテーション(Reasoning segmentation)は、セグメンテーションシステムが暗黙のユーザ意図を推論し解釈することを可能にする新しいタスクである。
推論セグメンテーションに関する研究は、方法論設計とデータセットラベリングの両方に寄与する。
論文 参考訳(メタデータ) (2024-04-12T18:45:51Z) - RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation [53.4319652364256]
本稿では,ビデオオブジェクトのセグメンテーションを参照するためのSAMの可能性を探るRefSAMモデルを提案する。
提案手法は,Cross-RValModalを用いることで,モダリティ学習を向上させるためにオリジナルのSAMモデルに適応する。
我々は、言語と視覚の特徴を効果的に調整し、融合させるために、パラメータ効率のチューニング戦略を採用している。
論文 参考訳(メタデータ) (2023-07-03T13:21:58Z) - Memory-Augmented Relation Network for Few-Shot Learning [114.47866281436829]
本研究では,新しい距離学習手法であるメモリ拡張リレーショナルネットワーク(MRN)について検討する。
MRNでは、作業状況と視覚的に類似したサンプルを選択し、重み付け情報伝搬を行い、選択したサンプルから有用な情報を注意深く集約し、その表現を強化する。
我々は、MRNが祖先よりも大幅に向上し、他の数発の学習手法と比較して、競争力や性能が向上することを示した。
論文 参考訳(メタデータ) (2020-05-09T10:09:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。