論文の概要: ManimAgent: Self-Evolving Multimodal Agents for Visual Education
- arxiv url: http://arxiv.org/abs/2606.30296v2
- Date: Wed, 01 Jul 2026 09:43:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.066859
- Title: ManimAgent: Self-Evolving Multimodal Agents for Visual Education
- Title(参考訳): ManimAgent:視覚教育のための自己進化型マルチモーダルエージェント
- Abstract要約: マルチラウンドリフレクションでは、大きな言語モデル上に構築されたエージェントが単一のタスク内の障害から回復するが、各タスクは分離されたエピソードのままである。
本稿では,マルチモーダルエージェントであるManimAgentについて述べる。
得られた信号は、成功論理をソフトリファレンス例として記憶する正のチャネルM+と、検証済みの障害パターンをハードナウンピットフォールとして記憶する負のチャネルM−とをポップアップさせる。
- 参考スコア(独自算出の注目度): 13.55098935029791
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-round reflection lets agents built on large language models recover from failures within a single task, but each task remains an isolated episode: lessons learned across many reflection rounds on one task are discarded before the next begins. We study this gap on a code-generation task: from a scientific paper section, the agent writes Python in the open-source Manim library to render a mathematical animation. We present ManimAgent, a self-evolving multimodal agent that carries reflection experience across tasks through a dual-channel Episodic Memory Bank grown entirely from its own task stream, with no weight updates and no human seeds. After each animation converges, a vision-language model scores the rendered keyframes; the resulting signals populate a positive channel M+ that stores success rationales as soft Reference Examples, and a negative channel M- that stores validated failure patterns as hard Known Pitfalls. On a fixed-probe evaluation against no-memory, matched-budget retrieval-augmented generation, and shuffled-memory baselines, blind human Pass@1 rises and reflection rounds fall as memory size grows. We will release the code, frozen memory snapshots, and the task stream.
- Abstract(参考訳): マルチラウンドリフレクションでは、大きな言語モデル上に構築されたエージェントが単一のタスク内の障害から回復するが、各タスクは独立したエピソードのままである。
科学論文のセクションでは、エージェントがオープンソースのManimライブラリにPythonを書き、数学的アニメーションを描画する。
私たちはManimAgentを紹介します。ManimAgentは、多チャンネルのエピソード記憶バンクを通じてタスク間のリフレクション経験を伝達する、自己進化型マルチモーダルエージェントです。
各アニメーションが収束すると、視覚言語モデルは、レンダリングされたキーフレームをスコアし、結果の信号は、成功論理をソフト参照例として格納する正のチャネルM+と、検証済みの障害パターンをハードナウンピットフォールとして格納する負のチャネルM−とをポップアップさせる。
メモリサイズが大きくなるにつれて、非メモリ、一致予算検索強化世代、シャッフルメモリベースラインに対する固定プローブ評価では、盲人Pass@1が上昇し、リフレクションラウンドが減少する。
コード、凍結したメモリスナップショット、タスクストリームをリリースします。
関連論文リスト
- AdMem: Advanced Memory for Task-solving Agents [13.611633561917513]
大規模言語モデル(LLM)はツール使用エージェントとしての約束を示すが、知識の記憶、整理、再利用を必要とする長期的タスクには制限がある。
本稿では,短期記憶と長期記憶を組み合わせた2段階設計において,セマンティック,エピソード,手続き記憶を統合した統合的・自動記憶フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-05T00:11:57Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data [52.80567461420316]
メモリ拡張LPMに基づくマルチエージェントシステム(textbfMALMAS)を提案する。
MALMASは生成プロセスを独立した責任を持つエージェントに分解し、ルータエージェントはイテレーション毎にエージェントの適切なサブセットを起動する。
さらに、手続きメモリ、フィードバックメモリ、概念記憶を含むメモリモジュールを統合し、その後の特徴生成を適応的に導く反復的改善を可能にする。
論文 参考訳(メタデータ) (2026-04-22T07:09:30Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse [14.413401094877122]
LLMに基づくエージェントの自己進化に関する最近の研究は、主にテキストのプロンプトやリフレクションとして成功した経験を記録している。
本稿では,タスクソリューションを実行可能なサブエージェントコードとして保存する,新たな自己進化パラダイムであるAgentFactoryを提案する。
保存されたサブエージェントは、標準化されたドキュメントを備えた純粋なPythonコードであり、任意のPython対応システム間で移植性を実現する。
論文 参考訳(メタデータ) (2026-03-18T17:58:25Z) - Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers [0.42061757959666934]
大きな言語モデル(LLM)エージェントは、単一のコンテキストウィンドウが小さすぎて何が起きているのかをキャプチャできないような環境で、ますます運用される。
メモリはステートレステキストジェネレータを真に適応的なエージェントに変える。
この調査は、メモリがどのように設計され、実装され、現代のLCMベースのエージェントで評価されるかという構造化された説明を提供する。
論文 参考訳(メタデータ) (2026-03-08T15:08:01Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z) - Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory [89.65731902036669]
Evo-Memoryは、大規模言語モデル(LLM)エージェントで自己進化型メモリを評価するための、ストリーミングベンチマークとフレームワークである。
10以上の代表的なメモリモジュールを評価し、10種類の多ターンゴール指向およびシングルターン推論およびQAデータセットで評価した。
論文 参考訳(メタデータ) (2025-11-25T21:08:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。