論文の概要: Training and Agentic Inference Strategies for LLM-based Manim Animation Generation
- arxiv url: http://arxiv.org/abs/2604.18364v1
- Date: Mon, 20 Apr 2026 14:54:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.952359
- Title: Training and Agentic Inference Strategies for LLM-based Manim Animation Generation
- Title(参考訳): LLMに基づくアニメーション生成のためのトレーニングとエージェント推論手法
- Authors: Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird,
- Abstract要約: 本研究は,Manimを用いたテキスト・コード・ビデオ変換のための統合的学習と推論のための最初の研究である。
ManimBenchを使って、トレーニングと推論の9つの組み合わせで17のオープンソースサブ30B LLMを評価している。
その結果、一般的にSFTはコード品質を向上し、GRPOは視覚出力を向上することがわかった。
- 参考スコア(独自算出の注目度): 1.8866564236122627
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generating programmatic animation using libraries such as Manim presents unique challenges for Large Language Models (LLMs), requiring spatial reasoning, temporal sequencing, and familiarity with domain-specific APIs that are underrepresented in general pre-training data. A systematic study of how training and inference strategies interact in this setting is lacking in current research. This study introduces ManimTrainer, a training pipeline that combines Supervised Fine-tuning (SFT) with Reinforcement Learning (RL) based Group Relative Policy Optimisation (GRPO) using a unified reward signal that fuses code and visual assessment signals, and ManimAgent, an inference pipeline featuring Renderer-in-the-loop (RITL) and API documentation-augmented RITL (RITL-DOC) strategies. Using these techniques, this study presents the first unified training and inference study for text-to-code-to-video transformation with Manim. It evaluates 17 open-source sub-30B LLMs across nine combinations of training and inference strategies using ManimBench. Results show that SFT generally improves code quality, while GRPO enhances visual outputs and increases the models' responsiveness to extrinsic signals during self-correction at inference time. The Qwen 3 Coder 30B model with GRPO and RITL-DOC achieved the highest overall performance, with a 94% Render Success Rate (RSR) and 85.7% Visual Similarity (VS) to reference videos, surpassing the baseline GPT-4.1 model by +3 percentage points in VS. Additionally, the analysis shows that the correlation between code and visual metrics strengthens with SFT and GRPO but weakens with inference-time enhancements, highlighting the complementary roles of training and agentic inference strategies in Manim animation generation.
- Abstract(参考訳): Manimのようなライブラリを使ってプログラムアニメーションを生成することは、Large Language Models (LLMs) に固有の課題を示し、空間的推論、時間的シークエンシング、一般的な事前学習データで不足しているドメイン固有のAPIとの親和性を必要とする。
この環境でのトレーニングと推論戦略の相互作用に関する体系的研究は、現在の研究では欠落している。
本稿では、コードと視覚的アセスメント信号を融合する統一報酬信号を用いて、監視ファインチューニング(SFT)と強化学習(RL)に基づくグループ相対ポリシー最適化(GRPO)を組み合わせたトレーニングパイプラインManimTrainerと、Renderer-in-the-loop(RITL)とAPIドキュメント拡張RITL(RITL-DOC)戦略を備えた推論パイプラインManimAgentを紹介する。
これらの手法を用いて,Manimを用いたテキスト・コード・ビデオ変換のための統合学習と推論を初めて行った。
ManimBenchを使って、トレーニングと推論の9つの組み合わせで17のオープンソースサブ30B LLMを評価している。
その結果、SFTは一般的にコード品質を向上し、GRPOは視覚的出力を高め、推論時間における自己補正時の外部信号に対するモデルの応答性を高めることが示された。
GRPO と RITL-DOC を用いた Qwen 3 Coder 30B モデルは,94% のレンダリング成功率 (RSR) と85.7% のビジュアル類似度 (VS) を基準ビデオに適用し,ベースライン GPT-4.1 モデルを VS で+3 ポイント超えた。さらに,コードと視覚メトリクスの相関性は SFT と GRPO で強化されるが,推論時間の強化により低下し,マンムアニメーション生成におけるトレーニングとエージェント推論戦略の補完的役割を強調した。
関連論文リスト
- PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning [30.44007644340425]
本稿では,モンテカルロ木探索 (MCTS) とGRPOを統合した新しいフレームワーク PROPA について紹介する。
7つのベンチマークと4つのVLMバックボーンで、PROPAはSFTとRLVRベースのベースラインを一貫して上回っている。
ドメイン内タスクで最大17.0%、ドメイン外タスクで最大21.0%のゲインを達成する。
論文 参考訳(メタデータ) (2025-11-13T13:06:12Z) - Review of Inference-Time Scaling Strategies: Reasoning, Search and RAG [13.772025442106544]
LLMのパフォーマンス向上は、歴史的に、モデルサイズとトレーニングデータのスケールアップによって推進されてきた。
高品質なトレーニングデータの可用性が急速に低下する中で、基本的なボトルネックが発生しています。
このレビューでは、新しい推論時間スケーリングの時代に寄与する様々なテクニックを体系的に調査する。
論文 参考訳(メタデータ) (2025-10-12T20:09:07Z) - Learning Efficient and Generalizable Graph Retriever for Knowledge-Graph Question Answering [75.12322966980003]
大規模言語モデル(LLM)は、様々な領域にわたって強い帰納的推論能力を示している。
既存のRAGパイプラインのほとんどは非構造化テキストに依存しており、解釈可能性と構造化推論を制限する。
近年,知識グラフ解答のための知識グラフとLLMの統合について検討している。
KGQAにおける効率的なグラフ検索のための新しいフレームワークであるRAPLを提案する。
論文 参考訳(メタデータ) (2025-06-11T12:03:52Z) - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency [56.475612147721264]
本稿では、離散的かつ連続的な報酬信号を通して意味的推論と時間的推論の両方を監督する二重回帰定式化を提案する。
我々は,ビデオQA,テンポラルビデオグラウンディング,グラウンドドビデオQAを含む8つの代表的なビデオ理解タスクに対するアプローチを評価した。
その結果、MLLMを用いた推論中心のビデオ理解の進展において、報酬設計とデータ選択の重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-06-02T17:28:26Z) - Compile Scene Graphs with Reinforcement Learning [69.36723767339001]
次世代予測は大規模言語モデル(LLM)の訓練の基本原理である
本稿では,マルチモーダルLLM(M-LLM)であるR1-SGGを紹介する。
私たちは、Hard Recall、Hard Recall+Relax、Soft Recallの3つのリコールベースのバリエーションを含む、グラフ中心の報酬セットを設計します。
論文 参考訳(メタデータ) (2025-04-18T10:46:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。