論文の概要: Can LLMs Design Video Coding Tools? A Case Study on Planar Mode
- arxiv url: http://arxiv.org/abs/2609.01535v1
- Date: Tue, 01 Sep 2026 17:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.886022
- Title: Can LLMs Design Video Coding Tools? A Case Study on Planar Mode
- Title(参考訳): LLMはビデオ符号化ツールを設計できるか? : 平面モードを事例として
- Authors: Yingwen Zhang, Meng Wang, Liqiang He, Shiqi Wang,
- Abstract要約: 本稿では,大規模言語モデル (LLM) がビデオ符号化ツールを設計できるかどうかを考察する。
ビデオ符号化標準における長年の予測ツールであるPlanarモードに関する実証事例を提示する。
- 参考スコア(独自算出の注目度): 19.40228193475537
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper explores whether large language models (LLMs) can design video coding tools, a highly challenging task due to the intricate algorithmic coupling of tool modifications. In particular, we present an empirical case study on the Planar mode, a long-standing intra prediction tool in video coding standards. Our experiments operate within a generation-and-evaluation loop, with the LLM generating new Planar predictors, encoder trials evaluating their coding performance, and the LLM re-generating refined implementations based on the evaluation feedback. We first examine directly replacing the default Planar mode in the Fraunhofer Versatile Video Encoder (VVenC) under its faster preset. Experimental results demonstrate that the LLM-generated mode can outperform the conventional Planar mode on this lightweight toolset, achieving 0.18% bitrate savings with 0.4% complexity overhead on the standard benchmark. We further extend our evaluation to the Enhanced Compression Model (ECM). Leveraging newly introduced directional Planar modes, we investigate two integration strategies: directly replacing them, and introducing the LLM-generated predictor as an additional prediction mode with new syntax elements. The empirical results suggest that both strategies can yield coding gains under a constrained low-resolution setting. Overall, this study offers preliminary evidence and practical insights, highlighting both the potential and open challenges of LLM-based coding tool design.
- Abstract(参考訳): 本稿では,大規模言語モデル(LLM)がビデオ符号化ツールを設計できるかどうかを考察する。
特に、ビデオ符号化標準における長年の予測ツールであるPlanarモードに関する実証事例を提示する。
実験では,LLMが新しいPlanar予測器を生成し,符号化性能を評価するエンコーダ試験を行い,評価フィードバックに基づいて改良された実装を再生成する。
まず、Fraunhofer Versatile Video Encoder(VVenC)のデフォルトのPlanarモードを、より高速なプリセットで直接置き換える。
LLM生成モードは、この軽量ツールセット上で従来のPlanarモードよりも優れており、標準ベンチマークでは0.18%のビットレートの節約と0.4%の複雑さが達成されている。
評価をさらに拡張圧縮モデル(ECM)に拡張する。
新たに導入された指向性平面モードを利用して、直接置き換える2つの統合戦略と、新たな構文要素を付加した予測モードとしてLLM生成予測器を導入する。
実験結果から,両戦略が制約された低解像度条件下での符号化ゲインを得る可能性が示唆された。
本研究は,LLMベースのコーディングツール設計における潜在的な課題とオープンな課題の両立を図った,予備的な証拠と実践的な洞察を提供する。
関連論文リスト
- World Modelling Improves Language Model Agents [11.081954466884392]
DyMoは、トレーニング後の関数呼び出しと並行して、状態予測機能を備えた大きな言語モデルを拡張する方法である。
バークレー・コールリング・リーダーボードV2では、DyMoは成功率を改善し、幻覚を著しく減少させる。
論文 参考訳(メタデータ) (2025-06-03T14:20:59Z) - LLM-Guided Evolution: An Autonomous Model Optimization for Object Detection [0.0]
機械学習では、ニューラルネットワークサーチ(NAS)はモデル設計のドメイン知識と、有望なパフォーマンスを達成するために大量の試行錯誤を必要とする。
Large Language Model (LLM)-Guided Evolution (GE)フレームワークは、CIFARデータ上の画像分類アルゴリズムのモデルソースコードを直接修正するためにLLMを組み込むことによって、このアプローチを変革した。
LLM-GEは平均平均精度を92.5%から94.5%に向上させるなど,大幅な性能向上を図った。
論文 参考訳(メタデータ) (2025-04-03T05:06:06Z) - ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning [27.725814615823687]
本研究では,計画段階と実行段階の誤りを訂正する"plug-and-play"手法であるExoViPを提案する。
我々は、現在の視覚言語プログラミング手法を強化するために、検証モジュールを"exoskeletons"として採用する。
論文 参考訳(メタデータ) (2024-08-05T03:22:10Z) - CoMMIT: Coordinated Multimodal Instruction Tuning [90.1532838391285]
マルチモーダル大言語モデル(MLLM)は一般に、バックボーンLLMと非テキスト入力モードの特徴エンコーダ間の協調学習を含む。
本稿では,MLLM命令のチューニングを理論的・経験的両面から解析する。
本稿では,学習のバランスを定量的に測定できるマルチモーダルバランス係数を提案する。
論文 参考訳(メタデータ) (2024-07-29T23:18:55Z) - Exploring and Benchmarking the Planning Capabilities of Large Language Models [57.23454975238014]
この研究は、大規模言語モデル(LLM)の計画能力を改善するための基礎を築いた。
我々は、古典的な計画ベンチマークと自然言語シナリオの両方を含む包括的なベンチマークスイートを構築した。
本研究は,LLM計画の強化を目的としたマルチショットインコンテキスト学習について検討し,文脈長の増大と計画性能の向上の関係について検討する。
論文 参考訳(メタデータ) (2024-06-18T22:57:06Z) - From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems [59.40480894948944]
大規模言語モデル (LLM) は、物理世界の意思決定問題を解くことができる。
このモデルの下で、LLM Plannerは、プロンプトを介して言語ベースのサブゴールを反復的に生成することにより、部分的に観測可能なマルコフ決定プロセス(POMDP)をナビゲートする。
我々は,事前学習したLLMプランナーが,文脈内学習を通じてベイズ的集計模倣学習(BAIL)を効果的に行うことを証明した。
論文 参考訳(メタデータ) (2024-05-30T09:42:54Z) - Evaluating and Explaining Large Language Models for Code Using Syntactic
Structures [74.93762031957883]
本稿では,コード用大規模言語モデルに特有の説明可能性手法であるASTxplainerを紹介する。
その中核にあるASTxplainerは、トークン予測をASTノードに整合させる自動メソッドを提供する。
私たちは、最も人気のあるGitHubプロジェクトのキュレートデータセットを使用して、コード用の12の人気のあるLLMに対して、実証的な評価を行います。
論文 参考訳(メタデータ) (2023-08-07T18:50:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。