論文の概要: MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- arxiv url: http://arxiv.org/abs/2607.01813v1
- Date: Thu, 02 Jul 2026 07:27:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.721032
- Title: MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- Title(参考訳): MMBench-Live:マルチモーダルモデルのための継続的進化型ベンチマーク
- Authors: Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma,
- Abstract要約: MMBench-Liveはマルチエージェント駆動自動パイプラインによって構築された連続的に進化するマルチモーダルベンチマークである。
本フレームワークは,ベンチマークの進化をタスク誘導型データセット構築,構造化ベンチマーク仕様の統合,フィードバック制御リアルタイムデータ取得,検証可能なQA生成として扱う。
MMBench-Liveには5.9Kの新しい評価インスタンスがあり、回答の正確性が高い。
- 参考スコア(独自算出の注目度): 33.25323416656233
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluation benchmarks are essential for assessing vision-language models (VLMs), but most multimodal benchmarks are static, making them vulnerable to temporal staleness, data contamination, and costly maintenance. We present MMBench-Live, a continuously evolving multimodal benchmark built by a multi-agent-driven automated pipeline. Our framework treats benchmark evolution as task-guided dataset construction, integrating structured benchmark specification, feedback-controlled real-time data acquisition, and verifiable QA generation with executable reasoning. To maintain cross-version comparability, we introduce a distribution-consistent update strategy that extracts task-related visual patterns from the original benchmark to guide data collection and filtering. Instantiated from MMBench, MMBench-Live contains 5.9K newly generated evaluation instances with a high answer correctness rate, while each update costs about USD 30 and takes 1-2 hours. Extensive evaluations show that MMBench-Live preserves stable model rankings, maintains semantic alignment with the original benchmark, and exhibits weaker contamination-related memorization signals, suggesting a practical and scalable paradigm for sustainable multimodal benchmark evolution. The project is available at https://github.com/PRIS-CV/MMBench-Live.
- Abstract(参考訳): 評価ベンチマークは視覚言語モデル(VLM)の評価に不可欠であるが、ほとんどのマルチモーダルベンチマークは静的であり、時間的安定性、データ汚染、コストのかかる保守に弱い。
MMBench-Liveはマルチエージェント駆動自動パイプラインによって構築された連続的に進化するマルチモーダルベンチマークである。
本フレームワークは,ベンチマークの進化をタスク誘導型データセット構築,構造化されたベンチマーク仕様の統合,フィードバック制御されたリアルタイムデータ取得,実行可能推論による検証可能なQA生成として扱う。
クロスバージョン互換性を維持するために,元のベンチマークからタスク関連視覚パターンを抽出し,データ収集とフィルタリングをガイドする分散一貫性更新戦略を導入する。
MMBenchをベースとしたMMBench-Liveには5.9Kの新しい評価インスタンスがあり、回答の正確性が高い。
MMBench-Liveは、安定したモデルランキングを維持し、元のベンチマークとセマンティックアライメントを維持し、より弱い汚染関連記憶信号を示し、持続可能なマルチモーダルベンチマーク進化のための実用的でスケーラブルなパラダイムを示唆している。
このプロジェクトはhttps://github.com/PRIS-CV/MMBench-Liveで入手できる。
関連論文リスト
- Benchmark Everything Everywhere All at Once [28.30618112297148]
ベンチマーク構築用に設計された完全自律型エージェントシステムであるBenchmark Agentを紹介する。
本フレームワークは,ユーザクエリ分析やサブタスク設計からデータアノテーション,品質管理に至るまで,完全なベンチマーク構築パイプラインを編成する。
テキスト理解やマルチモーダル理解,ドメイン固有の推論など,さまざまな評価シナリオにまたがる15の代表的なベンチマークを作成した。
論文 参考訳(メタデータ) (2026-06-04T17:52:04Z) - It's TIME: Towards the Next Generation of Time Series Forecasting Benchmarks [87.7937890373758]
時系列基礎モデル(TSFM)は,特定のデータセットモデルから一般化可能なタスク評価に至るまで,予測環境に革命をもたらしている。
我々は、50の新しいデータセットと98の予測タスクからなる次世代タスク中心のベンチマークであるTIMEを紹介する。
静的なメタラベルに基づく従来のデータセットレベルの評価を超える新しいパターンレベルの評価視点を提案する。
論文 参考訳(メタデータ) (2026-02-12T16:31:01Z) - MACEval: A Multi-Agent Continual Evaluation Network for Large Models [52.629762680215315]
大規模モデルの動的評価のためのマルチエージェント連続評価ネットワークであるMACEvalを紹介する。
MACEvalは,(1)人間フリーで自動で,(2)エージェント間判定による退屈な結果処理を緩和し,(2)効率よく,経済的に,相当量のデータとオーバーヘッドを減らして,関連するベンチマークと同じような結果が得られること,(3)カスタマイズされた評価トポロジによる既存のベンチマークの柔軟性,拡張性,マイグレーション,統合化を実証する。
論文 参考訳(メタデータ) (2025-11-12T09:26:24Z) - ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation [33.22383550511664]
ArenaBencherは自動ベンチマーク進化のためのモデルに依存しないフレームワークである。
アリーナベンチャーを数学の問題解決、常識推論、安全領域に適用する。
論文 参考訳(メタデータ) (2025-10-09T17:59:55Z) - BenchAgents: Multi-Agent Systems for Structured Benchmark Creation [23.653678381444276]
BenchAgentsは評価ベンチマークの作成を自動化するフレームワークである。
BenchAgentsを使って、計画、制約満足度、因果推論に関連する機能を評価するベンチマークを作成します。
次に、これらのベンチマークを使用して、最先端のモデルを研究し、共通の障害モードとモデルの違いに関する新たな洞察を抽出します。
論文 参考訳(メタデータ) (2024-10-29T22:56:18Z) - LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content [62.816876067499415]
我々は、科学的ArXiv論文に基づくスケーラブルな進化型ライブベンチマークであるLiveXivを提案する。
LiveXivは、任意のタイムスタンプでドメイン固有の原稿にアクセスし、視覚的な問合せペアを自動的に生成することを提案する。
ベンチマークの最初のバージョンで、複数のオープンでプロプライエタリなLMM(Large Multi-modal Models)をベンチマークし、その挑戦的な性質を示し、モデルの真の能力を明らかにする。
論文 参考訳(メタデータ) (2024-10-14T17:51:23Z) - Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM
Evaluation [51.99752147380505]
本稿では,大規模言語モデル(LLM)を動的に評価するベンチマーク自己進化フレームワークを提案する。
マルチエージェントシステムを用いて、元のインスタンスのコンテキストや質問を操作し、信頼性の高い新しいインスタンスをフレーミングする。
我々のフレームワークは、異なるモデル間の性能の相違を拡大し、様々なタスクで同じモデル内で性能の相違を拡大します。
論文 参考訳(メタデータ) (2024-02-18T03:40:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。