論文の概要: A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation
- arxiv url: http://arxiv.org/abs/2609.01315v2
- Date: Wed, 09 Sep 2026 00:44:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.850008
- Title: A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation
- Title(参考訳): 再現可能なOmni-Modal Foundationモデル評価のための構成可能な評価システム
- Authors: Hodong Lee, Sanghee Park, Dohoon Ryu, Jungwhan Kim, Junyeob Kim, Soyoon Kim, Geewook Kim,
- Abstract要約: OmniEvaluatorは推論エンジンとキュレートされた評価ライブラリを高いレベルで接続する。
すべての実行は、正確な再現のために完全な構成をキャプチャするアーティファクトとして記録される。
CPUで動かすのに十分小さい内蔵検証器は、エンジン間でスコアを安定させます。
- 参考スコア(独自算出の注目度): 8.788947389563083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Building an omni-modal foundation model means evaluating it across text, image, video, and audio. Excellent evaluation toolkits exist for each modality, but their inference engines, prompt conventions, and metric implementations are mutually incompatible, so practitioners end up maintaining separate environments for every toolchain and still struggle to compare results across them. OmniEvaluator grew out of this need in our own model development: rather than reimplementing benchmarks, it connects existing inference engines and curated evaluation libraries at a higher level, exposing four inference backends, four evaluation frameworks, and over a thousand benchmarks through a single interface. Every run is recorded as an artifact capturing the full configuration for exact reproduction, and results flow into a shared dashboard for cross-model comparison. A federated mode shares GPU inference servers across concurrent evaluations, and a built-in verifier, small enough to run on CPU, keeps its score stable across engines and prompts where rule-based scoring fluctuates under configuration mismatch, matching cost-efficient commercial LLM judges without their recurring API cost. The system, demo video, and dashboard are publicly available. (https://github.com/naver-ai/omni-evaluator)
- Abstract(参考訳): オムニ・モーダル・ファンデーション・モデルの構築は、テキスト、画像、ビデオ、オーディオにまたがって評価することを意味する。
優れた評価ツールキットはモダリティごとに存在するが、推論エンジン、プロンプトコンベンション、メトリック実装は相互に互換性がないため、実践者はツールチェーンごとに別々の環境を維持し、その結果を比較するのに苦労する。
OmniEvaluatorは、ベンチマークを再実装する代わりに、既存の推論エンジンとキュレートされた評価ライブラリをより高いレベルで接続し、4つの推論バックエンド、4つの評価フレームワーク、1000以上のベンチマークを単一のインターフェースで公開します。
すべての実行は、正確な再現のために完全な設定をキャプチャしたアーティファクトとして記録され、結果が共有ダッシュボードに流れて、モデル間比較が行われる。
フェデレーションモードは、同時評価にまたがってGPU推論サーバを共有し、CPU上で実行するのに十分な小さな組み込み検証器は、エンジン間でスコアを安定させ、ルールベースのスコアが設定ミスマッチの下で変動し、コスト効率のよい商用LCM審査員が繰り返しAPIコストなしで一致するように促す。
システム、デモビデオ、ダッシュボードが公開されている。
(https://github.com/naver-ai/omni-evaluator)
関連論文リスト
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection [0.04736448323490553]
VendorBench-100は、ディープフェイク画像検出のためのクロスパラダイムなベンチマークである。
単一対角100画像コーパス,統一出力スキーマ,共通評価フレームワークを用いて36種類の代表モデルを評価する。
評価の結果,商用APIが最も高い性能を達成し,次いでビジョンLLMとオープンソース検出器が続いた。
論文 参考訳(メタデータ) (2026-07-07T13:22:00Z) - BatchBench: Toward a Workload-Aware Benchmark for Autoscaling Policies in Big Data Batch Processing -- A Proposed Framework [0.0]
BatchBenchはオープンなベンチマークフレームワークで、平等な足場上でルールベース、学習、エージェントによるオートスケーリングポリシーを設定するように設計されている。
1)自動スケーリングベンチマークと公開クラスタトレースから合成された6つのバッチ処理クラスのワークロード,(2)2サンプルのKolmogorov-Smirnovとアースモーバー距離に基づく検証手法,(3)コスト,SLA達成,スケール応答性,スケールスラッシュ,決定解釈性を含む5軸評価ハーネス仕様,(4)LLMベースおよび強化学習オートスケーラをルールベースのコントローラとともに評価するための標準化されたエージェントインターフェース。
論文 参考訳(メタデータ) (2026-05-12T15:36:20Z) - UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities [70.79422099851506]
対話型AIシステム評価のための統合評価ツールキットUniDial-EvalKit(UDE)を提案する。
UDEは異種データフォーマットを普遍的なスキーマに標準化し、モジュールアーキテクチャを通じて複雑な評価パイプラインを合理化し、一貫したスコアリングインターフェースの下でメートル法計算を調整する。
論文 参考訳(メタデータ) (2026-03-24T13:01:31Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation [0.0]
本稿では,Apache Spark上に構築された分散評価フレームワークであるSpark-LLM-Evalを紹介する。
フレームワークとすべての評価コードはオープンソースとして利用可能である。
論文 参考訳(メタデータ) (2026-01-18T04:34:39Z) - Uncovering Competency Gaps in Large Language Models and Their Benchmarks [11.572508874955659]
本稿では,スパースオートエンコーダ(SAE)を用いて,両方のギャップを自動的に発見する手法を提案する。
我々は、モデルが、サイコファンティックな振る舞いとは対照的な概念に一貫して劣っていることを発見した。
提案手法は,ベンチマークスコアの概念レベルの分解を可能にするため,評価のための表現的アプローチを提供する。
論文 参考訳(メタデータ) (2025-12-06T17:39:47Z) - EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing [170.71134330650796]
EdiVal-Agentは、命令ベースの画像編集のためのオブジェクト指向評価フレームワークである。
標準のシングルターンだけでなく、マルチターンの命令ベースの編集を精度良く評価するように設計されている。
EdiVal-Benchは、インコンテキスト、フローマッチング、拡散パラダイムにまたがる9つの命令タイプと13の最先端編集モデルをカバーするベンチマークである。
論文 参考訳(メタデータ) (2025-09-16T17:45:39Z) - ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation [51.297873393639456]
ArtifactsBenchは自動ビジュアルコード生成評価のためのフレームワークである。
我々のフレームワークは、生成した各アーティファクトをレンダリングし、時間的スクリーンショットを通してその動的な振る舞いをキャプチャする。
我々は1,825の多様なタスクの新しいベンチマークを構築し、30以上の主要な大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-07-07T12:53:00Z) - Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。
FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。
その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文 参考訳(メタデータ) (2023-07-13T17:14:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。