論文の概要: BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
- arxiv url: http://arxiv.org/abs/2608.17895v1
- Date: Tue, 18 Aug 2026 15:29:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.375747
- Title: BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
- Title(参考訳): BEAR-Bench: マルチモーダルモデルのためのバイリンガルエンタープライズとアカデミック推論ベンチマーク
- Abstract要約: BEAR-Benchは英語とロシア語の自己完結型で複雑なベンチマークで、1000の人間による注釈付き質問を含む。
我々は、BEAR-Bench上でGemini 3.1 ProやQwen3.5-397Bを含む16のプロプライエタリでオープンウェイトなMLLMを評価し、最強のシステムでもクリアなヘッドルームを観察する。
- 参考スコア(独自算出の注目度): 37.78339878369385
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Multimodal Large Language Models (MLLMs) have made significant strides in visual comprehension, their ability to reason about text-dense, professional documents remains incompletely evaluated. Existing benchmarks emphasize information extraction, require external domain knowledge, or cover professional documents only as one of many settings. They are also largely English- or Chinese-centric, leaving other languages and Russian, in particular, substantially underrepresented. To address these limitations, we introduce BEAR-Bench (Bilingual Enterprise and Academic Reasoning), a self-contained, complex English-and-Russian benchmark comprising 1000 human-annotated questions based on text-rich business and scientific documents. We evaluate 16 proprietary and open-weight MLLMs, including Gemini 3.1 Pro and Qwen3.5-397B, on BEAR-Bench and observe clear headroom even for the strongest systems. Finally, we use the resulting model outputs to compare existing hallucination detection methods, evaluating not only how often models fail on BEAR-Bench but also how reliably those failures can be identified.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、視覚的理解において大きな進歩を遂げてきたが、テキスト密度を推論する能力は、まだ完全には評価されていない。
既存のベンチマークでは、情報抽出、外部のドメイン知識、プロのドキュメントを多くの設定の1つとして扱うことが強調されている。
また、主に英語や中国語が中心で、他の言語、特にロシア語がほとんど表現されていない。
これらの制約に対処するために、テキスト豊富なビジネスおよび科学文書に基づく1000の人間注釈付き質問からなる、自己完結した複雑な英語とロシア語のベンチマークであるBEAR-Bench(Bilingual Enterprise and Academic Reasoning)を紹介する。
我々は、BEAR-Bench上でGemini 3.1 ProやQwen3.5-397Bを含む16のプロプライエタリでオープンウェイトなMLLMを評価し、最強のシステムでもクリアなヘッドルームを観察する。
最後に、得られたモデル出力を用いて、既存の幻覚検出法を比較し、BEAR-Bench上でモデルが失敗する頻度だけでなく、それらの失敗を確実に特定できるかどうかを評価する。
関連論文リスト
- Multimodal Evaluation of Russian-language Architectures [88.00147763684451]
本稿では,ロシアの建築におけるオープンなマルチモーダル評価フレームワークであるMera Multiを紹介する。
ベンチマークはインストラクションベースで、デフォルトのテキスト、画像、オーディオ、ビデオモダリティを含んでいる。
Mera Multiは、マルチモーダルベンチマークを構築するための複製可能な方法論を提供する。
論文 参考訳(メタデータ) (2025-11-19T15:43:53Z) - LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models [13.28738007425811]
大規模な言語モデル(LLM)を評価するための,最初の大規模,高品質,多次元ベンチマークデータセットであるLaoBenchを紹介する。
LaoBenchは、知識応用、K12基礎教育、ラオス語、中国語、英語のバイリンガル翻訳という3つの中核領域にまたがる17,000以上の精査されたサンプルで構成されている。
我々のデータ構築パイプラインは、専門家によるキュレーションと自動エージェント支援検証を統合し、言語的正確性、文化的妥当性、教育的価値を保証します。
論文 参考訳(メタデータ) (2025-11-14T14:13:07Z) - R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation [75.33671166231096]
我々は、Reasoning Bench(R-Bench)と呼ばれる、大学院レベルの多学派、英語の中国語ベンチマークを導入する。
RBenchは108の被験者に1,094の質問を、83の被験者に665の質問を、マルチモーダルなモデルテストに当てはめている。
我々は,OpenAI o1,GPT-4o,DeepSeek-R1など,広く使用されているモデルを評価した。
論文 参考訳(メタデータ) (2025-05-04T07:48:36Z) - Multimodal Large Language Models to Support Real-World Fact-Checking [80.41047725487645]
MLLM(Multimodal large language model)は、膨大な情報処理において人間を支援する能力を持つ。
MLLMはすでにファクトチェックツールとして使用されていますが、その能力や制限については検討中です。
本稿では,現実のファクトチェックを容易にするために,現在のマルチモーダルモデルの能力を体系的に評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-06T11:32:41Z) - One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support [18.810320088441678]
この研究は、法域に対する新しいNLPベンチマークを導入している。
エンフロング文書(最大50Kトークン)の処理、エンフドメイン固有の知識(法的テキストに具体化されている)、エンフマルチリンガル理解(5つの言語をカバーしている)の5つの重要な側面においてLCMに挑戦する。
我々のベンチマークにはスイスの法体系からの多様なデータセットが含まれており、基礎となる非英語、本質的には多言語法体系を包括的に研究することができる。
論文 参考訳(メタデータ) (2023-06-15T16:19:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。