論文の概要: WorldBench: Culturally Grounded Benchmark for Multilingual Agents
- arxiv url: http://arxiv.org/abs/2609.01056v1
- Date: Tue, 01 Sep 2026 10:53:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.588182
- Title: WorldBench: Culturally Grounded Benchmark for Multilingual Agents
- Title(参考訳): WorldBench: 多言語エージェントの文化的基盤ベンチマーク
- Authors: Leonardo Ranaldi, Sherrie Shen, Jushi Kai, Alexandra Birch,
- Abstract要約: 既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な根拠のあるシナリオへのアプリケーションをテストすることはめったにない。
We present WorldBench: a comprehensive, multilingual benchmark, where agent can act in a sandbox via structured action。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、人間のアノテータからのフィードバックによってフィルタリングされ洗練されている。
- 参考スコア(独自算出の注目度): 69.76002914143531
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite the growing use of LLM-powered agents to solve multi-step tasks in complex environments, existing benchmarks rarely test state preservation, performance across languages, and application to realistic, grounded scenarios. To address these concerns, we present WorldBench: a comprehensive, multilingual benchmark of genuine, persona-grounded everyday workflows, where agents can act in a sandbox via structured actions. WorldBench comprises 1,600 tasks across seven languages and eight cultures, filtered and refined through feedback from human annotators with language- and culture-specific expertise. For evaluation, we extend metrics from previous works and introduce Constrained Task Success (CTS), which combines natural language instructions and testbeds to score task completion, minimal modification, and other complementary metrics through deterministic and LLM-as-a-Judge evaluations. Our experiments show that frontier models reach only 49.2% CTS, with all models demonstrating large gaps between correctness and environment preservation. We thereby show that current agents remain brittle in multilingual, agentic scenarios, especially for long-horizon tasks and under state-preservation constraints
- Abstract(参考訳): 複雑な環境でのマルチステップタスクの解決にLLMを使用したエージェントが増えているにもかかわらず、既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な基礎化されたシナリオへのアプリケーションをテストすることはめったにない。
これらの懸念に対処するために、WorldBench: エージェントが構造化されたアクションを介してサンドボックスで動作可能な、本物のペルソナの日常ワークフローを総合的に多言語でベンチマークする。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、言語と文化特有の専門知識を持つ人間のアノテータからのフィードバックによってフィルタリングされ、洗練されている。
評価のために、従来の作業からメトリクスを拡張し、自然言語命令とテストベッドを組み合わせた制約付きタスク継承(CTS)を導入し、決定論的およびLCM-as-a-Judge評価を通じてタスク完了、最小修正、その他の補完的メトリクスを評価する。
実験の結果,フロンティアモデルは49.2%にしか達せず,全てのモデルでは正しさと環境保全のギャップが大きいことがわかった。
したがって、多言語、エージェントシナリオ、特に長期タスクや状態保存制約下では、現在のエージェントは脆弱であることを示す。
関連論文リスト
- PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents [72.96251271825038]
大規模言語モデル(LLM)エージェントは、計画、ツールの使用、外部環境との相互作用を必要とする長い水平タスクにおいて、強いパフォーマンスを示している。
ほとんどの既存のベンチマークでは、単一の言語内で実行プロセス全体が実行されるモノリンガルな設定を暗黙的に仮定している。
多言語長時間労働作業におけるエージェント評価のためのベンチマークであるPolyWorkBenchを紹介する。
論文 参考訳(メタデータ) (2026-07-07T08:50:09Z) - CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks [64.22418143822016]
CulturALLは、大規模言語モデルの多言語的・多文化的な能力を評価するためのベンチマークである。
51の領域から14の言語で2,610のサンプルが含まれており、16のトピックに分散して、接地されたタスクの全幅をキャプチャしている。
実験の結果、最高のLLMはカルトゥルルルで44.48%の精度を達成し、改善の余地があることが示されている。
論文 参考訳(メタデータ) (2026-04-21T09:21:46Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z) - Ticket-Bench: A Kickoff for Multilingual and Regionalized Agent Evaluation [4.563830993050022]
タスク指向シナリオにおける多言語エージェント評価のためのベンチマークであるTicket-Benchを紹介する。
Ticket-Benchは、ポルトガル語、英語、スペイン語、ドイツ語、イタリア語、フランス語の6つの主要言語にわたるサッカーチケット購入のドメインをシミュレートしている。
我々は,関数呼び出しの精度と言語間の一貫性を計測し,多種多様な商用およびオープンソース LLM の評価を行った。
論文 参考訳(メタデータ) (2025-09-17T23:13:47Z) - IberBench: LLM Evaluation on Iberian Languages [2.3034630097498883]
大規模言語モデル(LLM)は、特に英語以外の言語に対しては、包括的な評価が難しい。
IberBench は基本的な NLP タスクと産業関連 NLP タスクの両方において LLM 性能を評価するために設計されたベンチマークである。
1億から1400億のパラメータから23のLSMを評価し、その強度と限界に関する実証的な洞察を提供する。
論文 参考訳(メタデータ) (2025-04-23T17:48:25Z) - P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs [84.24644520272835]
本稿では,P-MMEvalを提案する。P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P -M
P-MMEvalは、さまざまなデータセットにわたって一貫した言語カバレッジを提供し、並列サンプルを提供する。
我々は、モデルとタスク間の性能を比較するために、代表的多言語モデル系列に関する広範な実験を行う。
論文 参考訳(メタデータ) (2024-11-14T01:29:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。