論文の概要: PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2607.06008v1
- Date: Tue, 07 Jul 2026 08:50:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.459574
- Title: PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents
- Title(参考訳): PolyWorkBench: 多言語LLMエージェントのベンチマーク
- Abstract要約: 大規模言語モデル(LLM)エージェントは、計画、ツールの使用、外部環境との相互作用を必要とする長い水平タスクにおいて、強いパフォーマンスを示している。
ほとんどの既存のベンチマークでは、単一の言語内で実行プロセス全体が実行されるモノリンガルな設定を暗黙的に仮定している。
多言語長時間労働作業におけるエージェント評価のためのベンチマークであるPolyWorkBenchを紹介する。
- 参考スコア(独自算出の注目度): 72.96251271825038
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents have shown strong performance in long-horizon tasks that require planning, tool use, and interaction with external environments. However, most existing benchmarks implicitly assume a monolingual setting, where the entire execution process, including reasoning, tool invocation, and output generation, is conducted within a single language. In contrast, real-world applications often involve multilingual inputs and outputs within a unified workflow, yet the interaction between multilinguality and agentic execution remains underexplored. In this work, we introduce PolyWorkBench, a benchmark for evaluating LLM agents on multilingual long-horizon workplace workflows. PolyWorkBench consists of 67 tasks across five domains, including commerce, knowledge work, legal analysis, localization, and manufacturing, where agents must process heterogeneous multilingual inputs, perform iterative reasoning, invoke external tools, and produce structured outputs. To enable comprehensive evaluation, we propose a hybrid framework that combines structural grading, executable verification, and LLM-based semantic assessment. This design allows us to capture both functional correctness and linguistic consistency across complex workflows. Empirical results show that state-of-the-art LLM agents suffer significant performance degradation in multilingual workflow settings compared to monolingual counterparts. Our analysis suggests that multilinguality introduces compounding effects across reasoning and execution steps, highlighting the importance of jointly modeling language variation and procedural decision-making in agent evaluation.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、計画、ツールの使用、外部環境との相互作用を必要とする長い水平タスクにおいて、強いパフォーマンスを示している。
しかしながら、ほとんどの既存のベンチマークでは、推論、ツール呼び出し、出力生成を含む実行プロセス全体が単一の言語内で実行される、モノリンガルな設定を暗黙的に仮定している。
対照的に、現実世界のアプリケーションは統合ワークフロー内で多言語入力と出力を伴うことが多いが、多言語性とエージェント実行の相互作用は未解明のままである。
本稿では,多言語長時間労働ワークフロー上でのLLMエージェント評価のためのベンチマークであるPolyWorkBenchを紹介する。
PolyWorkBenchは、商取引、知識労働、法的な分析、ローカライゼーション、製造を含む5つのドメインにわたる67のタスクで構成されており、エージェントは異種多言語入力を処理し、反復推論を実行し、外部ツールを実行し、構造化された出力を生成する必要がある。
包括的評価を可能にするために,構造化グレーディング,実行可能検証,LLMに基づくセマンティックアセスメントを組み合わせたハイブリッドフレームワークを提案する。
この設計により、複雑なワークフローにまたがる機能的正確性と言語的一貫性の両方をキャプチャできる。
実験の結果, 従来のLLMエージェントは, 多言語ワークフロー設定において, モノリンガルと比べ, 顕著な性能劣化がみられた。
分析の結果,多言語性は推論と実行ステップにまたがって複合的効果をもたらすことが示唆され,エージェント評価における言語変化と手続き的決定の重要性が強調された。
関連論文リスト
- WorldBench: Culturally Grounded Benchmark for Multilingual Agents [69.76002914143531]
既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な根拠のあるシナリオへのアプリケーションをテストすることはめったにない。
We present WorldBench: a comprehensive, multilingual benchmark, where agent can act in a sandbox via structured action。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、人間のアノテータからのフィードバックによってフィルタリングされ洗練されている。
論文 参考訳(メタデータ) (2026-09-01T10:53:07Z) - Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks [22.908904483320953]
コーディングタスクにおけるLarge Language Models (LLM) は、しばしばその広範な事前学習コーパスの反映である。
動作プリミティブのセットをLCMに装備する一般のIRAフレームワークであるIRAエージェントを提案する。
我々は,Cangjie 用の ILA エージェントをインスタンス化し,コード生成,翻訳,プログラム修復タスクのパフォーマンスを評価する。
論文 参考訳(メタデータ) (2026-01-16T09:06:47Z) - From over-reliance to smart integration: using Large-Language Models as translators between specialized modeling and simulation tools [0.3749861135832073]
大規模言語モデル(LLM)はモデリングとシミュレーション(M&S)に変革をもたらす
過信リスクは曖昧さ、論理的ショートカット、幻覚によって品質を損なう。
本稿では,M&Sタスクにおける複雑性を軽減するため,特殊なツール間でLLMを翻訳器として統合することを提唱する。
論文 参考訳(メタデータ) (2025-06-11T02:39:08Z) - EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models [64.70546873396624]
大規模言語モデル(LLM)を評価するためのEIFBENCH(Extremely Complex Instruction following Benchmark)を提案する。
EIFBENCHにはマルチタスクシナリオが含まれており、多様なタスクタイプを同時に総合的に評価することができる。
また,LLMのマルチタスクワークフローを正確に満たす能力を高めるために,セグメントポリシー最適化(SegPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-10T02:39:55Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - Collaboration is all you need: LLM Assisted Safe Code Translation [4.3764649156831235]
UniTranslatorは、複数のコンパクトLLM間の協調的な取り組みとしてコード翻訳を再想像するフレームワークである。
特殊なエージェントのインタラクションを編成することによって、UniTranslatorは、より大きなモノリシックモデルに匹敵する精度と効率のレベルを達成する。
論文 参考訳(メタデータ) (2025-03-14T09:42:07Z) - LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models [89.13128402847943]
LUSIFERは,LLMをベースとした多言語タスクの埋め込みモデルに,多言語監視を必要とせずに適用可能なゼロショット方式である。
LUSIFERのアーキテクチャは多言語エンコーダを組み、言語ユニバーサル学習者として機能し、埋め込み固有のタスクに最適化されたLLMベースの埋め込みモデルと組み合わせている。
5つの主要な埋め込みタスク、123の多様なデータセット、14言語にわたるカバレッジを含む新しいベンチマークを導入する。
論文 参考訳(メタデータ) (2025-01-01T15:43:07Z) - P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs [84.24644520272835]
本稿では,P-MMEvalを提案する。P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P-MMEval,P -M
P-MMEvalは、さまざまなデータセットにわたって一貫した言語カバレッジを提供し、並列サンプルを提供する。
我々は、モデルとタスク間の性能を比較するために、代表的多言語モデル系列に関する広範な実験を行う。
論文 参考訳(メタデータ) (2024-11-14T01:29:36Z) - Multilingual Large Language Models Are Not (Yet) Code-Switchers [41.47534626749588]
大規模言語モデル(LLM)は、最近、幅広いタスクにおいて優れた機能を示している。
発話の中で言語を交互に行う習慣は、いまだにほとんど受け継がれていない。
LLMの現在の「多言語主義」は、本質的にはコードスイッチングテキストの習熟度を示唆していない、と我々は主張する。
論文 参考訳(メタデータ) (2023-05-23T16:50:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。