論文の概要: M-SQE: Multilingual Skill Quality Estimation for Enhancing Language Equality in Agentic Skill Use
- arxiv url: http://arxiv.org/abs/2609.18445v1
- Date: Wed, 16 Sep 2026 10:36:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.758734
- Title: M-SQE: Multilingual Skill Quality Estimation for Enhancing Language Equality in Agentic Skill Use
- Title(参考訳): M-SQE:エージェントスキル利用における言語品質向上のための多言語スキル品質評価
- Abstract要約: 検索後のスキル品質評価フレームワークであるM-SQEを提案する。
M-SQEは、品質の理論ビューとタスクグラウンドユーティリティのアクションビューを通じて候補をスコアする。
我々は,M-SQEを3つのスキル・ユース領域,ツール・ユース,文化的タスクで評価する。
- 参考スコア(独自算出の注目度): 38.85115169474078
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills, reusable procedural documents that extend LLM agents beyond their parametric memory, have become an important interface for deploying agents on real-world tasks. Community-maintained skill libraries built around this interface are growing rapidly. However, this ecosystem remains deeply English-centric: our audit finds that low-resource languages such as Swahili and Hindi have no in-language skill content, so retrieval often returns a skill written in a different language than the query, degrading accuracy and recall. A practical solution is to synthesize in-language skills for retrieval but the quality can be unreliable, so relevance in this setting alone often surfaces a related but unusable candidate. To address this, we propose M-SQE, a post-retrieval Multilingual Skill Quality Estimation framework that scores candidates via a Theory view for intrinsic quality and an Action view for task-grounded utility, unified into a domain-conditioned final score. We evaluate M-SQE across three skill-use domains: general, tool-use, and cultural tasks. Empirically, we build three-layer candidate skill pools mirroring today's ecosystem, where M-SQE's task success exceeds existing baseline's average by at least +3.5 points across three different retrievers. Particularly, M-SQE lifts the lowest-resource languages most (+12.9pp on Hindi and +5.6pp on Swahili) and achieves strong performance across all six culture regions, thereby moving agentic skill use toward linguistic and cultural equality.
- Abstract(参考訳): LLMエージェントをパラメトリックメモリを超えて拡張する再利用可能な手続き文書であるエージェントスキルは、現実世界のタスクにエージェントをデプロイするための重要なインターフェースとなっている。
このインターフェースを中心に構築されたコミュニティ保守型スキルライブラリは急速に成長している。
私たちの監査では、スワヒリ語やヒンディー語のような低リソース言語には言語内スキルコンテンツがないため、検索はクエリと異なる言語で書かれたスキルを返却し、精度を低下させ、リコールすることが多い。
実用的な解決策は、検索のための言語スキルを合成することだが、品質は信頼性が低いため、この設定だけでは、関連性はあるが使用不可能な候補が現れることが多い。
そこで本研究では,M-SQEを提案する。M-SQE,M-SQE,M-SQE,M-SQE,M-SQE,M-SQE,M-SQE,M-SQE,M-SQE。
我々は,M-SQEを3つのスキル・ユース領域,ツール・ユース,文化的タスクで評価する。
実証的に、M-SQEのタスク成功が既存のベースラインの平均を3つの異なるレトリバーで少なくとも3.5ポイント越える、今日のエコシステムを反映した3層候補スキルプールを構築した。
特に、M-SQEは最も低いリソース言語(ヒンディー語では+12.9pp、スワヒリ語では+5.6pp)を持ち上げ、6つの文化圏で強いパフォーマンスを発揮し、それによって言語と文化の平等に向けたエージェントスキルの使用が促進される。
関連論文リスト
- WorldBench: Culturally Grounded Benchmark for Multilingual Agents [69.76002914143531]
既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な根拠のあるシナリオへのアプリケーションをテストすることはめったにない。
We present WorldBench: a comprehensive, multilingual benchmark, where agent can act in a sandbox via structured action。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、人間のアノテータからのフィードバックによってフィルタリングされ洗練されている。
論文 参考訳(メタデータ) (2026-09-01T10:53:07Z) - MAPS: A Multilingual Benchmark for Global Agent Performance and Security [8.275240552134338]
多様な言語やタスクにまたがるエージェントAIシステムを評価するためのベンチマークスイートであるMAPSを提案する。
それぞれのデータセットを11の多様な言語に変換し、805のユニークなタスクと9,660の言語固有のインスタンスを生成します。
我々は、英語から他の言語に移行する際に、パフォーマンスとセキュリティの両方の劣化を観察する。
論文 参考訳(メタデータ) (2025-05-21T18:42:00Z) - SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages [77.75535024869224]
東南アジアの言語に合わせたSeaLLMsモデルファミリーの最新版SeaLLMs 3を紹介します。
SeaLLMs 3は、英語、中国語、インドネシア語、ベトナム語、タイ語、タガログ語、マレー語、ビルマ語、クメール語、ラオス語、タミル語、ジャワ語など、この地域で話される言語全般をカバーすることで、このギャップを埋めることを目指している。
我々のモデルは、世界的知識、数学的推論、翻訳、命令の追従といったタスクに優れており、同様の大きさのモデルで最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-07-29T03:26:22Z) - M3GIA: A Cognition Inspired Multilingual and Multimodal General Intelligence Ability Benchmark [25.44666570272266]
我々は,MLLMの汎用知能を評価するために,認知駆動型多言語・多モーダルベンチマークを導入した。
我々は,知能のモデルであるキャッテル・ホルン・キャロル(CHC)に基づいて,5つの認知要因を同定した。
私たちは英語を超えて、中国語、フランス語、スペイン語、ポルトガル語、韓国語など、その人気に基づいて他の言語を包含しています。
論文 参考訳(メタデータ) (2024-06-08T04:07:09Z) - Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models [79.46179534911019]
大規模言語モデル (LLM) は多言語機能を示しているが、ほとんどは不均衡なトレーニングコーパスのため英語中心である。
実世界のユーザクエリと非英語中心のLLMに評価を拡張し、多言語性能のより広範な評価を提供する。
論文 参考訳(メタデータ) (2024-03-15T12:47:39Z) - DIALIGHT: Lightweight Multilingual Development and Evaluation of
Task-Oriented Dialogue Systems with Large Language Models [76.79929883963275]
DIALIGHTは多言語タスク指向対話(ToD)システムの開発と評価のためのツールキットである。
ローカル発話レベルとグローバル対話レベルの両方において、人間のきめ細かい評価のためのセキュアでユーザフレンドリーなWebインターフェースを備えている。
評価の結果, PLMの微調整により精度とコヒーレンスが向上する一方, LLMベースのシステムは多様で類似した応答を生成するのに優れていた。
論文 参考訳(メタデータ) (2024-01-04T11:27:48Z) - M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining
Large Language Models [76.88692952308084]
M3Examは、多言語、マルチモーダル、マルチレベルコンテキストにおける大規模言語モデル(LLM)を評価するためのベンチマークである。
M3Examには、9つの言語で12,317の質問があり、3つの教育レベルがある。
我々は,M3Exam上でのLLMの性能評価を行い,GPT-4を含む現在のモデルが多言語テキストに苦戦していることを確認した。
論文 参考訳(メタデータ) (2023-06-08T13:21:29Z) - Learning to Answer Multilingual and Code-Mixed Questions [4.290420179006601]
質問応答(QA)は、人間とコンピュータのシームレスな相互作用において重要な要素である。
もっとも古い研究分野の1つであるにもかかわらず、現在のQAシステムは多言語クエリを扱う上で重要な課題に直面している。
この論文は、多言語環境でエンドユーザクエリを扱うためのQA技術の進歩に焦点を当てている。
論文 参考訳(メタデータ) (2022-11-14T16:49:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。