論文の概要: Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
- arxiv url: http://arxiv.org/abs/2608.11110v2
- Date: Thu, 13 Aug 2026 04:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.719715
- Title: Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
- Title(参考訳): 言葉よりも口を傾ける行動:ツール・ユース・エージェントにおける言語間政策維持の測定
- Abstract要約: ツール使用エージェントは別の言語で同じタスクを与えられるが、それでも同じステップを踏むだろうか?
アクションポリシーを,8つのモデル,6つの並列ベンチマーク,41の言語で測定対象とする。
- 参考スコア(独自算出の注目度): 22.30468215041597
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a tool-using agent is given the same task in a different language, does it still take the same steps? Multilingual evaluation rarely asks: it compares final answers and discards the actions. Yet those actions are the product: they fix cost and latency, decide how the system fails, and are the only auditable part of its behaviour. We make the action policy the measured object across 8 models, 6 parallel benchmarks and 41 languages (2.38M rollouts). The naive measurement fails: five confounds sit between raw trace similarity and any defensible claim, each able to flip a conclusion. Short traces score higher, empty traces score perfectly, unrelated traces agree by chance over half the time, the gap is capped by each model's reproducibility, and a model asked the same question twice in one language answers differently, leaving no baseline. We remove all five, and every correction makes the effect larger. Divergence proves structural, not sampling noise: it survives greedy decoding in every cell and stays flat as temperature rises, even as models grow less self-consistent. Normalised by their own reproducibility, four very different frontier models converge under greedy decoding, each keeping 71-73% of its action policy across languages, with model identity explaining only 5.7% of the variance. Below roughly 10B parameters it breaks down, and the ordering among smaller models is largely an artifact of a chance floor we measure by permutation rather than assume. Agents route non-English tasks through English; this pivot is causally load-bearing, confirmed by a pre-registered prediction across four models, and models will not abandon it when told to. Finally, a single trace-extraction regex, not the model, manufactured a multilingual failure: two worked examples raise one model's measured accuracy twenty-sixfold while its accuracy on readable outputs barely moves.
- Abstract(参考訳): ツール使用エージェントが別の言語で同じタスクを与えられたとき、それでも同じステップを踏むだろうか?
最終回答を比較して、アクションを破棄する。
コストとレイテンシを修正し、システムがどのように失敗するかを決定し、その振る舞いの中で唯一監査可能な部分である。
アクションポリシーを,8つのモデル,6つの並列ベンチマーク,41言語(238万ロールアウト)で測定対象とする。
単純な測定は失敗する: 5つの欠点は、生のトレース類似性と、任意の防御可能なクレームの間にあり、それぞれが結論を覆すことができる。
短いトレーススコアは高く、空のトレーススコアは完璧で、無関係のトレースは半分以上の確率で一致し、ギャップは各モデルの再現性によって制限される。
私たちは5つすべてを取り除き、すべての修正が効果を大きくします。
多様性は、ノイズをサンプリングするのではなく構造的であることを証明している。それは、モデルが自己一貫性を減らしながらも、すべてのセルで強欲な復号を保ち、温度が上昇するにつれて平らに保たれる。
それぞれの再現性によって正規化され、4つの非常に異なるフロンティアモデルがグリーディ復号の下で収束し、それぞれが71-73%のアクションポリシーを言語間で保持し、モデルの同一性は分散の5.7%しか説明できない。
およそ10Bのパラメータで分解し、小さなモデル間の順序付けは、仮定よりも置換によって測定されるチャンスフロアのアーティファクトである。
エージェントは英語を介して非英語タスクをルーティングする。このピボットは因果的にロードベアリングであり、4つのモデルにまたがって事前登録された予測によって確認される。
最後に、モデルではなく1つのトレース抽出残差が多言語的故障を発生させた: 2つの実験例は、1つのモデルの測定精度を20倍に上げ、読みやすい出力の精度はわずかに動く。
関連論文リスト
- Measuring Stability and Failure Behavior in Language Models Under Structured Perturbations [0.5076419064097734]
ストレステスト推論モデルのための、グレード付き、多家族対応のフェールアウェアフレームワークを提案する。
それぞれの問題を7つのファミリーにまたがる複数のレベルの重大さのはしごに沿ってゆがめている。
すべてのテストは、その測定された重症度によって評価され、ラベル付けされる。
論文 参考訳(メタデータ) (2026-08-22T23:46:11Z) - Prompt-Model Interaction Reaches the Fixed Points: A deterministic, task-free structural readout -- and the factorizations of it that failed [0.0]
ショートウィンドウ argmax map x_t+1 = argmax_x p(x | x_t-1, x_t) の固定点構造は96 から始まる。
6つのモデルのうち4つは、ウィンドウ16で完全に失われている。
第一に、相互作用は全等級でこの読み出しに達する:条件付けの9つのトークンは、そのほとんどにわたって固定点分数を動かす。
論文 参考訳(メタデータ) (2026-08-21T17:25:18Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Language Models Agree With Each Other, Not With Readers [1.8620637029128544]
我々は、その目的のために構築された誰もいない人間の参照に対する収束を測定する。
120のWebドキュメントに2,523のリードマークがある。
読者が読むものよりも確実に読者に同意するモデルはない。
論文 参考訳(メタデータ) (2026-07-31T10:44:10Z) - OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment [0.9821874476902969]
逆ペアによる方向バイアスを検出するOptimismBenchを導入する。
ポストトレーニングではバイアスの兆候が示され、異なる家族の反対のシフトが示される。
モデル毎の指向性監査のために,10言語で3,870項目をリリースしています。
論文 参考訳(メタデータ) (2026-07-29T14:38:55Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts [51.84894623128418]
現代の推論言語モデルは、すべてのトークンが寄与し、ステップを順番に消費しなければならないと暗黙的に仮定して、シーケンシャルな連鎖トレースを生成する。
我々は、モデル生成推論連鎖に適用した、系統的な介入パイプライン、除去、マスキング、シャッフル、ノイズ注入により、両方の仮定に挑戦する。
解答抽出は, スパース, 秩序不感, 構造的に堅牢な情報基板上で行う。
論文 参考訳(メタデータ) (2026-05-08T06:15:50Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures [0.0]
我々は、モデルのエラーが出力コミット前に検出可能で、一度検出されると修正できる程度、統治性を導入します。
ベンチマーク精度は支配可能性を予測するものではなく、補正能力は検出と独立に異なり、同一のガバナンス足場はモデル間で逆の効果をもたらす。
本稿では,モデルとタスクの組み合わせをGovernable, Monitor Only, Steer Blind, Ungovernableの4つに分類する。
論文 参考訳(メタデータ) (2026-03-22T21:50:28Z) - Confidence-Based Model Selection: When to Take Shortcuts for
Subpopulation Shifts [119.22672589020394]
モデル信頼度がモデル選択を効果的に導くことができるConfidence-based Model Selection (CosMoS)を提案する。
我々はCosMoSを,データ分散シフトのレベルが異なる複数のテストセットを持つ4つのデータセットで評価した。
論文 参考訳(メタデータ) (2023-06-19T18:48:15Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z) - Few-shot Learning with Multilingual Language Models [66.49496434282564]
多様な言語群をカバーするバランスの取れたコーパス上で,多言語の自動回帰言語モデルを訓練する。
私たちの最大のモデルは、20以上の代表言語で数ショットの学習において、新しい最先端の技術を定めています。
本稿では,モデルがどこで成功し,失敗するかを詳細に分析し,特に言語間の文脈内学習を可能にすることを示す。
論文 参考訳(メタデータ) (2021-12-20T16:52:35Z) - NLP-CIC @ DIACR-Ita: POS and Neighbor Based Distributional Models for
Lexical Semantic Change in Diachronic Italian Corpora [62.997667081978825]
本稿では,イタリア語に対する教師なし語彙意味変化のシステムと知見について述べる。
その課題は、対象の単語が時間とともにその意味を進化させたかどうかを判断することであり、それは2つの時間固有のデータセットからの原文のみに依存する。
本研究では,各期間に対象単語を表す2つのモデルを提案し,しきい値と投票方式を用いて変化単語を予測する。
論文 参考訳(メタデータ) (2020-11-07T11:27:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。