論文の概要: From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and Scale
- arxiv url: http://arxiv.org/abs/2609.35149v1
- Date: Mon, 28 Sep 2026 13:31:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 16:39:26.332828
- Title: From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and Scale
- Title(参考訳): マイグレーションからキャリブレーション: モデル、判断、スケールにわたるエージェント能力の保存
- Abstract要約: エージェントキャリブレーションを3つの相互作用層にまたがる制約付き行動適応として定式化する。
基本的な目的は、目標要件を満たしつつ、事前特定能力対策の非劣化である。
モデル変更,クロスボーダ適応,スケールに対するホールドアウト評価を提案する。
- 参考スコア(独自算出の注目度): 4.321360447503974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agents need calibration when deployment conditions change: replacing a driving model, including a foundation-to-post-trained transition; crossing jurisdictions; or scaling across heterogeneous markets and sources. Interface compatibility alone does not establish capability retention or target-contract satisfaction. We formulate agent calibration as constrained behavioral adaptation across three interacting layers: information preservation, harness adaptation, and user acceptance; the layers apply to every scenario, not one-to-one to the three. The basic objective is non-degradation on prespecified capability measures while satisfying target requirements; aggregate improvement is stronger. Information calibration preserves independently validated source content still applicable to the target task. Harness calibration aligns observable artifacts at semantic checkpoints and repairs them through iteration, tool substitution, or local replanning within explicit budgets. User calibration enforces recipient-specific output contracts: templates, schemas, and section-level preferences. A global e-commerce example shows how shared standards coexist with site- and market-specific adapters and validation. We distinguish trainable policies from frozen-backbone configuration or controller optimization, and evidence verification from relative judgment and DPO/GRPO optimization. Recent harness-transfer and judge-validity studies motivate target-native execution records, separate audits of task validity and near-tie ranking, and matched target-native optimization controls. We propose held-out evaluations for model changes, cross-border adaptation, and scale, including a factorial test of source evidence and checkpoint repair and group-level reporting to prevent aggregate gains from masking local failures. This is a methodological proposal; implementation and empirical validation remain future work.
- Abstract(参考訳): エージェントは、デプロイ条件が変わるとキャリブレーションを必要とします。例えば、基礎から訓練後の移行を含む、運転モデルを置き換えること、管轄区域を横断すること、異種市場やソースをまたがるスケーリングです。
インターフェースの互換性だけでは、機能維持や目標契約満足度を確立しません。
我々は,エージェントキャリブレーションを情報保存,利用適応,ユーザ受け入れの3つの相互作用層にまたがる制約付き行動適応として定式化し,各シナリオに適用する。
基本的目的は、目標要件を満たしつつ、事前特定能力対策の非劣化であり、総合的な改善はより強固である。
情報キャリブレーションは、目標タスクにまだ適用可能な、独立して検証されたソースコンテンツを保存する。
Harness Calbrationは、セマンティックチェックポイントで観測可能なアーティファクトを調整し、イテレーション、ツール置換、明示的な予算内でのローカルなリプランを通じて修正する。
ユーザキャリブレーションは、テンプレート、スキーマ、セクションレベルの好みといった、受信者固有の出力コントラクトを強制する。
グローバルなeコマースの例は、共有標準がサイト固有のアダプタやバリデーションとどのように共存しているかを示している。
トレーニング可能なポリシは,フリーズバックボーン構成やコントローラ最適化と区別し,相対的判断とDPO/GRPO最適化とのエビデンス検証を行う。
近年のハーネス・トランスファー・ジャッジ・バリダリティ研究は、目標-ネイティブ実行記録のモチベーション、タスク妥当性の個別監査とニアティーランキングの分離、および一致した目標-ネイティブ最適化制御を動機付けている。
本稿では, モデル変更, クロスボーダー適応, スケールに対するホールドアウト評価を提案し, 情報源証拠の因子的検証, チェックポイント修復, グループレベルの報告を行い, 集合ゲインが局所的故障を隠蔽することを防ぐ。
これは方法論的な提案であり、実装と実証的な検証は今後も継続される。
関連論文リスト
- Federated Targeted Maximum Likelihood Estimation [15.722746871859593]
クロスサイロ学習は計算をデータに移動させ、合意された要約を交換する。
我々は2つのサイロを通して、任意の目標、損失、変動家族のためのターゲティング自体を連携させた。
FedTMLEGは、局所的な勾配を集約し、ステップの集中的なターゲティングステップを再現する。
FedTMLELは、各機関が適合した更新を単一に交換する前に、独自のゆらぎを完了させる。
論文 参考訳(メタデータ) (2026-09-24T19:43:40Z) - Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - Learning to Adapt and Calibrate: Score Distribution Alignment for Few-Shot Uncertainty Prediction in Medical VLMs [9.993859591441238]
本研究では,非交換性下でのコンフォーマルな不確実性推定で教師付き少数ショット適応を再現する枠組みを提案する。
AlignCPは、ラベル付きサポートセットとラベルなしクエリセットとのスコアレベルの相違を低減するために、再重み付きキャリブレーション分布を学習する。
論文 参考訳(メタデータ) (2026-09-09T15:32:01Z) - More Data, Worse Decisions? Preference Reversals in Neural Networks under Gram Incompatibility [9.196757973061198]
ケースベース決定理論(CBDT)は、その構成公理を通じて要求を定式化する。
この特性が、通常最小二乗(OLS)出力ヘッドを持つ固定表現ニューラルネットワークに対していつ保持されるかを検討する。
意思決定からタスク定義ユーティリティ損失まで、厳密なペアの逆転をトレースする3段階の監査を開発する。
論文 参考訳(メタデータ) (2026-07-28T18:52:47Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Interactive Critique-Revision Training for Reliable Structured LLM Generation [18.00222080273147]
DPA-GRPOは,構成された検証器の介入による2人プレイヤジェネレータゲームのためのペアアクショントレーニング手法である。
我々は,非正規化ゲームを分析し,厳格に低いリワード介入やリビジョン行動に対する肯定的な確率が,一側偏差を生み出すことを示す。
TaxCalc TY24の実験では、DPA-GRPOはゼロショット生成とジェネレータのみのRLベースラインよりも構造化された決定精度を向上させる。
論文 参考訳(メタデータ) (2026-05-08T17:00:38Z) - K$α$LOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks [4.297070083645049]
本稿では,「ローカライゼーションファースト」の原理を一般化した統一メタアルゴリズムであるK$LOSを提案する。
合意を査定する前に空間対応を解消することにより,複雑な分類問題を名目上の信頼性に変換する。
論文 参考訳(メタデータ) (2026-03-28T08:54:05Z) - Contrastive Model Adaptation for Cross-Condition Robustness in Semantic
Segmentation [58.17907376475596]
意味的セグメンテーションのための正規-逆条件モデル適応について検討する。
提案手法は, コントラスト学習を通じて条件不変の特徴を学習するために, このような画像ペアを利用する。
いくつかの正規-逆適応ベンチマークにおけるモデル適応のための最先端セマンティックセマンティックセマンティクス性能を実現する。
論文 参考訳(メタデータ) (2023-03-09T11:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。