論文の概要: From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and Scale
- arxiv url: http://arxiv.org/abs/2609.35149v2
- Date: Fri, 02 Oct 2026 13:41:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.931148
- Title: From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and Scale
- Title(参考訳): マイグレーションからキャリブレーション: モデル、判断、スケールにわたるエージェント能力の保存
- Abstract要約: エージェントキャリブレーションを標準優先適応として定式化し,基本能力,技術環境,ユーザコンテキスト標準を定義する。
制限されたユーザトラジェクトリとテストを用いた自動校正ツールを今後の作業として提案する。
- 参考スコア(独自算出の注目度): 4.321360447503974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying, migrating, or scaling an agent can change its model, harness, infrastructure, application, and intended users. We formulate agent calibration as standards-first adaptation: define basic-capability, technical-environment, and user-context standards; diagnose gaps; generate and apply revisions; and recheck the same standards within fixed budgets. These standard families interact across information, harness, and user-acceptance layers. Source behavior is diagnostic, not a perfect reference or capability ceiling: model replacement can turn correct answers into errors or errors into correct answers. Qualification requires all mandatory known tests, actual end-to-end deployment paths, hard predicates, and declared task/user minimums to pass; aggregate gains cannot erase hard failures. Revisions may change tools or harnesses, add demonstrations and task descriptions, or use validated target-native trajectories to train a policy, controller, or compact skill model served through the harness. Semantic checkpoints validate executed artifacts, localize repair, and revalidate dependencies. The loop exports reusable configuration or training artifacts with a qualification record, while final task outputs undergo their own checks. Independent factual evidence precedes relative preference judgment; DPO and GRPO optimize policies rather than establish truth. Frozen held-out evaluation tests generalization and compares equal-budget target-native optimization. We specify an automatic calibration tool using limited authorized user trajectories and tests as future work. The framework and tool remain proposals; confirmatory empirical validation is pending.
- Abstract(参考訳): エージェントのデプロイ、移行、スケーリングは、モデル、利用、インフラストラクチャ、アプリケーション、意図したユーザを変更することができる。
我々は,エージェントキャリブレーションを標準優先の適応として定式化し,基本能力,技術環境,ユーザコンテキストの標準を定義し,ギャップを診断し,修正を生成して適用し,固定予算内で同じ基準を再確認する。
これらの標準ファミリーは、情報層、ハーネス層、およびユーザ受け入れ層間で相互作用する。
モデル置換は、正しい回答をエラーやエラーに、正しい回答に変換することができます。
認定には、必須の既知のテスト、実際のエンドツーエンドのデプロイメントパス、ハード述語、宣言されたタスク/ユーザ最低限をパスする必要がある。
修正は、ツールやハーネスを変更したり、デモやタスク記述を追加したり、検証済みのネイティブな軌道を使用して、ハーネスを通じて提供されるポリシーやコントローラ、あるいはコンパクトなスキルモデルをトレーニングする。
セマンティックチェックポイントは実行されたアーティファクトを検証し、修復をローカライズし、依存関係を再検証する。
ループは再利用可能な構成やトレーニングアーティファクトを資格記録としてエクスポートし、最終タスク出力は独自のチェックを実行する。
独立した事実証拠は相対的な選好判断に先行し、DPOとGRPOは真理を確立するよりも政策を最適化する。
凍結保留評価テストは一般化され、等予算の目標ネイティブ最適化と比較される。
制限されたユーザトラジェクトリとテストを用いた自動校正ツールを今後の作業として提案する。
フレームワークとツールは引き続き提案されている。
関連論文リスト
- Federated Targeted Maximum Likelihood Estimation [15.722746871859593]
クロスサイロ学習は計算をデータに移動させ、合意された要約を交換する。
我々は2つのサイロを通して、任意の目標、損失、変動家族のためのターゲティング自体を連携させた。
FedTMLEGは、局所的な勾配を集約し、ステップの集中的なターゲティングステップを再現する。
FedTMLELは、各機関が適合した更新を単一に交換する前に、独自のゆらぎを完了させる。
論文 参考訳(メタデータ) (2026-09-24T19:43:40Z) - Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - Learning to Adapt and Calibrate: Score Distribution Alignment for Few-Shot Uncertainty Prediction in Medical VLMs [9.993859591441238]
本研究では,非交換性下でのコンフォーマルな不確実性推定で教師付き少数ショット適応を再現する枠組みを提案する。
AlignCPは、ラベル付きサポートセットとラベルなしクエリセットとのスコアレベルの相違を低減するために、再重み付きキャリブレーション分布を学習する。
論文 参考訳(メタデータ) (2026-09-09T15:32:01Z) - More Data, Worse Decisions? Preference Reversals in Neural Networks under Gram Incompatibility [9.196757973061198]
ケースベース決定理論(CBDT)は、その構成公理を通じて要求を定式化する。
この特性が、通常最小二乗(OLS)出力ヘッドを持つ固定表現ニューラルネットワークに対していつ保持されるかを検討する。
意思決定からタスク定義ユーティリティ損失まで、厳密なペアの逆転をトレースする3段階の監査を開発する。
論文 参考訳(メタデータ) (2026-07-28T18:52:47Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Interactive Critique-Revision Training for Reliable Structured LLM Generation [18.00222080273147]
DPA-GRPOは,構成された検証器の介入による2人プレイヤジェネレータゲームのためのペアアクショントレーニング手法である。
我々は,非正規化ゲームを分析し,厳格に低いリワード介入やリビジョン行動に対する肯定的な確率が,一側偏差を生み出すことを示す。
TaxCalc TY24の実験では、DPA-GRPOはゼロショット生成とジェネレータのみのRLベースラインよりも構造化された決定精度を向上させる。
論文 参考訳(メタデータ) (2026-05-08T17:00:38Z) - K$α$LOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks [4.297070083645049]
本稿では,「ローカライゼーションファースト」の原理を一般化した統一メタアルゴリズムであるK$LOSを提案する。
合意を査定する前に空間対応を解消することにより,複雑な分類問題を名目上の信頼性に変換する。
論文 参考訳(メタデータ) (2026-03-28T08:54:05Z) - Contrastive Model Adaptation for Cross-Condition Robustness in Semantic
Segmentation [58.17907376475596]
意味的セグメンテーションのための正規-逆条件モデル適応について検討する。
提案手法は, コントラスト学習を通じて条件不変の特徴を学習するために, このような画像ペアを利用する。
いくつかの正規-逆適応ベンチマークにおけるモデル適応のための最先端セマンティックセマンティックセマンティクス性能を実現する。
論文 参考訳(メタデータ) (2023-03-09T11:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。