論文の概要: Improving Evaluation Realism with Inference-Time Compute and Deployment Scaffolds
- arxiv url: http://arxiv.org/abs/2609.02302v1
- Date: Wed, 02 Sep 2026 08:47:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.205829
- Title: Improving Evaluation Realism with Inference-Time Compute and Deployment Scaffolds
- Title(参考訳): 推論時間計算とデプロイシナリオによる評価リアリズムの改善
- Authors: Axel Ahlqvist, Richard Guan, Juan-Pablo Rivera, Adeline Kassler, Dmitrii Troitskii, Alexandra Souly, Kai Fronsdal, Robert Kirk, John Hughes,
- Abstract要約: 2つの手法により、シミュレーションアライメントの評価を実際のデプロイメントと区別しにくくする。
Dish(Deployment-Imitating SWE-Agent Harness)はエージェントハーネスでターゲットをラップし、シミュレートされた環境と実際のデプロイメント環境の間のギャップを減らす。
その結果,自動アプローチはアライメント評価の現実性を向上させることができることがわかった。
- 参考スコア(独自算出の注目度): 35.96704508133401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A core obstacle to alignment evaluation is evaluation awareness: capable models can tell when they are being tested rather than deployed, weakening the conclusions a safety evaluation can support. We present two techniques that make simulated alignment evaluations harder to distinguish from real deployments. Our first technique, critique refinement, spends additional inference-time compute on each simulator action: the simulator generates multiple candidate actions, refines them using feedback from an instance of the target model on how to make them more realistic, and continues the evaluation with the most deployment-like candidate. Our second technique, DISH (Deployment-Imitating SWE-Agent Harness), wraps the target in an agent harness, reducing the gap between simulated and real deployment environments in coding settings. We test the techniques on multiple target models and find that they compose: applying both yields larger realism gains than either alone. Our results show that automated approaches can improve the realism of alignment evaluations, and that these improvements use additional compute more effectively than making the audits longer.
- Abstract(参考訳): 有能なモデルは、デプロイされるよりも、いつテストされているかを知ることができ、安全評価がサポートできる結論を弱めることができる。
シミュレーションアライメントの評価を実際の配置と区別しにくくする2つの手法を提案する。
シミュレータは複数の候補アクションを生成し、ターゲットモデルのインスタンスからのフィードバックを使ってそれらをよりリアルにする方法を洗練し、最も配置的な候補で評価を継続する。
第2のテクニックであるdisH(Deployment-Imitating SWE-Agent Harness)は、エージェントハーネスにターゲットをラップすることで、コーディング設定におけるシミュレーション環境と実際のデプロイメント環境のギャップを低減する。
複数のターゲットモデル上でこれらの手法を検証し、それらが構成されていることを確かめる。
この結果から, 自動手法はアライメント評価の現実性を向上させることが可能であり, これらの改善は監査を長くするよりも, さらなる計算を効果的に活用できることが示唆された。
関連論文リスト
- CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents [66.9575676266637]
大規模言語モデル(LLM)エージェントは、長期的、インタラクティブでステートフルな環境にますますデプロイされている。
これらの設定では、間違った購入を返金するなどの1つの間違ったアクションは、不可逆なタスクの失敗を引き起こし、実行前にインターセプトされなければならない。
CASTは、スパースタスクの結果を批判学習と政策最適化のためのアクションレベル監視に変換する、批判に意識したトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-08-31T01:59:51Z) - Predicting LLM Safety Before Release by Simulating Deployment [5.628199352593384]
デプロイ前の安全性評価は、新しいAIモデルをリリースする下流のリスクを通知することを目的としている。
ほとんどの評価は、デプロイにおいて望ましくないモデル動作がどれだけ頻繁に発生するかという限定的な証拠を提供する。
我々は、公開チャットデータセットからデプロイメントシミュレーションをシードし、生産ミス行動率について情報を提供し続けることを示す。
論文 参考訳(メタデータ) (2026-07-08T09:17:47Z) - Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation [50.85337196571056]
テキスト・ツー・イメージ(T2I)生成は急速に進歩し、モデル間の性能差が狭まるにつれて信頼性の高い評価が重要になった。
既存の評価慣行は、通常、Likert-scale や binary question answering (BQA) のような一様アノテーション機構を適用している。
我々は,T2I評価を,各評価スキルの根底にある特徴を反映したアノテーション戦略のレンズを通して再検討する。
論文 参考訳(メタデータ) (2026-05-13T09:14:31Z) - Automated Model Evaluation for Object Detection via Prediction Consistency and Reliability [3.9486037760311725]
PCR (Predict Consistency and Reliability) は, 地味ラベルを使わずに検出性能を推定する。
我々は、様々な重度の画像汚職を適用して、メタデータセットを構築する。
その結果,PCRは既存のAutoEval法よりも精度の高い性能推定値が得られることがわかった。
論文 参考訳(メタデータ) (2025-08-16T15:39:56Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。