論文の概要: Finding Blind Spots in AppWorld and WorkArena Task Verifiers
- arxiv url: http://arxiv.org/abs/2610.09142v1
- Date: Tue, 06 Oct 2026 21:34:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.614944
- Title: Finding Blind Spots in AppWorld and WorkArena Task Verifiers
- Title(参考訳): AppWorldとWorkArenaタスク検証で盲点を見つける
- Abstract要約: 実行ベースのタスク検証器は、エージェントが成功したかどうかを決定する。
ソースインフォームド突然変異テストで出荷されたAppWorldとWorkArenaの検証を監査した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Execution-based task verifiers decide whether an agent succeeded. We audit shipped AppWorld and WorkArena verifiers with source-informed mutation tests. The main audit never modifies a shipped checker. In AppWorld, duplicating a non-idempotent write creates an extra record while preserving every checked field value. The verifier accepts all three task variants from two of five eligible generators: 6/15 constructed effects. A cardinality patch applied to checker copies after the census makes all six cells fail while preserving valid controls. In WorkArena, we prospectively rerun 23 extra-field candidates selected for earlier checker-PASS outcomes. Independent Table API readback confirms nondefault persisted values in 21, while all 23 receive PASS. Two requested strings are aliases of stored defaults. The 21 confirmed wrong effects span three form templates. These selected cases confirm wrong effects under the audit's protocol; they do not estimate a population rate. No other construction produces an independently confirmed false accept. Other checker-PASS cases are effect-correct degeneracies. We report zero-PASS families separately because retained evidence differs. In fixed intent-swap grids, the checkers return no PASS on 2,689 off-diagonal executions. This is a rejection census: 57 WorkArena cells use session-scoped evidence; the other 2,632 lack classified rejection causes and independent target ground truth. Each increment is specified before its own cells are scored. A supplement accompanies the OpenReview submission with the construction grammar, evidence, content-bound stage lineage and count reproducer.
- Abstract(参考訳): 実行ベースのタスク検証器は、エージェントが成功したかどうかを決定する。
ソースインフォームド突然変異テストで出荷されたAppWorldとWorkArenaの検証を監査した。
メイン監査は、出荷されたチェッカーを変更することはない。
AppWorldでは、非イデミティブな書き込みを複製すると、チェックされたフィールド値をすべて保存しながら追加レコードが生成される。
検証者は、5つの許容可能なジェネレータのうち2つから3つのタスク変種を全て受け入れる:6/15構成効果。
国勢調査後、チェッカーコピーに適用された濃度パッチは、有効な制御を維持しながら6つの細胞全てを失敗させる。
ワークアリーナでは,早期のチェッカーPASSの結果から選ばれた23のフィールド外候補を前向きに再選する。
独立テーブルAPIの読み取りは21で非デフォルト持続値を確認し、23人はPASSを受け取る。
2つのリクエストされた文字列は、保存されたデフォルトのエイリアスである。
21の間違った効果は3種類のテンプレートで確認された。
これらの選択されたケースは、監査のプロトコルの下で間違った効果を確認し、人口率を見積もるものではない。
他の構成では、独立に確認された偽の受け入れは得られない。
その他のチェッカー-PASSのケースは、エフェクト・コレクト・デジェネティクスである。
証拠が異なっていたため,無PASS家族を別々に報告した。
固定されたインテントスワップグリッドでは、チェッカーは2,689のオフ対角実行でPASSを返さない。
57のWorkArena細胞はセッションスコープによる証拠を使用しており、残りの2,632個は分類された拒絶原因と独立したターゲットの真実を欠いている。
各インクリメントは、自身のセルが得点される前に指定される。
サプリメントは、構築文法、エビデンス、コンテンツバウンドステージの系統、カウントレコーダを含むOpenReviewの提出に伴う。
関連論文リスト
- Discriminating Fixture Coverage in Agent-Infrastructure Verification Suites [8.475591798270258]
マルチセッションエージェント状態投影層に対する変異解析を不変スイートに適用する。
マルチセッションエージェント・ステート・プロジェクション・レイヤの不変集合に突然変異解析を適用すると、この標準バリデーションがスイートを認証していることが最初にわかる。
その後、修復された12チェックスイートを凍結し、ハッシュを記録し、敵リーダが指定した10のミュータントに対して一度実行します。
論文 参考訳(メタデータ) (2026-10-02T07:17:41Z) - Independent Verification Paths Are Not Independent: A Case Study of Common-Mode Failure in a Satellite Catalogue Pipeline [0.0]
我々は、地球周回物体の2つのオープンレジスタのクロスカタログ整合性研究において、そのようなゲートの1つが故障していることを報告した。
どちらのパスも同じ定数をインポートし、ソースのステータス語彙の誤読をエンコードした。
メカニズム、すべてのフィギュアを調整するオブジェクトレベルの台帳、ソースのドキュメントに遡る3つのチェックを与えます。
論文 参考訳(メタデータ) (2026-09-29T13:53:23Z) - Where the Numbers Come From: Auditing Evaluation in Provenance-Based Intrusion Detection [42.49426058823369]
証明に基づく侵入検知器のスコアを再現しても、そのアラームの出力やエンコーダが使用する情報についてそのスコアが何を言っているかは定かでない。
我々は、リリースした9つの実装を監査し、独自のコードを使用して4つの検出器を実行し、3つの測定効果を分離する。
論文 参考訳(メタデータ) (2026-09-27T13:01:02Z) - CART: Closed-Loop Adaptive Red Teaming for Large Language Models [91.66397227953821]
CART(Closed-Loop Adaptive Red Teaming)は、各結果を使用して、次にテストするものをガイドするフレームワークである。
テストを生成するChallengeと、テスト中のTarget、テキストのみのモデルや境界ツール使用エージェント、結果を評価するJuiceを分離する。
論文 参考訳(メタデータ) (2026-09-23T04:16:46Z) - From Experiments to Decisions: Reusing Evidence in Autonomous Coding Research [0.0]
我々は400タスクのNeuroGolfキャンペーンでエビデンスをどのように再利用するかを再構築する。
数値的な反例は、オーバーブロード排除を公開する。
他のエピソードでは、失敗、不完全、そして修正されたプログラムが次に行うことを正当化する。
論文 参考訳(メタデータ) (2026-09-10T03:48:31Z) - Rent-a-RAG: Embedding-Space Watermarks for Auditing Third-Party RAG [43.39396127458633]
サードパーティの検索強化世代(RAG)マーケットプレースでは,新たな監査問題が発生している。
我々は,プロバイダ側のセマンティックな透かしとブラックボックス監査フレームワークであるDirBucketを提案する。
DirBucketは、埋め込みがプロバイダとプロバイダの秘密の方向に偏っている意味保存のパラフレーズによって文書を透かし出す。
論文 参考訳(メタデータ) (2026-09-03T12:20:00Z) - Selection-Aware Stress Testing for Interactive Agents [40.135301960368906]
SASSTは、発見タスクの事前実行機能からタスクの重み付けを学習し、別個の確認タスクで同じペア比較を評価する。
プロトコルはサポートと安定性をチェックし、計画されたすべてのクレームにジョイントバウンドを使用し、クレームを返さない。
論文 参考訳(メタデータ) (2026-08-31T14:58:04Z) - From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering [0.0]
公開資料のみから、AIレコードがクレームを表現できるかどうか、宣言された場所を保持できるかどうかを測定する。
188個の二重グレード細胞で、デフォルトレコードが行動システムのコンテンツアイデンティティを出力するプラットフォームは見つからなかった。
計器は、パイプラインが発行した排気のみからの保証深度を計算し、宣言された深さと比較する。
論文 参考訳(メタデータ) (2026-08-21T16:45:00Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch [47.836680625916266]
テストスイート監査官として機能する市販のコーディングエージェントは、どちらも、公式スイートが見逃すものを公開するために、敵対的なテストスイートを構築します。
認証チェーンは、各エージェントフラッグされた申請が、公式の裁判官に頼らずに、真にバグだらけであるか否かを判定する。
Codeforceは、利用可能なオフィシャルスイートを持たない問題に対して、同じテストビルディングメソッドを使用して、テストされた入力予算毎に5つの再生ベースラインを導出する。
論文 参考訳(メタデータ) (2026-08-03T05:24:03Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。