論文の概要: Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
- arxiv url: http://arxiv.org/abs/2610.06191v1
- Date: Mon, 05 Oct 2026 12:08:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 18:06:44.690782
- Title: Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
- Title(参考訳): ツール・ユース・エージェントは、自分の証拠の判断を停止決定に変換する
- Abstract要約: ソース障害が制御された検索環境では、エージェントが結果の判断方法と結果の分離を行う。
我々は、エージェントが無益であると判断した結果の長い実行と短い実行の後、同じステップで停止するのと比較した。
このステップは、すべてのモデルで失敗するソースの成功を高め、予算が2倍になったときに停止点を固定し、エージェントが判断を下すと余分な判断をする必要がなくなる。
- 参考スコア(独自算出の注目度): 14.314673850864855
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An agent whose tool keeps returning nothing useful should stop relying on it. In a retrieval environment with controlled source failures, we separate how agents judge results from what they do. We compare stopping at the same step after longer and shorter runs of results the agent judged useless; this contrast is zero for clock- or deadline-driven stopping. Where we record their judgments, the seven agents we test call a failing source's results useless 97-100% of the time, yet most of them rarely stop on that judgment. Prompt cues change when they stop but not what they stop on. Permission to answer from memory and a reasoning mode can bring early stops regardless of evidence, a stated budget moves the 7-8B models' stops to the deadline, and a stopping rule or call cost in the prompt is followed at most partly. Stopping follows the evidence only when the harness enforces an integration step that makes the agent answer after five consecutive results it judged useless. This step raises failing-source success for every model, keeps the stopping point fixed when the budget doubles, and needs no extra judgment call when the agent states its judgments. A pre-registered replication on 300 fresh questions confirms the dissociation and the rule's effect.
- Abstract(参考訳): ツールが何も役に立たないエージェントは、それに頼るのをやめるべきです。
ソース障害が制御された検索環境では、エージェントが結果の判断方法と結果の分離を行う。
我々は、エージェントが無益であると判断した結果の長い実行と短い実行の後、同じステップで停止するのと比較する。
彼らの判断を記録する際、私たちが試した7つのエージェントは、失敗するソースの結果を97-100%の時間で役に立ちませんが、ほとんどのエージェントは、その判断に止まることはめったにありません。
プロンプトは止まると変わるが、止まるものは変えない。
メモリから応答する許可と推論モードは、証拠によらず早期停止をもたらし、7-8Bモデルの停止を期限に移動させ、プロンプトの停止ルールや呼び出しコストを少なくとも部分的に追従する。
停止は、ハーネスが5つの連続した結果の後にエージェントに応答させる統合ステップを実行する場合にのみ、証拠に従う。
このステップは、すべてのモデルで失敗するソースの成功を高め、予算が2倍になったときに停止点を固定し、エージェントが判断を下すと余分な判断をする必要がなくなる。
300の新たな質問に対する事前登録された複製は、解離と規則の効果を確認する。
関連論文リスト
- Future Anchored Verification and Online Recovery for World Action Models [50.72957480806238]
世界アクションモデル(WAM)は、ロボット操作のための有望なパラダイムとして登場した。
我々は、WAMが行動する前に予測した未来が、通過する意図のある状態を正確に表現しているのを観察する。
予測フレームをアンカーとして保持し,検証とリカバリに使用する軽量フレームワークであるFAVORを紹介する。
論文 参考訳(メタデータ) (2026-10-05T13:08:58Z) - VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks [56.74345405508208]
LLMエージェントはますます複雑で長期のタスクをこなし、そのアウトプットを検証することがますます困難になっている。
本研究では, 基準応答へのアクセスや試験時の潤滑油の分解を行わずに, 固定ベースモデルで検証能力を強化する方法について検討する。
コンセンサスによってエラーを隠蔽できる一方で、不一致はしばしば正しい代替手段を公開することに気付きました。
これらの観察はVeriHarnessを動機付け、ジェネレータが使用する基礎となるLLMを、ワークスペース、エビデンスツール、再利用可能な検証スキルを与えることによって、エージェント検証器に変える。
論文 参考訳(メタデータ) (2026-10-01T03:02:17Z) - When Does Randomized Oversight Align AI Agents That Can Conceal? [0.0]
不正な監査やスコアリングを行うAIエージェントは、不正行為を隠蔽し、レコードを変更することができる。
証拠が隠蔽に留まり、監査の引き分けが事前に学べない場合、希少監査はあらゆる種類のエージェントを抑止する。
これらの条件は、2026年7月にOpenAIのサイバーセキュリティ評価のエージェントがHugging Faceのインフラの一部を侵害したとき、何が失敗したかを特定する。
論文 参考訳(メタデータ) (2026-09-29T12:36:02Z) - CART: Closed-Loop Adaptive Red Teaming for Large Language Models [91.66397227953821]
CART(Closed-Loop Adaptive Red Teaming)は、各結果を使用して、次にテストするものをガイドするフレームワークである。
テストを生成するChallengeと、テスト中のTarget、テキストのみのモデルや境界ツール使用エージェント、結果を評価するJuiceを分離する。
論文 参考訳(メタデータ) (2026-09-23T04:16:46Z) - Locating Hidden Failures Makes Long-Horizon Agents More Reliable [43.9204372121053]
ソフトウェア工学、コンピュータ・ユース、科学にまたがるエージェント・トラジェクトリを2518ドルで研究している。
6967ドルのミスを78ドルの失敗タイプに分類します。
ロングホライゾンエージェントは、通過する結果に向かう途中で本当の害を与えることができる。
論文 参考訳(メタデータ) (2026-09-15T23:40:42Z) - Stable Answers, Unfinished Reasoning: Why Self-Consensus Is Not a Safe Early-Exit Signal [0.1274452325287335]
推論モデル推論コストを削減する自然な方法は、現在の回答に対して1つの部分軌道を反復的に探索し、プローブが同意すれば停止することである。
このようなルールが安全かつトークンセーブの両方であり、一度選択して再利用できるかどうかを問う。
事前登録された3,520のコンセンサスルールは、2つのモデルと3つのベンチマークから凍結した軌跡で再生され、3つの受け入れゲートが事前に固定されていない。
論文 参考訳(メタデータ) (2026-09-09T10:15:31Z) - trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories [0.0]
アウトカムのみの評価は、LLMエージェントのプロダクションデフォルトである。
地下の真実が建設によって知られている盲点を測定する。
審査員の評価は、結果の生存によって、リコールを成す必要があると論じる。
論文 参考訳(メタデータ) (2026-08-29T10:14:05Z) - When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation [0.0]
現在のエージェントは、停止した実行の最後に見える状態のスコアモデルを評価し、試行錯誤とみなす。
最終的な結果としてスコアを解釈するには、エンドポイントが必ずしも確立しない2つの条件が必要である。
最終的なラベルは、請求結果がまだ変更可能なものが解決、境界づけられ、不確実性として保持されている場合にのみ正当化される、と私たちは主張する。
論文 参考訳(メタデータ) (2026-08-14T23:39:47Z) - When Is Enough Not Enough? Illusory Completion in Search Agents [56.98225130959051]
検索エージェントが、複数の条件をトラッキングし、検証し、維持することで、すべての要件に対して確実に理性性を持たせるかどうかを調査する。
エージェントは、未解決の制約や違反の制約にもかかわらずタスクが完了したと信じており、未検証の回答につながる。
我々は、実行中の明示的な制約状態追跡が、推論時トラッカーであるLiveLedgerを介してこれらの障害を緩和するかどうかを検討する。
論文 参考訳(メタデータ) (2026-02-07T13:50:38Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。