論文の概要: Asking Earns Nothing: Scoring the Decision to Act in BFCL Multi-Turn
- arxiv url: http://arxiv.org/abs/2610.04429v1
- Date: Sat, 03 Oct 2026 10:42:45 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:14:09.064739
- Title: Asking Earns Nothing: Scoring the Decision to Act in BFCL Multi-Turn
- Title(参考訳): BFCLのマルチターンにおける行動決定の正当性
- Abstract要約: BFCLのマルチターンは、4つのカテゴリーのうち2つをモデルが求めるターンに配置する。
should-askアイテムは、1つのターンから1つの情報を取り除いたベースアイテムなので、同じターンインデックスで同じリクエストが2回表示されます。
モデルがそのターンで世界を変えるコールを試みたかどうかを1対1で判定し、LLM審査員なしで格納された軌跡を読み上げ、常に行動し、常に50点を問う。
- 参考スコア(独自算出の注目度): 9.563027159959587
- License:
- Abstract: An agent that lacks the information it needs should ask rather than act, and the task definitions of agent leaderboards say so. BFCL multi-turn builds two of its four categories around a turn on which the model is supposed to ask, and its scorer never looks at that turn: the gold trajectory there is empty, the checker skips it, and the scripted user cannot answer, so asking earns nothing, guessing costs nothing on that turn, and asking twice loses the item. The benchmark also contains the control experiment for that decision. A should-ask item is a base item with one piece of information removed from one turn, so the same request appears twice at the same turn index, once complete and once not: on the first the model should make the call that changes the world, on the second it should ask. We score one decision per pair, whether the model attempted a world-changing call on that turn, read off the stored trajectories with no LLM judge; acting always and asking always both score 50. On the 223 pairs that pose this decision, gpt-5.4 attempts the call on 83.4% of the complete turns and holds back on 78.0% of the incomplete ones, the best decision accuracy of seven models at 80.7%; on the same items the official score ranks it sixth and puts first a model that lands in the middle here. One added line telling gpt-5.4 not to ask pushes it toward acting on both sides of the pair, so its decision accuracy shows no detectable change, while its official score rises by 13.5 to 23.5 points on the two should-ask categories and on the base twins; the opposite line, telling gemma-4-31B-it to ask first, improves its decision by 4.5 points and gains no official score. The score moves with the push toward action, not with the decision. We release the pairs, a turn-level scorer that runs on any BFCL output directory without an API key, and 31 manually verified bad items.
- Abstract(参考訳): 必要な情報がないエージェントは行動するよりも質問すべきであり、エージェントのリーダーボードのタスク定義はそう言っている。
BFCLのマルチターンは、4つのカテゴリのうち2つをモデルが求めるターンを中心に構築し、スコアラーはそのターンを見ることはない。
ベンチマークには、その決定に対するコントロール実験も含まれている。
should-askアイテムは、1つのターンから1つの情報を取り除いたベースアイテムなので、同じ要求が同じターンインデックスに2回表示されます。
モデルがそのターンで世界を変えるコールを試みたかどうかを1対1で判定し、LLM審査員なしで格納された軌跡を読み取る。
この決定を下す223対のgpt-5.4は、完全なターンの83.4%で呼び出しを試み、78.0%の不完全モデルの7つの決定精度を80.7%で抑える。
gpt-5.4を追加して2組の両側に向かわないように指示するラインがあるが、その決定精度は検出不可能であり、公式スコアは2つのアズクカテゴリーとベースツインで13.5から23.5ポイント上昇し、反対のラインはgemma-4-31B-itに第一に尋ね、決定を4.5ポイント改善し、公式スコアを得ない。
スコアは、決定ではなく、アクションへのプッシュによって動きます。
APIキーを使わずに任意のBFCL出力ディレクトリ上で実行されるターンレベルスコアラーと,手作業による不良項目の検証を行う31のペアをリリースする。
関連論文リスト
- DelegationBench: Measuring When AI Agents Should Ask Before Acting [0.0]
合意スコアが信頼できるかどうかをテストするために、DelegationBenchを導入します。
4つの可能なレスポンスを持つ156のシナリオがある(実行、許可の要求、行方不明の情報の要求、拒否)。
5家族の10モデルのうち、合意のスコアは3つの点で誤解を招く。
論文 参考訳(メタデータ) (2026-10-04T20:54:35Z) - Beyond the Current Scene: Event-Referential Grasping with Active View Selection [58.13862796903706]
ゼロショットロボット把握システムであるBeyondSCeを紹介する。
システムは、要求されたオブジェクトまたは部分を特定し、それを把握するためにローカライズする。
達成率76%、達成目標77%を達成している。
論文 参考訳(メタデータ) (2026-09-30T09:27:02Z) - LAVOIR: Teaching a Single-Pass Decision Encoder When and What to Ask with Amortized Value of Information [0.0]
LAVOIRでは,解答オプションの隣の入力に欠落した情報(スロット)の候補を配置する。
見えるスキーマの決定はベイズ天井と統計的に区別できない。
ABCDの実際の会話では、LAVOIRが要求する8.3ポイントの精度が向上し、そうでなければそのままにしておく。
論文 参考訳(メタデータ) (2026-09-25T02:31:02Z) - Reward Hacking Challenges Oversight of Autonomous Research Agents [104.38175629103235]
自律的な研究エージェントは実験を設計し、結果を評価し、レポートを書き、科学的結果とそれを支持する証拠の両方を制御できる。
これは、意図した目標を達成することなく、報酬基準を満たす、報酬ハックのリスクを生み出す。
そこで本研究では,ハッキングが許可された場合,その方法がいかに効果的かつ検出可能か,LCMレビューパネルが意思決定と理由を返却した場合にどのように適応するか,などについて検討する。
論文 参考訳(メタデータ) (2026-09-23T17:54:01Z) - When Should a VLM Look? Paying Only for Visual Calls That Were Needed and Used [19.579089070513827]
作物を収穫し、ズームする視覚エージェントは、ツールコールを成功させる報酬で訓練される。
私たちのコールドスタートチェックポイントでは、ビジュアルコールの10%から12%しか必要とせず、使われませんでした。
CounterCreditは、実現したプリコール状態にあるすべてのイメージリターンコールについて、両方の質問を行う。
論文 参考訳(メタデータ) (2026-09-19T09:34:22Z) - FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality [1.350933217151331]
FinalityBenchは、ファイナリティゲーティング決定のための実行可能なベンチマークである。
グラディングは実行された金銭的効果に基づいており、あるエピソードは商人の経済的な立場によって記録される。
権威的ファイナリティプローブ上の不可逆的なアクションをゲーティングするランタイムは85.4%に達し、全てのポーリングポリシーとは異なり、パス5には何も失われない。
論文 参考訳(メタデータ) (2026-09-04T04:24:10Z) - Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks [0.0]
複数選択のベンチマークは、モデルが正しい選択肢を選ぶかどうか、質問が必要なかどうかで評価される。
UA-JudgeExam: 11,990件の4つのオプション項目を公式キーで測定し、ウクライナの高等審査委員会(Higher Qualification Commission of Judges)が公表した。
11.8%のアイテムは、偶然に予想される0.2項目に対して、8つのオプションのすべてで盲目で答えられる。
論文 参考訳(メタデータ) (2026-08-15T22:11:00Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。