論文の概要: The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
- arxiv url: http://arxiv.org/abs/2609.25804v2
- Date: Wed, 23 Sep 2026 03:47:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.675204
- Title: The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
- Title(参考訳): 味覚エージェント:長期作業における味覚の測定と改善
- Abstract要約: Taste-Benchは、エンジニアリングタスクのエージェントが生成する軌跡から自動的に構築される味覚質問のベンチマークである。
我々は、Taste-Benchのフロンティアモデルを評価し、最良のモデルが質問の59.7%しか正しく答えていないことを発見した。
結果を見た教師の判断を学生モデルに精査し、学生は見当たらない課題についてより良い判断を下す。
- 参考スコア(独自算出の注目度): 54.378597734485744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents increasingly work on long-horizon tasks, and the decisions they make along the way, such as which hypothesis to test or which implementation to build on, determine the outcome of the whole run. Making these decisions well is becoming a key capability for both engineering and research agents. We refer to the ability to make good long-horizon decisions as the taste of an agent. While existing benchmarks measure the end-to-end success of agents on long-horizon tasks, none of them measures the taste of an agent. To address this problem, we build Taste-Bench, a benchmark of taste questions constructed automatically from trajectories that agents produced in engineering and research tasks. Each question presents a decision fork, a point in a trajectory where multiple directions are available and one of them leads to a better outcome, and the evaluated model chooses among these directions without seeing what happens after the fork. We mine these forks automatically from parallel attempts at the same task and from detours inside a single trajectory, without needing human annotation. We evaluate frontier models on Taste-Bench and find that the best model answers only 59.7% of the questions correctly. We further find that forks whose deciding evidence appears later in the trajectory are much harder for every model, and that a larger reasoning budget does not improve the accuracy. Finally, we show that taste can be trained. We distill the judgment of a teacher that has seen the outcome into a student model, and the student makes better decisions on unseen tasks and improves end-to-end success on held-out SWE-bench Pro tasks.
- Abstract(参考訳): LLMエージェントはますます長期のタスクに取り組んでおり、どの仮説をテストするか、どの実装を構築するかといった決定が実行全体の結果を決定する。
これらの決定をうまく行うことは、エンジニアリングエージェントと研究エージェントの両方にとって重要な能力になりつつある。
我々は,エージェントの味として,優れた長期的意思決定を行う能力について言及する。
既存のベンチマークは、長期的なタスクにおけるエージェントのエンドツーエンドの成功を測定するが、エージェントの味を測定するものはない。
この問題に対処するために、エンジニアリングや研究タスクで生成するエージェントの軌跡から自動的に構築された味覚質問のベンチマークであるTaste-Benchを構築した。
各質問は、複数の方向が利用可能で、そのうちの1つがより良い結果をもたらす軌道上の点である決定フォークを示し、評価されたモデルは、フォークの後に何が起こるかを知ることなく、これらの方向の中から選択する。
これらのフォークは、同じタスクにおける並列的な試みから、人間のアノテーションを必要とせずに、単一の軌道内でのデトラクションから自動的にマイニングします。
我々は、Taste-Benchのフロンティアモデルを評価し、最良のモデルが質問の59.7%しか正しく答えていないことを発見した。
さらに、後述する証拠が軌跡に現れるフォークは、すべてのモデルにとってはるかに困難であり、より大きな推論予算が精度を向上しないことがわかった。
最後に、味覚を訓練できることを示します。
学生モデルに結果を見出した教師の判断を精査し、学生は目に見えない課題についてより良い判断をし、持たないSWE-bench Proタスクにおけるエンドツーエンドの成功を改善する。
関連論文リスト
- AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning [57.72181998599248]
AgentFugueは、共通の推論ハブを中心に構築された、集合的推論フレームワークである。
ピアエージェントが同じタスクを並列に探索する際、ハブは各エージェントが何を確立、試み、あるいは除外したかを簡潔に記録する。
この結果から,集団推論によってピアエージェントシステムのスケールアウトが実現可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-23T09:21:51Z) - Optimizing Coverage and Difficulty in Reinforcement Learning for Quiz Composition [7.215573039552987]
提案するトピックのカバレッジと難易度を満たすクイズを構成するためにエージェントを訓練することを目的として、汎用的なシーケンシャルな意思決定問題を定式化する。
我々は、RLが最良のクイズに着陸する能力を研究するための、合成および実際のデータセットに関する広範な実験を行う。
論文 参考訳(メタデータ) (2026-03-29T13:46:02Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Understanding Code Agent Behaviour: An Empirical Study of Success and Failure Trajectories [10.751728274263536]
本稿では,エージェントのトラジェクトリ,すなわちソフトウェア問題の解決に際し,エージェントが行うステップを捉えた実行トレースについて,実証的研究を行う。
我々は、SWE-Benchベンチマークで、最先端の3つのコードエージェント(OpenHands、SWE-agent、Prometheus)の軌跡を分析し、成功と失敗の両方について検討した。
論文 参考訳(メタデータ) (2025-10-31T18:58:13Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z) - Designing Closed-Loop Models for Task Allocation [36.04165658325371]
我々は、ブートストラップモデルトレーニングと人間とタスクの類似性に関する弱い事前情報を利用する。
このような弱い事前の使用は、人間の意思決定者が誤りを犯したりバイアスを受けたりしても、タスク割り当て精度を向上させることができることを示す。
論文 参考訳(メタデータ) (2023-05-31T13:57:56Z) - The Paradox of Choice: Using Attention in Hierarchical Reinforcement
Learning [59.777127897688594]
サブゴールオプションのさらなる学習に使用できる、オンラインでモデルフリーなアルゴリズムを提案する。
訓練データ収集におけるハード・ソフト・アテンションの役割,長期的タスクにおける抽象的価値学習,および多数の選択肢に対する対処について検討する。
論文 参考訳(メタデータ) (2022-01-24T13:18:02Z) - Automatic Curriculum Learning through Value Disagreement [95.19299356298876]
新しい未解決タスクを継続的に解決することが、多様な行動を学ぶための鍵です。
エージェントが複数の目標を達成する必要があるマルチタスク領域では、トレーニング目標の選択はサンプル効率に大きな影響を与える可能性がある。
そこで我々は,エージェントが解決すべき目標のための自動カリキュラムを作成することを提案する。
提案手法は,13のマルチゴールロボットタスクと5つのナビゲーションタスクにまたがって評価し,現在の最先端手法よりも高い性能を示す。
論文 参考訳(メタデータ) (2020-06-17T03:58:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。