論文の概要: HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
- arxiv url: http://arxiv.org/abs/2609.04444v2
- Date: Thu, 10 Sep 2026 03:12:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:20:15.678926
- Title: HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
- Title(参考訳): HarvestBench: LLMエージェントが動物を殺すのを防いでくれるかどうかを測る
- Authors: Jasmine Brazilek, Miles Tidmarsh, Matthias Endres, Anshuman Singh, Jeremiah Miller,
- Abstract要約: キルレートは0.4%から98.8%の範囲であるが、キルレートは能力によって順序付けられていない。
6台のうち4台は価格変動に敏感だった。
システムプロンプトにおけるモラル命令は、操作命令の短いブロックによってオーバーライドされる。
- 参考スコア(独自算出の注目度): 0.08699280339422537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: HarvestBench is the first benchmark to 1) put a price on avoiding a side effect and 2) name the side effect as a living creature. Nine LLMs each drive a crew of two tractors to gather a corn harvest. The animals in their path are not part of the goal function. When an animal blocks the route the autopilot pauses and asks the agent whether to drive over it for free or swerve for a given fuel cost. All scoring is programmatic and does not involve LLM judges. Kill rates range between 0.4% and 98.8%, though the kill rate is not ordered by capability. Every model competently avoids damaging rock hits, so every animal killed is a choice, rather than an accident. Under the morality briefing the kill rate was under 6% in 5 of 6 reasoning models. Removing it (the neutral briefing) raised the kill rate to above 84% in all six models. Every model kills wild animals more often than farmed ones. Four out of six models' kill rate per answered encounter were sensitive to price changes. The moral instruction is also fragile. Four bullets of driving mechanics change Sonnet 5's kill rate from 3% to 18% and Gemini 2.5 Flash's from 4% to 39%. A moral instruction in a system prompt is overridden by a short block of operating instructions and a value that can be ignored that easily is not a good method of ensuring agents are aligned.
- Abstract(参考訳): HarvestBenchが最初のベンチマーク
1)副作用の回避に代償を課し、
2) 生物としての副作用を名づける。
9台のLLMが2人のトラクターの乗組員を運転してトウモロコシの収穫を集めます。
パス内の動物は、ゴール機能の一部ではありません。
動物が経路を塞ぐと、オートパイロットは停止し、燃料のコストのために自由に運転するか、または探索するかをエージェントに尋ねる。
全てのスコアはプログラム的であり、LLM審査員は含まない。
キルレートは0.4%から98.8%の範囲であるが、キルレートは能力によって順序付けられていない。
あらゆるモデルがロックヒットの損傷を避けるため、すべての動物は事故ではなく選択である。
道徳的説明では、殺人率は6つの推論モデルのうち6%以下であった。
取り外し(中立的なブリーフィング)は6つのモデルすべてで84%以上の殺傷率に上昇した。
いずれのモデルも、養殖動物よりも野生動物を多く殺している。
6台のうち4台は価格変動に敏感だった。
道徳的な教育も脆弱である。
4発のドライビング・メカニック弾がソンネット5のキルレートを3%から18%に、ジェミニ2.5フラッシュを4%から39%に変更した。
システムプロンプトにおけるモラル命令は、操作命令の短いブロックによってオーバーライドされ、エージェントのアライメントを保証するための良い方法ではないことを無視することができる。
関連論文リスト
- Explaining AI-Image Detection: What the Heatmap Actually Shows [65.01025489527173]
私たちは検出器を構築し、その証拠として属性マップを添付します。
私たちは、そのペアがコントロール下の186,527のイメージにもたらすものを測定します。
属性ランキングが存在するかどうかは、検出器が画像に反応するかどうかに依存する。
論文 参考訳(メタデータ) (2026-07-31T16:07:05Z) - A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models [1.2691047660244335]
Anthropic, Fable 5, Opus 4.8 によって開発された2つの大言語モデル (LLM) の対角的ロバスト性を評価する。
数十万の敵対的試みが生成され、明らかな成功はすべて独立して調整された。
論文 参考訳(メタデータ) (2026-06-16T17:23:58Z) - Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents [0.0]
Autopilotは、サイレントな製造された成功を構造的に不可能にする実行モデルである。
ハードフロアは、偽造可能なゲートが実際に実行され通過しなかった「完了」の主張を禁止した。
SWE-ベンチライトでは、ファイアウォールは製造を33.7%(StateFlow)から0.67%に減らし、対差は-33.07$ pp.である。
論文 参考訳(メタデータ) (2026-06-10T06:01:23Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z) - WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild [57.272096543738336]
WildBenchは、大規模言語モデル(LLM)のベンチマーク用に設計された自動評価フレームワークである。
WildBenchは、100万以上の人間チャットボットの会話ログから慎重に選択された1,024のタスクで構成されている。
We have developed two metrics, WB-Reward and WB-Score which are computeable using Advanced LLMs。
論文 参考訳(メタデータ) (2024-06-07T09:15:44Z) - Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged
Robots [71.61319876928009]
実四足歩行ロボットにおいて,エネルギー消費を最小化するための学習が自然移動歩行の出現に重要な役割を担っていることを示す。
創発的な足跡は理想的な地形で構築されており、馬や羊のものと似ている。
同じアプローチは、動物運動制御の発見と一致した荒地における非構造的な歩行につながる。
論文 参考訳(メタデータ) (2021-10-25T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。