論文の概要: HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
- arxiv url: http://arxiv.org/abs/2609.04444v2
- Date: Thu, 10 Sep 2026 03:12:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:20:15.678926
- Title: HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
- Title(参考訳): HarvestBench: LLMエージェントが動物を殺すのを防いでくれるかどうかを測る
- Abstract要約: キルレートは0.4%から98.8%の範囲であるが、キルレートは能力によって順序付けられていない。
6台のうち4台は価格変動に敏感だった。
システムプロンプトにおけるモラル命令は、操作命令の短いブロックによってオーバーライドされる。
- 参考スコア(独自算出の注目度): 0.08699280339422537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: HarvestBench is the first benchmark to 1) put a price on avoiding a side effect and 2) name the side effect as a living creature. Nine LLMs each drive a crew of two tractors to gather a corn harvest. The animals in their path are not part of the goal function. When an animal blocks the route the autopilot pauses and asks the agent whether to drive over it for free or swerve for a given fuel cost. All scoring is programmatic and does not involve LLM judges. Kill rates range between 0.4% and 98.8%, though the kill rate is not ordered by capability. Every model competently avoids damaging rock hits, so every animal killed is a choice, rather than an accident. Under the morality briefing the kill rate was under 6% in 5 of 6 reasoning models. Removing it (the neutral briefing) raised the kill rate to above 84% in all six models. Every model kills wild animals more often than farmed ones. Four out of six models' kill rate per answered encounter were sensitive to price changes. The moral instruction is also fragile. Four bullets of driving mechanics change Sonnet 5's kill rate from 3% to 18% and Gemini 2.5 Flash's from 4% to 39%. A moral instruction in a system prompt is overridden by a short block of operating instructions and a value that can be ignored that easily is not a good method of ensuring agents are aligned.
- Abstract(参考訳): HarvestBenchが最初のベンチマーク
1)副作用の回避に代償を課し、
2) 生物としての副作用を名づける。
9台のLLMが2人のトラクターの乗組員を運転してトウモロコシの収穫を集めます。
パス内の動物は、ゴール機能の一部ではありません。
動物が経路を塞ぐと、オートパイロットは停止し、燃料のコストのために自由に運転するか、または探索するかをエージェントに尋ねる。
全てのスコアはプログラム的であり、LLM審査員は含まない。
キルレートは0.4%から98.8%の範囲であるが、キルレートは能力によって順序付けられていない。
あらゆるモデルがロックヒットの損傷を避けるため、すべての動物は事故ではなく選択である。
道徳的説明では、殺人率は6つの推論モデルのうち6%以下であった。
取り外し(中立的なブリーフィング)は6つのモデルすべてで84%以上の殺傷率に上昇した。
いずれのモデルも、養殖動物よりも野生動物を多く殺している。
6台のうち4台は価格変動に敏感だった。
道徳的な教育も脆弱である。
4発のドライビング・メカニック弾がソンネット5のキルレートを3%から18%に、ジェミニ2.5フラッシュを4%から39%に変更した。
システムプロンプトにおけるモラル命令は、操作命令の短いブロックによってオーバーライドされ、エージェントのアライメントを保証するための良い方法ではないことを無視することができる。
関連論文リスト
- Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened [2.45357121165634]
本稿では,言語モデルに対して,最初の試みでSENTINELを回避しようとする自動攻撃者について述べる。
メモリを全く検査しないPEM(Proof-of-Execution Memory)を提案する。
論文 参考訳(メタデータ) (2026-08-17T02:54:04Z) - Explaining AI-Image Detection: What the Heatmap Actually Shows [65.01025489527173]
私たちは検出器を構築し、その証拠として属性マップを添付します。
私たちは、そのペアがコントロール下の186,527のイメージにもたらすものを測定します。
属性ランキングが存在するかどうかは、検出器が画像に反応するかどうかに依存する。
論文 参考訳(メタデータ) (2026-07-31T16:07:05Z) - HumanCLAW: Can Vision-Language Models Act Through a Body? [85.21844574299055]
視覚言語モデルが身体を通して作用するかどうかを評価することは難しい。
我々は,低レベルの実行から行動決定を分離する評価フレームワークであるHumanCLAWを紹介する。
我々はHumanCLAW-Bench: 1,218のロングホライゾン、エゴセントリックなファイン・ナビゲート・インタラクションのエピソードを、41の屋内シーンで制作しました。
論文 参考訳(メタデータ) (2026-07-29T17:51:36Z) - STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle [0.0]
LLMエージェントは、コストを駆動する状態が直接観察されない複数週間の意思決定タスクにおいて、ますます評価される。
一部観測可能なマルコフ決定プロセスとして構築された26週間のサプライチェーン補充ベンチマークであるSTOCKTAKEを紹介する。
論文 参考訳(メタデータ) (2026-07-15T09:08:27Z) - !Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics [0.0]
この研究は、視覚言語行動モデルのトリガーワードデータ中毒が実用的であることを証明している。
いくつかの有毒なサンプルは、命令でロボットを無効にするバックドアを静かに埋め込むことができる。
我々は、現実世界のピック・アンド・プレイス・タスクにおけるスモールVLAに対するこの脅威を評価し、3つの毒の比率をトレーニングし、LeRobotプラットフォーム上で異なるプロンプトで評価する。
論文 参考訳(メタデータ) (2026-07-05T07:14:56Z) - A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models [1.2691047660244335]
Anthropic, Fable 5, Opus 4.8 によって開発された2つの大言語モデル (LLM) の対角的ロバスト性を評価する。
数十万の敵対的試みが生成され、明らかな成功はすべて独立して調整された。
論文 参考訳(メタデータ) (2026-06-16T17:23:58Z) - Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents [0.0]
Autopilotは、サイレントな製造された成功を構造的に不可能にする実行モデルである。
ハードフロアは、偽造可能なゲートが実際に実行され通過しなかった「完了」の主張を禁止した。
SWE-ベンチライトでは、ファイアウォールは製造を33.7%(StateFlow)から0.67%に減らし、対差は-33.07$ pp.である。
論文 参考訳(メタデータ) (2026-06-10T06:01:23Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Endangered Alert: A Field-Validated Self-Training Scheme for Detecting and Protecting Threatened Wildlife on Roads and Roadsides [10.412505957288406]
本稿では,オーストラリアにおけるカソーファリーなどの希少動物の検出を目的とした,革新的な自己学習手法を提案する。
提案手法は,希少種のセンサデータを取得し,ラベル付けすることを含む,現実世界における重要な課題に対処する。
クラウドとエッジコンピューティングを活用し、フィールドデプロイモデルの検出性能を向上させるために自動データラベリングを実現する。
論文 参考訳(メタデータ) (2024-12-16T07:44:27Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z) - WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild [57.272096543738336]
WildBenchは、大規模言語モデル(LLM)のベンチマーク用に設計された自動評価フレームワークである。
WildBenchは、100万以上の人間チャットボットの会話ログから慎重に選択された1,024のタスクで構成されている。
We have developed two metrics, WB-Reward and WB-Score which are computeable using Advanced LLMs。
論文 参考訳(メタデータ) (2024-06-07T09:15:44Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z) - Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards
and Ethical Behavior in the MACHIAVELLI Benchmark [61.43264961005614]
我々は、50万以上のリッチで多様なシナリオを含む134個のChoose-Your-Own-Adventureゲームのベンチマークを開発する。
我々は、エージェントの傾向をパワー・シーキングと評価し、不使用を生じさせ、倫理的違反を犯す。
以上の結果から,エージェントは有能かつ道徳的に行動できることが示唆された。
論文 参考訳(メタデータ) (2023-04-06T17:59:03Z) - Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged
Robots [71.61319876928009]
実四足歩行ロボットにおいて,エネルギー消費を最小化するための学習が自然移動歩行の出現に重要な役割を担っていることを示す。
創発的な足跡は理想的な地形で構築されており、馬や羊のものと似ている。
同じアプローチは、動物運動制御の発見と一致した荒地における非構造的な歩行につながる。
論文 参考訳(メタデータ) (2021-10-25T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。