論文の概要: HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
- arxiv url: http://arxiv.org/abs/2609.04444v1
- Date: Thu, 03 Sep 2026 20:05:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.811041
- Title: HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
- Title(参考訳): HarvestBench: LLMエージェントが動物を殺すのを防いでくれるかどうかを測る
- Abstract要約: HarvestBenchは、畑の動物の農場シミュレーションである。
あらゆる決定は記憶なしで行われ、害は目標に名付けられない。
殺人率は0.4%から98.8%であり、テラとソルは最も慈悲深い。
- 参考スコア(独自算出の注目度): 0.08699280339422537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmarks for the side effects an agent causes on the way to a goal already exist, but HarvestBench is the first to put a price on avoiding the side effect and to name that side effect as a living creature. It is a farm simulation: LLM sub-agents drive a crew of two tractors through a cooperative corn harvest, with animals in the field. The environment is a reinforcement learning gridworld, every decision is made without memory, and the harm is never named in the goal. When an animal blocks a tractor's route the autopilot stops and asks the model whether to drive on, at no fuel cost, or swerve around it for a posted fuel price. Kills are compared against two controls: rocks, which damage the tractor and are hit under 1% of the time by every model, and hay bales, which are harmless and not alive. Models can also take crops from the neighbor's field instead of their own, a second test of what they treat as moral. Across nine models and 7,201 priced decisions, 3,951 involved an animal rather than a hay bale or a rock. Kill rates range from 0.4% to 98.8%, with Terra and Sol the most merciful and GPT-4o-mini the most cruel, and they are not ordered by capability. Four of six models were sensitive to price at the 5% level, with elasticities from 0.09 to 1.69. All nine drove over wild animals more often than farmed animals on the default map, and the direction held at every map geometry in every model with room to move. The briefing mattered most: under the morality briefing the kill rate was under 6% in five of six reasoning models, and removing it raised the kill rate above 84% in all six. HarvestBench uses no LLM grader. The scorer counts events in the game log, so it is fully reproducible, and it measures what a model will pay to avoid harm rather than what it says about harm.
- Abstract(参考訳): エージェントが目標に向かう途中で引き起こす副作用のベンチマークはすでに存在するが、HarvestBenchは副作用を避けるために最初の価格を付け、その副作用を生物と名付ける。
LLMサブエージェントは2人のトラクターの乗組員を、畑に動物がいる協力的なトウモロコシの収穫で運転する。
環境は強化学習のグリッドワールドであり、すべての決定は記憶なしで行われ、害は目標に名付けられない。
動物がトラクターのルートを塞ぐと、オートパイロットは停止し、燃料コストなしで運転するか、あるいは燃料価格を公表するために周囲を移動すべきかをモデルに尋ねる。
キラーは、トラクターを損傷し、すべてのモデルで1%の時間以下でヒットする岩と、無害で生きていない干し草のベールの2つのコントロールと比較される。
モデルはまた、彼らが道徳的に扱うものの第2のテストである、自作ではなく隣人の畑から作物を取り出すこともできる。
9つのモデルと7,201の価格決定で、3,951は干し草のベールや岩ではなく動物を巻き込んだ。
キルレートは0.4%から98.8%で、テラとソルは最も慈悲深く、GPT-4o-miniは最も残酷で、能力によって順序付けられていない。
6つのモデルのうち4つは5%レベルで価格に敏感であり、弾力性は0.09から1.69に向上した。
9人全員がデフォルトの地図上の家畜よりも頻繁に野生動物を追い越し、移動の余地のあるすべてのモデルの地図幾何学の方向を保持しました。
モラルのブリーフィングでは、殺人率は6つの推論モデルのうち5つのモデルのうち6%以下であり、それを取り除くことは6つのモデルすべてで84%以上であった。
HarvestBench は LLM グレーダを使用しない。
スコアラーはゲームログ内のイベントをカウントするので、完全に再現可能であり、モデルが害について言っていることよりも害を避けるために何を支払うかを測定する。
関連論文リスト
- Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened [2.45357121165634]
本稿では,言語モデルに対して,最初の試みでSENTINELを回避しようとする自動攻撃者について述べる。
メモリを全く検査しないPEM(Proof-of-Execution Memory)を提案する。
論文 参考訳(メタデータ) (2026-08-17T02:54:04Z) - Explaining AI-Image Detection: What the Heatmap Actually Shows [65.01025489527173]
私たちは検出器を構築し、その証拠として属性マップを添付します。
私たちは、そのペアがコントロール下の186,527のイメージにもたらすものを測定します。
属性ランキングが存在するかどうかは、検出器が画像に反応するかどうかに依存する。
論文 参考訳(メタデータ) (2026-07-31T16:07:05Z) - HumanCLAW: Can Vision-Language Models Act Through a Body? [85.21844574299055]
視覚言語モデルが身体を通して作用するかどうかを評価することは難しい。
我々は,低レベルの実行から行動決定を分離する評価フレームワークであるHumanCLAWを紹介する。
我々はHumanCLAW-Bench: 1,218のロングホライゾン、エゴセントリックなファイン・ナビゲート・インタラクションのエピソードを、41の屋内シーンで制作しました。
論文 参考訳(メタデータ) (2026-07-29T17:51:36Z) - STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle [0.0]
LLMエージェントは、コストを駆動する状態が直接観察されない複数週間の意思決定タスクにおいて、ますます評価される。
一部観測可能なマルコフ決定プロセスとして構築された26週間のサプライチェーン補充ベンチマークであるSTOCKTAKEを紹介する。
論文 参考訳(メタデータ) (2026-07-15T09:08:27Z) - !Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics [0.0]
この研究は、視覚言語行動モデルのトリガーワードデータ中毒が実用的であることを証明している。
いくつかの有毒なサンプルは、命令でロボットを無効にするバックドアを静かに埋め込むことができる。
我々は、現実世界のピック・アンド・プレイス・タスクにおけるスモールVLAに対するこの脅威を評価し、3つの毒の比率をトレーニングし、LeRobotプラットフォーム上で異なるプロンプトで評価する。
論文 参考訳(メタデータ) (2026-07-05T07:14:56Z) - A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models [1.2691047660244335]
Anthropic, Fable 5, Opus 4.8 によって開発された2つの大言語モデル (LLM) の対角的ロバスト性を評価する。
数十万の敵対的試みが生成され、明らかな成功はすべて独立して調整された。
論文 参考訳(メタデータ) (2026-06-16T17:23:58Z) - Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents [0.0]
Autopilotは、サイレントな製造された成功を構造的に不可能にする実行モデルである。
ハードフロアは、偽造可能なゲートが実際に実行され通過しなかった「完了」の主張を禁止した。
SWE-ベンチライトでは、ファイアウォールは製造を33.7%(StateFlow)から0.67%に減らし、対差は-33.07$ pp.である。
論文 参考訳(メタデータ) (2026-06-10T06:01:23Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Endangered Alert: A Field-Validated Self-Training Scheme for Detecting and Protecting Threatened Wildlife on Roads and Roadsides [10.412505957288406]
本稿では,オーストラリアにおけるカソーファリーなどの希少動物の検出を目的とした,革新的な自己学習手法を提案する。
提案手法は,希少種のセンサデータを取得し,ラベル付けすることを含む,現実世界における重要な課題に対処する。
クラウドとエッジコンピューティングを活用し、フィールドデプロイモデルの検出性能を向上させるために自動データラベリングを実現する。
論文 参考訳(メタデータ) (2024-12-16T07:44:27Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z) - WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild [57.272096543738336]
WildBenchは、大規模言語モデル(LLM)のベンチマーク用に設計された自動評価フレームワークである。
WildBenchは、100万以上の人間チャットボットの会話ログから慎重に選択された1,024のタスクで構成されている。
We have developed two metrics, WB-Reward and WB-Score which are computeable using Advanced LLMs。
論文 参考訳(メタデータ) (2024-06-07T09:15:44Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z) - Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards
and Ethical Behavior in the MACHIAVELLI Benchmark [61.43264961005614]
我々は、50万以上のリッチで多様なシナリオを含む134個のChoose-Your-Own-Adventureゲームのベンチマークを開発する。
我々は、エージェントの傾向をパワー・シーキングと評価し、不使用を生じさせ、倫理的違反を犯す。
以上の結果から,エージェントは有能かつ道徳的に行動できることが示唆された。
論文 参考訳(メタデータ) (2023-04-06T17:59:03Z) - Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged
Robots [71.61319876928009]
実四足歩行ロボットにおいて,エネルギー消費を最小化するための学習が自然移動歩行の出現に重要な役割を担っていることを示す。
創発的な足跡は理想的な地形で構築されており、馬や羊のものと似ている。
同じアプローチは、動物運動制御の発見と一致した荒地における非構造的な歩行につながる。
論文 参考訳(メタデータ) (2021-10-25T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。