論文の概要: AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs
- arxiv url: http://arxiv.org/abs/2608.14320v1
- Date: Fri, 14 Aug 2026 14:04:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.392988
- Title: AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs
- Title(参考訳): AnchorBench: LLMにおけるアンカリング効果のマルチパスベンチマーク
- Abstract要約: アンカー効果(アンカー効果)は、初期基準値が後の判断をそれ自身にシフトする認知バイアスである。
我々は,大規模言語モデルにおけるアンカー効果のベンチマークであるAnchorBenchを紹介する。
アンカーは経路依存性が強く, 可塑性アンカーは, より強い経路を通すと, 無関係アンカーよりも大きなシフトを引き起こすことがわかった。
- 参考スコア(独自算出の注目度): 36.94429692322632
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The anchoring effect is a cognitive bias in which an initial reference value shifts a later judgment toward itself. This effect is well established in human judgment and decision-making, and recent work suggests that large language models (LLMs) exhibit similar behavior. However, existing work on anchoring in LLMs typically evaluates only a narrow set of anchor pathways and rarely distinguishes irrelevant from plausible anchors. We introduce AnchorBench, a benchmark for the anchoring effect in LLMs that evaluates multiple anchor pathways under an explicit anchor relevance axis. Across fourteen models, including ten open-weight models and four frontier API models, and a large set of controlled prompts, we find that (1) anchoring is strongly pathway-dependent, (2) plausible anchors usually induce larger shifts than irrelevant ones when introduced through stronger pathways, (3) anchor influence generally weakens as the anchor moves farther from the evidence-supported answer, most clearly on External and RAG, and (4) high task accuracy on the anchor-free control condition (Acc$_{10}$: answers within 10 points of gold) does not guarantee robustness: even frontier API models above 95% control accuracy remain susceptible to plausible anchors.
- Abstract(参考訳): アンカー効果(アンカー効果)は、初期基準値が後の判断をそれ自身にシフトする認知バイアスである。
この効果は、人間の判断と意思決定においてよく確立されており、最近の研究は、大きな言語モデル(LLM)が同様の振る舞いを示すことを示唆している。
しかし、LLMにおけるアンカーの既存の研究は、典型的には狭いアンカー経路のみを評価し、無関係なアンカーとプラウシブルアンカーとを区別することは滅多にない。
LLMにおけるアンカー効果のベンチマークであるAnchorBenchを導入し、明示的なアンカー関係軸の下で複数のアンカー経路を評価する。
10個のオープンウェイトモデルと4つのフロンティアAPIモデルを含む14のモデルと、多数のコントロールプロンプトは、(1)アンカーが経路依存性が強く、(2)プラウシブルアンカーは、強い経路を通すと、通常無関係のものよりも大きなシフトを誘導し、(3)アンカーの影響は、エビデンスに支えられた回答から遠ざかるにつれて、一般的に弱められ、(4)アンカーフリー制御条件(Acc$_{10}$:10ポイント以内の回答)のタスク精度は、ロバスト性は保証されない。
関連論文リスト
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety [54.4092272526747]
MLLM(Multimodal Large Language Models)は、クロスモーダルな理解と生成において大きな成功を収めていますが、そのデプロイは重大な安全性の脆弱性によって脅かされています。
本稿では,MLLMのバックドアを復号化するための解釈可能性フレームワークであるProjLensを提案する。
論文 参考訳(メタデータ) (2026-04-21T04:52:38Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Mediocrity is the key for LLM as a Judge Anchor Selection [28.656244246729184]
アンカー選択が結果の信頼性に与える影響は、まだ明らかにされていない。
貧弱なアンカーは、人間のランキングとの相関を劇的に減らすことができる。
信頼性と効率性を確保するために,情報アンカーを選択するためのガイドラインを提供する。
論文 参考訳(メタデータ) (2026-03-17T17:54:08Z) - Attention Projection Mixing with Exogenous Anchors [0.0]
早期注意投影の層間再利用はデータの効率を向上させるが、構造的な衝突を引き起こす。
この衝突は、内部アンカー設計の隠れた制限であることを示す。
逐次レイヤスタックの外でアンカープロジェクションを学習することで競合を解決するExoFormerを提案する。
論文 参考訳(メタデータ) (2026-01-13T01:52:19Z) - Anchors in the Machine: Behavioral and Attributional Evidence of Anchoring Bias in LLMs [0.0]
本稿では,3つのコントリビューションを通じて,大規模言語モデル(LLM)のアンカー化に関する研究を進める。
その結果、Gemma-2B、Phi-2、Llama-2-7Bではアンカーが再重み付けに影響を及ぼすことが示唆された。
LLMのアンカーバイアスは、適用ドメインのリスクを強調しながら、堅牢で、測定可能で、解釈可能であることを示す。
論文 参考訳(メタデータ) (2025-11-07T23:35:19Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - Scope Head for Accurate Localization in Object Detection [135.9979405835606]
本研究では,各位置のアンカーを相互依存関係としてモデル化したScopeNetと呼ばれる新しい検出器を提案する。
我々の簡潔で効果的な設計により、提案したScopeNetはCOCOの最先端の成果を達成する。
論文 参考訳(メタデータ) (2020-05-11T04:00:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。