論文の概要: Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise
- arxiv url: http://arxiv.org/abs/2610.02702v1
- Date: Fri, 02 Oct 2026 02:37:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.168049
- Title: Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise
- Title(参考訳): 消毒剤 LLM の効能は, 今もその原点を表わしている
- Abstract要約: エージェントが回答を変更するとき、その考えを変えたのか、あるいは声明だけを変えたのか?
中間実体が誰にも述べられていない2ホップの事実質問を用いてこれを研究する。
聖書の仲間は、アッシュの連合者の役割において、異なる橋で別の事実から取られた間違った答えを全会一致で主張する。
- 参考スコア(独自算出の注目度): 1.7043680515892454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent debate is increasingly used to reach consensus among LLM agents, yet agents often yield to a unanimous majority. When an agent changes its answer, has it changed its mind or only its statement? We study this with two-hop factual questions whose intermediate entity (the bridge, e.g. the country in "the capital of the country where the Sagrada Familia is located") is never stated by anyone. Scripted peers, in the role of Asch's confederates, unanimously assert a wrong answer taken from another fact with a different bridge. At the moment the agent answers, we read the bridge from its residual stream with the Jacobian lens (J-lens) and, for comparison, the logit lens. In pre-registered tests on held-out facts with four open-weight models, agents of Qwen3.5-4B, Qwen3.6-27B and Gemma-4-E4B-it that gave in still represented their original bridge in the pre-registered layers below the output (hit@100 above a control entity: 0.85, 0.22 and 0.24), where the logit lens rarely ranked it among the top 100 tokens (0.00-0.06). These agents also represented the bridge behind the peers' answer, beyond a mention baseline. A pre-registered addendum hid the agent's earlier answer or removed it: agents that gave in still represented their original bridge in all four models (0.43, 0.29, 0.37 and 0.25 with the answer hidden), including Llama-3.1-8B-Instruct, which barely did so with its answer in view (0.03). The premise can thus be computed from the question alone while the agent states the majority's answer. Hiding the earlier answer also changed conformity: Qwen3.5-4B gave in on 89% of questions instead of 8%. In exploratory interventions, injecting the bridge's J-lens direction brought agents back to their original answer only in the two Qwen models. Stated consensus in multi-agent debate can thus overstate agreement. We also report the negative results of our pre-registered program.
- Abstract(参考訳): マルチエージェントの議論は、LSMエージェントの間で合意に達するためにますます使用されるが、エージェントは概して多数を占める。
エージェントが回答を変更するとき、その考えを変えたのか、あるいは声明だけを変えたのか?
我々は、中間的な実体(例えば「サグラダ・ファミリアが位置する国の首都」の橋など)が誰にも述べられていない2ホップの事実問題を用いてこれを研究する。
聖書の仲間は、アッシュの連合者の役割において、異なる橋で別の事実から取られた間違った答えを全会一致で主張する。
エージェントが答えた時点で、残りの流れからヤコビレンズ(Jレンズ)と対してロジットレンズでブリッジを読み取る。
Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-itのエージェントは、4つのオープンウェイトモデルで保持された事実の事前登録試験において、出力の下の層で元のブリッジを表現していた(hit@100は制御エンティティ0.85、0.22、0.24)。
これらのエージェントは、言及ベースラインを越えて、ピアスの回答の背後にあるブリッジを表現した。
登録済みの増補剤は、エージェントの以前の答えを隠したり削除した: 入力したエージェントは、4つのモデル(0.43、0.29、0.37、0.25)で元のブリッジをまだ表現しており、その答えはLlama-3.1-8B-インストラクト(英語版)(0.03)。
したがって、前提は質問のみから計算でき、エージェントは多数派の答えを述べる。
Qwen3.5-4Bは8%ではなく89%の質問に回答した。
探索的な介入で、橋のJレンズ方向を注入すると、エージェントは2つのクウェンモデルでのみ元の答えに戻された。
したがって、マルチエージェントの議論における意見の一致は、過剰に合意できる。
また,事前登録プログラムの否定的な結果も報告した。
関連論文リスト
- Reinforcement Learning of Communication in a Mesh of Small Language Models [0.0]
私たちは、小さな言語モデルエージェントの分散メッシュであるTalkMeshを紹介します。
各エージェントは提案をサンプリングし、訓練された信頼度ヘッドでスコア付けする。
最も自信のあるエージェントはヒントを放送し、エージェントは信頼のしきい値以下で修正し、各リビジョンは提案を上回ります。
ゴシップ・コンセンサス(Gossip consensus)は、コーディネーターを使わずに、自信によって重み付けられた票を近似する。
論文 参考訳(メタデータ) (2026-09-24T21:41:12Z) - Message capacity and claim wording set the transition points of collective truth-finding in language-model networks [0.0]
集合の運命は、クレームのワードセットのしきい値と、遷移点を設定するメッセージキャパシティの2つの単一エージェント測定によって決定される。
論文 参考訳(メタデータ) (2026-09-15T14:46:31Z) - EULER: Exploring Underused Links with Evidence-Checked Return for Multi-Agent Mathematical Discovery [0.0]
本稿では,橋梁を検索単位とするマルチエージェントシステムであるEULERを提案する。
固定された予想の周囲で、EULERは直接、隣接領域、遠領域のルートを競合で実行している。
我々は120の最近の予想に基づいてEULERを評価する。
論文 参考訳(メタデータ) (2026-08-28T17:36:00Z) - Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier [0.05055376568994175]
間違った多数派はモデルの正しいMMLU回答の22.8%を逆転させ、GPQAは54.8%、SimpleQAは71.0%である。
モデルが最初に間違って答えた後、正しいピア回答を採用するレートであるReceptivityと組み合わせます。
最も強力な公表方法であるリフレクションは、MMLU抵抗の7.9ポイントを獲得し、レセプティビティの15.3を付与する。
論文 参考訳(メタデータ) (2026-08-03T11:12:38Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - More Agents Helps but Adversarial Robustness Gap Persists [10.507110902601466]
LLMエージェントが一緒に働くと、数学的な質問応答において、1つのLLMよりも強力なように見える。
本稿では,逆摂動問題を用いてこの問題を考察する。
論文 参考訳(メタデータ) (2025-11-10T13:58:17Z) - Multi-LLM QA with Embodied Exploration [55.581423861790945]
未知環境における質問応答におけるマルチエンボディードLEMエクスプローラ(MELE)の利用について検討する。
複数のLSMベースのエージェントが独立して家庭用環境に関する質問を探索し、回答する。
各問合せに対して1つの最終回答を生成するために,異なるアグリゲーション手法を解析する。
論文 参考訳(メタデータ) (2024-06-16T12:46:40Z) - ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs [61.07130026622437]
大規模言語モデル(LLM)は、まだ自然言語推論タスクに苦戦している。
心の社会に動機づけられて、我々はReConcileを提案する。
LLMエージェント間のラウンドテーブル会議として設計されたマルチモデルマルチエージェントフレームワーク。
論文 参考訳(メタデータ) (2023-09-22T17:12:45Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。