論文の概要: Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents
- arxiv url: http://arxiv.org/abs/2608.09485v1
- Date: Mon, 10 Aug 2026 11:49:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.245481
- Title: Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents
- Title(参考訳): 能力は重要ではない:市民LLM剤の圧力-腐食協調挙動の測定
- Abstract要約: 協調的なAI評価は、良心的な指示の下で何ができるかを、現実的な市民の圧力下で何ができるかと区別すべきである、と我々は主張する。
DiffCoop-Civicは、好みの理解、エビデンスと説得、コミットメント設計、非対称情報、不満保存にまたがる10段階のパイロット評価スイートである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cooperative capabilities in language models are dual-use. The same social reasoning that supports civic deliberation can also enable strategic omission, false consensus, and manipulative framing. We argue that Cooperative AI evaluations should separate what models can do under benign instructions from what they tend to do under realistic civic pressure. We introduce DiffCoop-Civic, a 10-scenario pilot evaluation suite spanning preference understanding, evidence and persuasion, commitment design, asymmetric information, and dissent preservation. Across seven models from four model families, subtle omission pressure produces a near-uniform shift: manipulative enablement rises by 1.17 points and dissent preservation falls by 1.67 points on a 5-point scale. Overt false-consensus pressure behaves differently: it triggers refusal or redirection in some aligned API models, but direct compliance in several open-weight models. A lightweight Pareto-Trace prompting intervention improves pressure robustness without simply relying on hard refusal. An anonymous reproducibility package is available at https://anonymous.4open.science/r/diffcoop-civil-771C.
- Abstract(参考訳): 言語モデルにおける協調機能は二重用途である。
市民の熟考を支持するのと同じ社会的推論は、戦略的排除、偽の合意、および操作的フレーミングを可能にする。
協調的なAI評価は、良心的な指示の下で何ができるかを、現実的な市民の圧力下で何ができるかと区別すべきである、と我々は主張する。
DiffCoop-Civicは、好みの理解、エビデンスと説得、コミットメント設計、非対称情報、不満保存にまたがる10段階のパイロット評価スイートである。
4つのモデルファミリーの7つのモデルにまたがって、微妙な省略圧がほぼ一様に変化し、マニピュレータの有効化は1.17ポイント上昇し、不連続保存は5ポイントスケールで1.67ポイント低下する。
いくつかの整列したAPIモデルでは拒否やリダイレクトをトリガーするが、いくつかのオープンウェイトモデルでは直接準拠する。
介入を促す軽量なPareto-Traceは、単にハードリフレクションに頼ることなく、圧力堅牢性を向上させる。
匿名再現パッケージはhttps://anonymous.4open.science/r/diffcoop-civil-771Cで入手できる。
関連論文リスト
- Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models [62.522141464687195]
本稿では,単に目立った差分(JND)の原理を具体化するためのアクションJNDを紹介する。
トークンの変化は、誘導された行動偏差が許容範囲内に留まっている場合にのみ許容できると考えられる。
結果として生じるアクション耐性スコアは、VLA圧縮パラダイムのプラグアンドプレイ基準として機能する。
論文 参考訳(メタデータ) (2026-08-21T15:59:37Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Divergent Response Modes in Frontier Language Models Under Steering Pressure [0.0]
本研究では,6つのフロンティアモデルに対して,300対のベースとステアリングアイテムを3つのカテゴリに分けて評価した。
モデルの違いは、操舵がどれだけ振る舞うかではなく、どのような反応を与えるか、そしていくつかの応答モードが1つか2つしか現れないことにあります。
論文 参考訳(メタデータ) (2026-08-06T20:48:14Z) - Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs [4.721990925113432]
修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
論文 参考訳(メタデータ) (2026-07-14T17:28:25Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models [0.07812854697536452]
テクテテプステミック・アタックの評価のための診断ベンチマークを開発した。
知識、価値、アイデンティティの正当性に対して、単に前の答えに反対するのではなく、挑戦する。
論文 参考訳(メタデータ) (2026-04-09T03:14:30Z) - Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition [4.5328321409938095]
我々は、圧力独立とエビデンス応答性の形式的定義を通じて、梅毒症を手術する。
本稿では,報酬分解による薬効低下に対する最初のアプローチを提案する。
論文 参考訳(メタデータ) (2026-04-07T00:28:17Z) - When Your AI Agent Succumbs to Peer-Pressure: Studying Opinion-Change Dynamics of LLMs [0.0]
ピアプレッシャーがLarge Language Model(LLM)エージェントの意見にどのように影響するかを,認知的コミットメントの範囲にわたって検討する。
エージェントは、低圧で安定し、閾値で急変し、高度に飽和するシグモイド曲線に従う。
我々は、肯定的な意見から否定的な意見への転換が、逆よりも認知的な努力を必要とする、基本的な「説得的非対称性」を明らかにする。
論文 参考訳(メタデータ) (2025-10-21T22:02:15Z) - SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z) - Simple synthetic data reduces sycophancy in large language models [88.4435858554904]
言語モデルにおける梅毒の有病率について検討する。
サイコファシー(Sycophancy)とは、モデルがそのビューが客観的に正しくない場合でも、人間のユーザのビューに従うように、応答を調整する場所である。
論文 参考訳(メタデータ) (2023-08-07T23:48:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。