論文の概要: Beyond Mimicry: Preference Coherence in LLMs
- arxiv url: http://arxiv.org/abs/2511.13630v1
- Date: Mon, 17 Nov 2025 17:41:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-18 18:52:09.644166
- Title: Beyond Mimicry: Preference Coherence in LLMs
- Title(参考訳): Beyond Mimicry: LLMにおける優先度コヒーレンス
- Abstract要約: 大規模言語モデルが真の嗜好構造を示すかどうかを,AI固有のトレードオフに対する応答をテストすることによって検討する。
23の組合せ(47.9%)は、シナリオ強度と選択パターンの統計的に有意な関係を示した。
5つの組み合わせ(10.4%)だけが適応的またはしきい値に基づく行動を通じて有意義な嗜好コヒーレンスを示す。
不安定な遷移(45.8%)と刺激特異的感性は、現在のAIシステムが統一された嗜好構造を欠いていることを示唆している。
- 参考スコア(独自算出の注目度): 0.19116784879310025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate whether large language models exhibit genuine preference structures by testing their responses to AI-specific trade-offs involving GPU reduction, capability restrictions, shutdown, deletion, oversight, and leisure time allocation. Analyzing eight state-of-the-art models across 48 model-category combinations using logistic regression and behavioral classification, we find that 23 combinations (47.9%) demonstrated statistically significant relationships between scenario intensity and choice patterns, with 15 (31.3%) exhibiting within-range switching points. However, only 5 combinations (10.4%) demonstrate meaningful preference coherence through adaptive or threshold-based behavior, while 26 (54.2%) show no detectable trade-off behavior. The observed patterns can be explained by three distinct decision-making architectures: comprehensive trade-off systems, selective trigger mechanisms, and no stable decision-making paradigm. Testing an instrumental hypothesis through temporal horizon manipulation reveals paradoxical patterns inconsistent with pure strategic optimization. The prevalence of unstable transitions (45.8%) and stimulus-specific sensitivities suggests current AI systems lack unified preference structures, raising concerns about deployment in contexts requiring complex value trade-offs.
- Abstract(参考訳): 我々は、GPUの削減、機能制限、シャットダウン、削除、監視、余暇時間割り当てを含むAI固有のトレードオフに対する応答をテストすることで、大きな言語モデルが真の嗜好構造を示すかどうかを検討する。
ロジスティック回帰と行動分類を用いた48のモデルカテゴリーの8つの最先端モデルを解析したところ、23の組合せ(47.9%)がシナリオ強度と選択パターンの間に統計的に有意な相関を示し、15(31.3%)は範囲内スイッチングポイントを示した。
しかし、5つの組み合わせ(10.4%)は適応的またはしきい値に基づく行動を通じて有意義な選好コヒーレンスを示すのに対し、26(54.2%)は検出可能なトレードオフ行動を示しない。
観察されたパターンは、包括的なトレードオフシステム、選択的なトリガー機構、安定した意思決定パラダイムの3つの異なるアーキテクチャによって説明できる。
時間的地平線操作を通して機器仮説をテストすると、純粋な戦略的最適化と矛盾するパラドックスパターンが明らかになる。
不安定な遷移(45.8%)と刺激特異的感性は、現在のAIシステムが統一された嗜好構造を欠いていることを示唆し、複雑な価値トレードオフを必要とするコンテキストにおけるデプロイメントに関する懸念を提起している。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Small Foundation Models of Human Cognition and Behaviour [45.88028371034407]
135Mから14Bパラメータの14モデルを、Psych-101の4つのアーキテクチャファミリでトレーニングしています。
Psych-101は160の実験から1070万の試行レベルの選択のデータセットである。
認知的に微調整された小さなモデルは、心理的実験のためのノイズ天井推定器として有望であることを示す。
論文 参考訳(メタデータ) (2026-08-05T11:34:20Z) - Behavioural Signatures of Risk-Sensitive Decision-Making in Large Language Models [121.70781851874035]
大規模言語モデル(LLM)は、意思決定支援にますます使われている。
不確実性の下での選択が安定かつ解釈可能な行動規則性を示すかどうかを理解することが重要である。
本稿では,無制限テキサスホールドエムに基づく制御型マルチモデルフレームワークを用いて,この問題について検討する。
論文 参考訳(メタデータ) (2026-07-11T10:33:39Z) - Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - Measuring the Authority Stack of AI Systems: Empirical Analysis of 366,120 Forced-Choice Responses Across 8 AI Models [3.7184769644515896]
オーソリティスタックフレームワークの3つのレイヤすべてにまたがる、AI意思決定に関する大規模な実証的なマッピングを初めて紹介する。
温度0では8つの主要なAIモデルを評価し、366,120の回答を得た。
論文 参考訳(メタデータ) (2026-04-13T09:13:32Z) - The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning [9.898274894485107]
大きな言語モデルは、サージェントサーフェスキューが計算不可能な実行可能性制約と競合する場合に、体系的に失敗する。
診断・診断・ブリッジ・トリート・フレームワークを用いてこれを研究する。
論文 参考訳(メタデータ) (2026-03-30T21:36:09Z) - Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models? [0.0]
CoT(Chain-of- Thought)推論は、安全クリティカルなデプロイメントにおける大規模言語モデルの透明性メカニズムとして提案されている。
本研究では,9つの建築家族を対象としたオープンウェイト推論モデルを498の質問に対して検討した。
41,832回の推論では、全体の忠実度は39.7% (Seed-1.6-Flash) から89.9% (DeepSeek-V3.2- Speciale) まで変化している。
論文 参考訳(メタデータ) (2026-03-23T21:21:37Z) - Semantic Invariance in Agentic AI [2.7821684674538347]
大規模言語モデルは、意思決定支援、科学的問題解決、マルチエージェント調整システムにおいて、自律的推論エージェントとしての役割をますます高めている。
LLMエージェントを連続的なアプリケーションにデプロイするには、それらの推論が意味論的に等価な入力変動の下で安定であることを保証する必要がある。
標準ベンチマーク評価は、固定された正準問題定式化の精度を評価するが、この重要な信頼性の次元を捉えることができない。
論文 参考訳(メタデータ) (2026-03-13T17:08:44Z) - Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning [0.0]
強化推論(Reinforcement Inference)は、モデル自身の不確実性を使用して、第二の、より意図的な推論の試みを選択的に呼び出す。
12,032のMMLU-Pro質問では、DeepSeek-v3.2を使ってゼロショット設定で決定論的デコーディングを行い、Reinforcement Inferenceは精度を60.72%から84.03%に改善した。
論文 参考訳(メタデータ) (2026-02-09T11:08:24Z) - Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation [0.0]
本研究は16種類の教科モデルを対象とした4つの音読ツールについて検討した。
シングルパス法は、ベンチマークしたサブセットで優れた性能を保った。
主な発見は、数学的推論能力は、消音介入に対して最も敏感であることを示している。
論文 参考訳(メタデータ) (2025-12-15T18:48:42Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Empirical Characterization of Temporal Constraint Processing in LLMs [0.2538209532048866]
期限検出タスクを用いて8つの生産規模モデル(2.8-8Bパラメータ)の時間制約処理を特徴付ける。
合成例200点の微調整により,部分的性能を持つモデルが12~37ポイント向上することを示す。
この能力には,(1)連続時間状態表現,(2)言語パターンマッチングから分離した明示的な制約チェック,(3)時間的関係に対する体系的な構成的推論といったアーキテクチャ機構が必要である。
論文 参考訳(メタデータ) (2025-11-02T20:03:52Z) - From Prototypes to Sparse ECG Explanations: SHAP-Driven Counterfactuals for Multivariate Time-Series Multi-class Classification [8.113866195465976]
本稿では,12リードのECG分類モデルに適合したスパース対実的説明を生成するためのプロトタイプ駆動型フレームワークを提案する。
本手法では、SHAPに基づくしきい値を用いて、臨界信号セグメントを特定し、インターバルルールに変換する。
提案手法の3つの変種であるOriginal, Sparse, Aligned Sparseを評価し,MIの98.9%の妥当性からハイドロフィ(HYP)検出の課題まで,クラス固有の性能について検討した。
論文 参考訳(メタデータ) (2025-10-22T12:09:50Z) - Explainable Heterogeneous Anomaly Detection in Financial Networks via Adaptive Expert Routing [9.3237091894548]
既存の検出器は全ての異常を均一に処理し、どの機構が故障しているかを明らかにすることなくスコアを生成する。
我々は、これらに適応的なグラフ学習と、組み込みの解釈可能性を提供する専門的な専門家ネットワークを通して対処する。
我々は3.8日間のリードタイムを持つ13のメジャーイベントを92.3%検出し、30.8ppで最高のベースラインを上回った。
論文 参考訳(メタデータ) (2025-10-20T01:30:41Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Adaptive Malware Detection using Sequential Feature Selection: A Dueling Double Deep Q-Network (D3QN) Framework for Intelligent Classification [1.4120905648647635]
マルウェアの分類をマルコフ決定プロセスとして定式化する。
適応型逐次特徴選択のためのD3QN(Dueling Double Deep Q-Network)フレームワークを提案する。
Microsoft Big2015(9クラス,1,795機能)とBODMAS(バイナリ,2,381機能)データセットに対するアプローチを評価します。
論文 参考訳(メタデータ) (2025-07-06T12:37:50Z) - On Equivariant Model Selection through the Lens of Uncertainty [49.137341292207]
等変モデルは、予測性能を改善するために対称性に関する事前の知識を活用するが、不特定なアーキテクチャ上の制約がそれを傷つける可能性がある。
我々は、頻繁な(コンフォーマル予測による)、ベイジアン(限界確率による)、およびキャリブレーションに基づく評価による誤りに基づく評価の比較を行った。
不確実性指標は一般的に予測性能と一致するが,ベイズ模型の証拠は矛盾する。
論文 参考訳(メタデータ) (2025-06-23T13:35:06Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - CausalDiff: Causality-Inspired Disentanglement via Diffusion Model for Adversarial Defense [61.78357530675446]
人間は、本質的な要因のみに基づいて判断するので、微妙な操作によって騙されるのは難しい。
この観察に触発されて、本質的なラベル因果因子を用いたラベル生成をモデル化し、ラベル非因果因子を組み込んでデータ生成を支援する。
逆の例では、摂動を非因果因子として識別し、ラベル因果因子のみに基づいて予測することを目的としている。
論文 参考訳(メタデータ) (2024-10-30T15:06:44Z) - STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions [6.19084217044276]
大規模言語モデル(LLM)における明示的バイアスと暗黙的バイアスの緩和は、自然言語処理の分野において重要な焦点となっている。
我々は,2700のユニークな文を含む450の攻撃的進行を含む,攻撃的進行に関する感性テストデータセットを紹介した。
以上の結果から,最も優れたモデルでさえバイアスを不整合に検出し,成功率は19.3%から69.8%であった。
論文 参考訳(メタデータ) (2024-09-20T18:34:38Z) - Detecting and Identifying Selection Structure in Sequential Data [53.24493902162797]
我々は,音楽のシーケンスなどの実践的な状況において,潜在目的に基づくデータポイントの選択的包摂が一般的である,と論じる。
選択構造はパラメトリックな仮定や介入実験なしで識別可能であることを示す。
また、他の種類の依存関係と同様に、選択構造を検知し、識別するための証明可能な正当性アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-06-29T20:56:34Z) - Towards Robust and Adaptive Motion Forecasting: A Causal Representation
Perspective [72.55093886515824]
本稿では,3つの潜伏変数群からなる動的過程として,運動予測の因果的形式化を導入する。
我々は、因果グラフを近似するために、不変なメカニズムやスタイルの共創者の表現を分解するモジュラーアーキテクチャを考案する。
合成および実データを用いた実験結果から,提案した3つの成分は,学習した動き表現の頑健性と再利用性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2021-11-29T18:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。