論文の概要: APS: Bias-Controlled Adaptive Prototype Simulation for Population-Scale LLM Agents
- arxiv url: http://arxiv.org/abs/2605.27419v1
- Date: Tue, 19 May 2026 08:45:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.17634
- Title: APS: Bias-Controlled Adaptive Prototype Simulation for Population-Scale LLM Agents
- Title(参考訳): APS:Bias-Controlled Adaptive Prototype Simulation for Population-Scale LLM Agents
- Authors: Quan Zheng, Yan Gao, Shaobin He, Haoxiang Guan, Yuanhe Tian, Jie Feng, Ming Wang, Shuxin Zheng, Zhen Liu,
- Abstract要約: 本稿では,拡張性 LLM に基づくシミュレーションを,再帰的なオラクル配置問題として再設計するフレームワークを提案する。
Adaptive Prototype Simulation (APS) は、適応型コアプロトタイプ、選択されたシングルトンテールエージェント、シャドウ監査エージェントをクエリする。
APSは、完全なシミュレーションよりも381.1倍の削減を実現し、対応するフルLLM参照に対して0.094の参照整列最終ラウンドJSDを実現している。
- 参考スコア(独自算出の注目度): 23.922499684047263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-agent simulation offers a flexible computational tool for studying population response trajectories that depend on scenario events, memory, demographics, and evolving social context. However, full multi-round simulation scales linearly with both population size and horizon, requiring every agent to query the LLM at every round. We propose Adaptive Prototype Simulation (APS), a framework that reframes scalable LLM-based simulation as a recurrent oracle-allocation problem. APS retains the designated LLM as the online transition oracle while querying adaptive core prototypes, selected singleton-tail agents, and shadow-audit agents. Prototype responses induce local response surfaces for nearby agents, reducing online LLM calls without replacing the underlying transition model. To control approximation bias, shadow-audit residual correction estimates propagation residuals for aggregate correction and future budget allocation, while tail-protected singleton routing directly queries selected isolated, heterogeneous, or high-curvature regions that are vulnerable to smoothing. Theoretically, we treat APS as an estimator for full-scale high-precision individual social simulation and decompose its errors into prototype-coverage error, shadow-audit residual-correction error, local-propagation bias, and temporal context mismatch. Under the reported protocols, APS gives lower reference-aligned distributional discrepancy than scale-oriented and same-budget baselines while reducing online LLM calls, with ablations and compact robustness checks diagnosing the main bias-control mechanisms. In a 10M-agent, multi-round public-opinion simulation, APS achieves a 381.1-fold reduction over full simulation, with reference-aligned final-round JSD of 0.094 against the corresponding full-LLM reference.
- Abstract(参考訳): LLM-エージェントシミュレーションは、シナリオイベント、記憶、人口統計、進化する社会状況に依存する集団反応の軌跡を研究するための柔軟な計算ツールを提供する。
しかし、全マルチラウンドシミュレーションは人口規模と地平線の両方で線形にスケールし、全てのエージェントが各ラウンドでLSMに問い合わせる必要がある。
本稿では,拡張性LLMに基づくシミュレーションを,繰り返しオラクル配置問題として再構成するフレームワークであるAdaptive Prototype Simulation (APS)を提案する。
APSは、適応型コアプロトタイプ、選択されたシングルトンテールエージェント、シャドウ監査エージェントを問い合わせながら、指定されたLSMをオンライン移行オラクルとして保持している。
プロトタイプ応答は、近くのエージェントの局所応答面を誘導し、基礎となる遷移モデルを置き換えることなく、オンラインLLM呼び出しを減少させる。
分離、不均一又はスムース化に脆弱な高曲率領域を選択したテール保護シングルトンルーティングを直接クエリしながら、近似バイアス、シャドウオーディット残差補正推定残差を集約補正及び将来の予算配分のために予測する。
理論的には、APSを高精度な個人社会シミュレーションのための推定器として扱い、その誤差をプロトタイプ被覆誤差、影聴覚残差補正誤差、局所伝搬バイアス、時間的コンテキストミスマッチに分解する。
報告されたプロトコルの下では、APSはスケール指向および同一予算ベースラインよりも低い参照整合分布差を与え、オンラインLCM呼び出しを削減し、アブレーションとコンパクトロバスト性チェックにより、メインのバイアス制御機構を診断する。
10Mエージェントで複数ラウンドのパブリック・オピニオン・シミュレーションでは、APSはフル・シミュレーションよりも381.1倍の削減を達成する。
関連論文リスト
- DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Scalable Variational Bayesian Fine-Tuning of LLMs via Orthogonalized Low-Rank Adapters [13.718993776070434]
不確実性定量化(UQ)は、大規模言語モデル(LLM)の信頼性を自己評価する上で最も重要である。
我々は、LLMに基づく決定論的特徴抽出器に不確実性推論のためのランダムな最終層パラメータが続くベイズ最後の層(BLL)モデルを構築した。
我々は変分(V)推論フレームワークを活用して、スケーラブルなベイズ微調整アプローチを提案する。
論文 参考訳(メタデータ) (2026-04-03T18:42:04Z) - The Sign Estimator: LLM Alignment in the Face of Choice Heterogeneity [4.957619545367733]
従来のアライメント手法は、人間の嗜好の不均一性に対して脆弱である。
そこで我々は,手話推定器という,シンプルで,確実に一貫性があり,効率的な推定器を提供する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-10-28T00:42:38Z) - Reinforce-Ada: An Adaptive Sampling Framework for Reinforce-Style LLM Training [47.26632817047513]
大規模言語モデル(LLM)に推論タスクに適用された強化学習は、不安定な勾配推定によってボトルネックとなることが多い。
LLMのオンラインRLポストトレーニングのための適応型サンプリングフレームワークであるReinforce-Adaを提案する。
従来の2段階配置法とは異なり、Reinforce-Adaはオンライン連続除去プロセスにおける推定とサンプリングをインターリーブする。
論文 参考訳(メタデータ) (2025-10-06T16:34:09Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach [51.76826149868971]
モンテカルロシミュレーションによる政策評価は多くのMC強化学習(RL)アルゴリズムの中核にある。
本研究では,異なる長さの軌跡を用いた回帰推定器の平均二乗誤差のサロゲートとして品質指標を提案する。
本稿では,Robust and Iterative Data Collection Strategy Optimization (RIDO) という適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T11:47:56Z) - Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification [76.14641982122696]
本稿では,属性制御付き大規模言語モデル(LLM)の制約学習スキーマを提案する。
提案手法は, ベンチマーク上での競合性能と毒性検出タスクを達成しながら, 不適切な応答を少ないLCMに導出することを示す。
論文 参考訳(メタデータ) (2024-10-07T23:38:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。