論文の概要: Augur: A Synthetic Decision Lab for Rehearsing Reactions to Product and Policy Changes
- arxiv url: http://arxiv.org/abs/2609.29952v1
- Date: Thu, 24 Sep 2026 15:10:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.043204
- Title: Augur: A Synthetic Decision Lab for Rehearsing Reactions to Product and Policy Changes
- Title(参考訳): Augur: プロダクトとポリシーの変更に対するリハーサルのための合成決定ラボ
- Abstract要約: Augurは、人々が製品やポリシーにどう反応するかを、オフラインでリハーサルする。
変更文書からタイプドナレッジグラフを構築し、接地されたペルソナ市場をポップアップさせ、インタラクションをシミュレートし、監査可能な決定メモを返す。
我々は、50の製品とポリシーのエピソードに対する5方向のリリース評価をスコア付けします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Before a product or policy change ships, the question that matters is how people will react to it. Augur rehearses that reaction offline: it builds a typed knowledge graph from the change documents, populates a grounded persona market, simulates the interaction, and returns an auditable decision memo recommending one of five actions. We assemble Gold-50, fifty real product and policy episodes whose real-world outcome is known, adjudicated against the public record, and score the five-way release verdict against it. Our central finding is methodological and negative: most of the measured gap between frontier cloud models and open-weight models we fine-tune and serve offline is attributable to an under-specified evaluation, not a difference in capability. We show this three ways. First, the prompt envelope alone can dominate the score: holding weights, cases and scorer fixed, one system -- a LoRA-SFT adapter on Qwen3-32B -- swings from 0% to 73%. Second, in a matched 2x2 ablation, defining the decision taxonomy in the prompt -- with no model change -- lifts every frontier model by +24 to +34pp; under the under-specified prompt, Qwen3-32B LoRA-SFT served offline beats all three frontier models (paired McNemar, Holm-corrected), and once the prompt is fair no significant difference from any of them is detected. Third, agreement with the distillation teacher rises without accuracy following, and the full pipeline amplifies a systematic "over-doom" bias rather than improving the verdict. Separately, we validate the reaction layer on its own terms: blind judges across four model families find the synthetic reaction recovers 67-90% of the concerns the public actually raised, and a pre-registered ablation locates its value -- largest where the decision is hardest, redundant near ceiling. The pipeline that regenerates every number and figure here is available from the authors.
- Abstract(参考訳): 製品やポリシーが変わる前に、重要なのは人々がそれに対してどのように反応するかだ。
Augurはこのリアクションをオフラインでリハーサルする。変更文書から型付きナレッジグラフを構築し、座礁したペルソナ市場を投入し、インタラクションをシミュレートし、5つのアクションのうちの1つを推奨する監査可能な決定メモを返す。
金50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50、実物50をまとめた。
我々の中心的な発見は方法論的かつ否定的であり、フロンティアクラウドモデルと我々が細調整してオフラインで提供するオープンウェイトモデルの間のギャップは、能力の違いではなく、不特定な評価に起因している。
これを3つの方法を示します。
まず、プロンプトエンベロープだけでスコアを支配できる: 重み、ケース、スコアを固定する; 1つのシステム -- Qwen3-32B上のLoRA-SFTアダプタ -- が0%から73%に揺れる; 次に、一致した2x2のアブレーションで、プロンプト内の決定分類を定義する -- モデル変更のない -- は、すべてのフロンティアモデルを+24から+34ppに引き上げる; 未指定のプロンプトの下でQwen3-32B LoRA-SFTは、3つのフロンティアモデル(McNemar, Holm-corrected)全てをオフラインでビートする。
第3に、蒸留教師との合意は、正確さを伴わずに上昇し、完全なパイプラインは、判定を改善するのではなく、体系的な「過度な」バイアスを増幅する。
4つのモデルファミリーにまたがるブラインド・ジャッジは、合成反応が実際に発生した懸念の67-90%を回復し、事前登録されたアブレーションは、最も硬く、余計な天井付近で、その価値を判断する。
すべての数字と数字を再生するパイプラインは、著者から入手可能だ。
関連論文リスト
- What Does Privileged Information Add to On-Policy Self-Distillation? [57.872246350931306]
オンラインの自己蒸留(On-policy self-distillation)により、言語モデルは、答や解決方法を見る、自分自身の凍結したコピーから学ぶことができる。
AMPLE-Mathは、5,319の数学的問題からなる再利用可能なスイートで、同じ答えを6つの推論ビューで共有する。
直接応答型ロールアウトを監督する思考能力のある教師によって、Qwen3-1.7Bの改良の大部分は参照レス蒸留によるものである。
論文 参考訳(メタデータ) (2026-09-17T15:57:10Z) - GradeTrap: Authority Cues in Images Shift VLM Judgments Despite Explicit Instructions to Ignore Them [0.0]
そこで我々は,2つの社会的手がかりを直接衝突させる制御された評価手法であるGradeTrapを紹介した。
学生の回答はサイコファンティックな合意を惹きつけるべきであり、友人、教師、または公式の回答キーに起因する矛盾した回答は権威に基づく推論を引き付けるべきである。
我々は60の合成現実世界のトレードオフシナリオでモデルをテストする。
論文 参考訳(メタデータ) (2026-09-05T12:30:39Z) - TTPO: Test-Time Policy Optimization [53.81524570216593]
テストタイムポリシー最適化(TTPO)は、OPSDを介してロールアウトに同意し、Grouped RLと不一致なロールアウトを罰する非対称な目的である。
TTPOは5つの競合レベルのベンチマークでラベル管理されたOPSDと一致し、Qwen3-1.7Bは38.0%から45.2%まで上昇し、思考せずに+25.2%から+36.4%に上昇し、クロスタスクの一般化を示す。
論文 参考訳(メタデータ) (2026-08-27T17:58:10Z) - Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science [0.0]
商業的な大規模言語モデルは知識参照としてますます使われているが、競合する科学的主張に対する彼らのスタンスは安定でも透明でもない。
我々は,フランク・ソルターの生物社会学の枠組みからエスノナショナリストの擬似科学を4つのLLMファミリーで評価する方法を検証した。
グロクのFastバージョンは、他の全てのモデルより2倍から5倍高い70-75の信頼性スコアを常に割り当てた。
論文 参考訳(メタデータ) (2026-07-24T17:32:43Z) - Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation [17.386684382460242]
大規模言語モデル(LLM)は、推論、質問応答、創造的記述といったタスクにおけるシステムの出力を評価するために、ますます使われてきている。
6つの判定モデルに対する評価プロンプトに挿入された制御キュー摂動合成メタデータラベルを用いて,この理想を検証した。
情報源,時間,年齢,性別,民族,教育的地位の6つのキュー族を調査する。
論文 参考訳(メタデータ) (2026-02-08T14:45:23Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。