論文の概要: The Shared Discovery Paradox: How a One-Answer Rule Turns Better Information into Worse Search
- arxiv url: http://arxiv.org/abs/2607.18045v1
- Date: Mon, 20 Jul 2026 15:14:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.67372
- Title: The Shared Discovery Paradox: How a One-Answer Rule Turns Better Information into Worse Search
- Title(参考訳): 共有された発見のパラドックス: ワンアンサーのルールは、どのようにしてより良い情報をより悪い検索に変えるか
- Abstract要約: 16個のボックス,1つのターゲット,8つのサーチカ,およびノイズの多い私的手がかりを備えた,正確に解決可能なベンチマークを開発する。
ポーリングは最高のシングルレコメンデーションの精度を0.20から0.3835に引き上げるが、そのリコメンデーションはグループ発見を0.8322から0.3835に下げる。
同じプールされたレポートを使用した調整された8アクションのポートフォリオは0.8594に達し、7つの調整されたアクションが分散化されたベンチマークを回復する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Organizations often pool dispersed information into one ranking and then allow many agents to act on that shared view. In a discovery problem, this can improve beliefs while reducing coverage. We develop an exactly solvable benchmark with sixteen boxes, one target, eight searchers, and noisy private clues. Pooling raises the accuracy of the best single recommendation from 0.20 to 0.3835, but repeating that recommendation lowers group discovery from 0.8322 under decentralized clue-following to 0.3835. A coordinated eight-action portfolio using the same pooled reports reaches 0.8594, and seven coordinated actions recover the decentralized benchmark. The paradox is a protocol failure, not an information failure: a one-answer rule compresses a portfolio of available actions into one repeated choice. We then replace the planner with self-interested searchers who split a prize. The equal-split game is a potential game. Its anonymous symmetric equilibrium obeys a water-filling rule. In the canonical instance it achieves 0.5991: strictly above consensus, but below both private search and the planner. The exact mixed price of anarchy is 2 - 1/N. A sole-rescue reward, which pays only an agent who covers the target alone, makes every pure Nash equilibrium first-best. Finally, a latent common-cue model shows how correlated reports collapse effective discovery channels. The centralized planner gain rises strictly with copying, and in the canonical environment the symmetric market overtakes decentralized report-following at copying probability c = 0.788462. In a proportional large-market limit the five-protocol ordering survives exactly: consensus discovery vanishes while blind, market, private, and portfolio search converge to 0.500, 0.547, 0.847, and 0.874. The contribution is a compact benchmark that separates information, allocation, incentives, and dependence into exact, reusable quantities.
- Abstract(参考訳): 組織はしばしば、分散した情報をひとつのランキングにまとめて、多くのエージェントがその共有ビューで行動できるようにします。
発見問題では、カバー範囲を減らしながら信念を改善することができる。
16個のボックス,1つのターゲット,8つのサーチカ,およびノイズの多い私的手がかりを備えた,正確に解決可能なベンチマークを開発する。
ポーリングは最高のシングルレコメンデーションの精度を0.20から0.3835に引き上げるが、そのリコメンデーションはグループ発見を0.8322から0.3835に下げる。
同じプールされたレポートを使用した調整された8アクションのポートフォリオは0.8594に達し、7つの調整されたアクションが分散化されたベンチマークを回復する。
パラドックス(英: paradox)とは、プロトコルの障害であり、情報障害ではない。
そして、そのプランナーを、賞金を分けた自己関心のあるサーチカーに置き換える。
平等なゲームは潜在的なゲームです。
その匿名対称平衡は水充填則に従う。
標準のインスタンスでは0.5991、厳密にはコンセンサスより上だが、プライベート検索とプランナーより下である。
アナーキーの正確な混合価格は2-1/Nである。
唯一の救済報酬は、ターゲットだけをカバーしているエージェントにのみ支払うものであり、純粋なナッシュ均衡を最優先とする。
最後に、潜在コモンキューモデルでは、相関レポートが効果的な発見チャネルを崩壊させる様子が示される。
集中型プランナーゲインはコピーによって厳密に上昇し、標準環境では対称市場はコピー確率c = 0.788462で分散化されたレポートフォロイングを吸収する。
コンセンサス発見は、ブラインド、マーケット、プライベート、ポートフォリオ検索が0.500、0.547、0.847、0.874に収束しながら消滅する。
このコントリビューションは、情報、アロケーション、インセンティブ、依存を正確な再利用可能な量に分離する、コンパクトなベンチマークである。
関連論文リスト
- When Does Information Sharing Improve Decentralized Discovery? Aggregation, Independent Rescue, and Equilibrium Selection [0.0]
情報共有は、独立した救助行動を取り除き、プールされた見積もりを改善することができる。
本稿では、これらの効果を正確な有限な発見モデルで分離する。
モデルは合成され有限であり、人間や組織的なデータは使用されない。
論文 参考訳(メタデータ) (2026-09-01T19:41:30Z) - Incentives and Market Structure in Intent-Based Exchanges: Evidence from a Solver-Reward Reform [2.5599656137521425]
プロトコルによって設計された報酬ルールの変更が、どのように価値をキャプチャするかを測定する。
CoW Protocol CIP-74は、固定されたソルバ・リワード・キャップをプロトコル収益に結びついたものに置き換え、広告価値のボリューム料金を導入した。
日替わりで395日超の株式を保有し、注文規模で取引価値を再配分した。
論文 参考訳(メタデータ) (2026-07-24T04:04:15Z) - When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals [0.0]
LLM-as-judgeは、企業パイプラインでAIシステムを評価する上で、ますますデフォルトになっている。
判断者間の整合性、あるいはモデル自身のサンプルが正当性を示していることを示す。
大規模なクロスランナー研究において、合意がいつ有用なプロキシであるかを問う。
論文 参考訳(メタデータ) (2026-07-09T02:46:51Z) - A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR [1.2958054117511815]
報酬からの強化学習は、報酬信号が刺激的であっても推論を改善する。
実践者は一般的に、報酬-設計効果として naive = acc(TRUE) - acc(R) を解釈する。
我々はこの推定が体系的に偏っていることを証明している。
論文 参考訳(メタデータ) (2026-06-04T09:35:54Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution [0.0]
予測市場は、不確実な出来事を予測するために集合的なインテリジェンスを集約する。
既存のオラクルシステムは、高速だが不安定な自動化と、正確だがコストのかかる人間の仲裁とをトレードオフする。
マルチエージェントLLMアーキテクチャが単一モデルベースラインよりもオラクル分解能を向上できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-05-29T03:44:19Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation [12.294365308421606]
我々は、議論のアウトプットを調整された行動逆エスカレート決定に変換する、ポストホックな意思決定層であるConformal Social Choiceを紹介する。
階層的なアクションポリシーは、シングルトンセットを自律的なアクションにマップし、より大きなセットを人間のエスカレーションにマップする。
この層は議論が確実に間違っている場合に作用しないため、残りの共形シングルトンは90.0--96.8%の精度に達する。
論文 参考訳(メタデータ) (2026-04-09T00:15:20Z) - Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus [0.0]
マルチエージェントLDM委員会は、異なるロールプロンプトの下で同じモデルを複製し、多数決によってアウトプットを集約する。
それぞれのエージェントのチェーン・オブ・シークレットの論理を組み込んで、100 GSM8Kの質問に3つのQwen2.5-14Bのエージェントでペアの類似度を測る。
DALCは、埋め込み幾何学から多様性重量を計算するトレーニングフリーコンセンサスプロトコルであり、GSM8Kでは87%、トークンコストでは84%に達する。
論文 参考訳(メタデータ) (2026-04-04T17:30:23Z) - VeriThinker: Learning to Verify Makes Reasoning Model Efficient [52.74493506816969]
大型推論モデルは、Chain-of-Thought (CoT)推論を用いて複雑なタスクで優れている。
過度に考える傾向は、必然的に長い推論連鎖に繋がる。
我々は,CoT圧縮の新しい手法であるVeriThinkerを紹介する。
論文 参考訳(メタデータ) (2025-05-23T14:17:56Z) - Sequential Manipulation Against Rank Aggregation: Theory and Algorithm [119.57122943187086]
脆弱なデータ収集プロセスに対するオンライン攻撃を活用します。
ゲーム理論の観点からは、対決シナリオは分布的に堅牢なゲームとして定式化される。
提案手法は,ランクアグリゲーション手法の結果を逐次的に操作する。
論文 参考訳(メタデータ) (2024-07-02T03:31:21Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z) - A Weaker Faithfulness Assumption based on Triple Interactions [89.59955143854556]
より弱い仮定として, 2$-adjacency faithfulness を提案します。
より弱い仮定の下で適用可能な因果発見のための音方向規則を提案する。
論文 参考訳(メタデータ) (2020-10-27T13:04:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。