論文の概要: Playing log(N)-Questions over Wikipedia Abstracts: How Per-Round Errors Compound Under Information Asymmetry
- arxiv url: http://arxiv.org/abs/2609.19113v3
- Date: Tue, 22 Sep 2026 02:06:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.851916
- Title: Playing log(N)-Questions over Wikipedia Abstracts: How Per-Round Errors Compound Under Information Asymmetry
- Title(参考訳): log(N)-Questions over Wikipedia Abstracts: How Per-Round Errors Compound under Information Asymmetric
- Abstract要約: 我々は2エージェントの$log N$-Questionsゲーム上で6つのフロンティア言語モデルを評価する。
$N$の候補リードパラグラフにアクセスする質問者は、正確に$log N$のバイナリ質問を使用して秘密のターゲットを特定する必要がある。
408ゲーム中、勝利率は水平長の幾何学的パワーとしてきれいに崩壊する。
- 参考スコア(独自算出の注目度): 0.08460698440162888
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We evaluate six frontier language models on the two-agent $\log_2 N$-Questions game (Potash et al., 2019) to measure self-communication across an information asymmetry. A questioner with access to $N$ candidate Wikipedia lead paragraphs ($N = 4$ to $1024$) must identify a secret target using exactly $\log_2 N$ binary questions answered by an agent from the same provider that sees only the target. Across 408 games, win rate decays cleanly as a geometric power of horizon length, $p^{\log_2 N}$ ($p \approx 0.93$). Per-round failure rates are flat across the horizon, indicating that errors compound because more rounds must succeed rather than because individual rounds grow harder. Adjudication across three independent judges shows that losses divide between single-agent answer errors and discrimination failures, which become undetectable and unrecoverable under the two-agent structure rather than from channel breakdown. Claude Opus 5 lags behind due to systematic false-negative answers (82% answer errors), whereas the five leading models (GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash, and Kimi K3) are closely clustered. Maximizing information gain requires structural partitioning (e.g., splitting on document titles), and neither reasoning-token expenditure nor API cost correlates with success ($r = -0.05$), highlighting communicative reliability as a distinct bottleneck from inference compute.
- Abstract(参考訳): 情報非対称性の自己伝達を測定するために,2エージェントの$\log_2 N$-Questionsゲーム(Potash et al , 2019)上で6つのフロンティア言語モデルを評価した。
ウィキペディアのリーダーパラグラフ(N = 4$から1024$)にアクセスする質問者は、ターゲットだけを見ている同じプロバイダのエージェントが答えた、正確に$\log_2 N$バイナリーの質問を使って秘密のターゲットを特定する必要がある。
408ゲーム全体で、勝利率は水平線の幾何学的パワーとしてきれいに崩壊し、$p^{\log_2 N}$$(p \approx 0.93$)となる。
ラウンドごとの失敗率は地平線を越えて平坦であり、個々のラウンドがより難しくなるためではなく、より多くのラウンドが成功しなければならないため、エラーは複雑であることを示している。
3人の独立した裁判官の判断は、単一エージェントの回答エラーと識別失敗の間に損失が分散していることを示している。
クロード・オプス 5 は体系的な偽陰性回答 (82%の解答エラー) により遅れており、5つの主要なモデル (GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash, Kimi K3) は密集している。
情報ゲインの最大化には構造的なパーティショニング(例: ドキュメントタイトルの分割)が必要であり、推論のコストもAPIコストも、成功と相関しない(r = -0.05$)。
関連論文リスト
- Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance [2.8543100656957883]
共有作業空間に対する管理作業者の足場の影響について検討する。
監督のオプス5は1回のパスで91%の得点を記録した。
マネジャーの実行はトークンの請求書を3倍にしますが、より大きなモデルに移行するよりも、より安価で精度が得られます。
論文 参考訳(メタデータ) (2026-08-27T00:11:41Z) - Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation [5.154153910688557]
モデルが3つのモードのうちの1つを選択することで、独自の推論作業の割り当てを学べるかどうかを検討する。
この選択は、別のルータなしで、グループ相対ポリシー最適化の中で学習される。
私たちは、各問題に対してどの程度の推論を行うかを適応的に選択する推論モデルを構築します。
論文 参考訳(メタデータ) (2026-08-20T16:54:08Z) - Watermark Forensics for Generative Models: An Information-Theoretic Perspective [21.787038393697056]
生成モデルの出力の透かしは通常、テキストが機械化されているかどうかのみ尋ねられる。
同じマークは、作成したユーザに属性付けしたり、隠されたペイロードを抽出したり、編集を生き残る部分をローカライズしたりできる。
S$ をマークが持つ秘密(ユーザのIDまたはペイロード)とし、情報プロファイル $(t)=I(S;X_tmid X_t)$レコードに、以前のものからすると、$t$-thトークンが約$S$を示すかを記録する。
論文 参考訳(メタデータ) (2026-07-14T17:49:52Z) - Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets [0.01269104766024433]
構造化推論の介入が大規模言語モデルの戦略的経済的推論を改善するかどうかを検討する。
GPT-4.1-mini(標準命令追従モデル)とGPT-5-mini(推論最適化モデル)を5条件で評価した。
足場型とモデルアーキテクチャ間の統計的に有意な相互作用を見出した。
論文 参考訳(メタデータ) (2026-07-03T10:23:31Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Human vs Machine Mathematical Difficulty on Project Euler: An Experimental Analysis [0.3070424190973324]
我々は,フロンティアAIシステムの取り組みと成功確率が,プロジェクト・オイラーの問題に対する人間の困難さとどのようにスケールするかを検討する。
MathArenaのベンチマークから得られたデータセットは、50の課題にまたがる3840の試行と26のモデル構成で構成されています。
論文 参考訳(メタデータ) (2026-06-20T10:01:18Z) - Stateful Reasoning via Insight Replay [51.85629502016196]
CoT(Chain-of-Thought)推論は,大規模言語モデルにおける多段階推論の基盤となっている。
この現象の主な原因は、CoTが成長するにつれて、トレースの早期に生成された重要な洞察に対するモデルの注意が徐々に弱まることである。
提案手法は、モデルがその推論トレースから定期的に重要な洞察を抽出し、アクティブな世代フロンティア付近で再生するステートフル推論手法である。
論文 参考訳(メタデータ) (2026-05-14T06:52:59Z) - What Do EEG Foundation Models Capture from Human Brain Signals? [64.48249643001402]
現代の脳波基礎モデルは、自己教師付き事前訓練を通じて生信号から直接学習する。
我々は3つのサブクエストに分解する: モデルが何を学習するか、モデルを何に使用するのか、そしてどのように説明できるのか。
3つの基礎モデル(CSBrain, CBraMod, LaBraM),5つの臨床タスク(MDD, Stress, ISRUC-Sleep, TUSL, Siena)と6ファミリー63機能レキシコンを含む。
論文 参考訳(メタデータ) (2026-05-12T01:57:53Z) - A$^2$Search: Ambiguity-Aware Question Answering with Reinforcement Learning [46.81869577197105]
A$2$Searchはアノテーションのないエンドツーエンドのトレーニングフレームワークで、曖昧さを認識し、扱います。
8つのオープンドメインQAベンチマークの実験では、A$2$Searchが新しい最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-09T08:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。