論文の概要: EnigmaForge: The Question Is Hidden in the Story
- arxiv url: http://arxiv.org/abs/2609.30144v1
- Date: Thu, 24 Sep 2026 17:10:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.145447
- Title: EnigmaForge: The Question Is Hidden in the Story
- Title(参考訳): EnigmaForge: 質問は物語の中に隠されている
- Abstract要約: EnigmaForgeは、古いドキュメントのスタックを渡すが、疑問の余地は全くない。
SATソルバは、すべての手がかりがロードベアリングであることを証明する。
205台のフロンティアモデルが600以上のインスタンスを走らせ(17,400得点)
Intrepidはリーダボードを再シャッフルする – 事実のリカバリが1.6倍に広がる22倍のスプレッド,第2位のファクトリカバリのランク,ひとつは質問に対する回答に無関心なモデル,もうひとつはそれなしでははるかによいモデルだ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most benchmarks hand the model a question. EnigmaForge hands it a stack of old documents and no question at all. Buried in the letters, receipts, and logbook margins is a small logic puzzle whose solution is unique - proved by a SAT solver at generation time, with an ablation certificate showing every clue is load-bearing. Because instances are generated rather than collected, the corpus renews forever. The headline measure is intuition: task success when handed only the story, with world reconstruction as the secondary axis. Twenty-five frontier models ran over 600 instances (17,400 scored records) under three matched conditions. Intuition reshuffles the leaderboard: a 22x spread where fact recovery spans 1.6x, the second-best fact-recoverer ranks fourteenth, one model is indifferent to being told the question, and another is significantly better without it. Several models were blocked by their own content filters before reaching the puzzle - any benchmark scoring refusals as failure is quietly measuring filter behavior.
- Abstract(参考訳): ほとんどのベンチマークがモデルに疑問を呈している。
EnigmaForgeは、古いドキュメントのスタックを渡すが、疑問の余地は全くない。
文字、レシート、ログブックのマージンに埋められているのは、一意の解法を持つ小さな論理パズルで、SATソルバが生成時に証明し、すべての手がかりがロードベアリングであることを示すアブレーション証明書がある。
インスタンスは収集されるのではなく生成されるので、コーパスは永久に更新される。
ストーリーのみを渡すとタスクが成功し、世界再構築が二次軸となる。
25台のフロンティアモデルが600以上のインスタンス(17,400得点記録)を3つのマッチした条件で走らせた。
22倍のリカバリ、第2位のファクトリカバリ、第14位、第1のモデルは質問に対して無関心、第2のモデルはそれなしでははるかに優れている。
パズルに到達する前に、いくつかのモデルが独自のコンテントフィルタによってブロックされた。
関連論文リスト
- Beyond Linear Context: Graph-Guided Evidence Navigation for Long-Novel Reasoning with a Local 9B Language Model [0.0]
凍結した知識グラフが同じ自由度を持つ小さな局所モデルを提供できるかどうかをテストする。
30の推理小説と234の質問は、固定されたqwen3.5:9bリーダーによって答えられる。
論文 参考訳(メタデータ) (2026-09-19T10:29:56Z) - In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning [0.0]
我々は、小さな量子化モデルであるLlama 3.1 8B(Llama 3.1 8B)が、検索された文脈のごく一部が汚染されたときにどれだけ劣化するかを研究する。
清潔な文脈では77.9%から43.5%に減少し、3つの通路が全て崩壊する。
論文 参考訳(メタデータ) (2026-09-08T08:31:57Z) - Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration [0.0]
ゲームエンジンが、どのモデルでも、クエストが完了するかどうかを知ることができるような、テキストアドベンチャーの世界を構築します。
結果が読まれる前に決定ルールが記録され、実行するアーティファクトが実行されたリビジョンにバインドされる。
プレイヤーが固定された状態で、楽器の選択は測定された振る舞いを大きく変えた。
論文 参考訳(メタデータ) (2026-07-15T22:33:53Z) - Piercing Gilbreath's Conjecture: From Deep Number Theory Insights to Fintech and Cybersecurity [0.0]
素数に関するギルブレスの予想は1878年に初めて投稿され、今日まで未解決である。
私は1878年に初めて投稿され、今日まで未解決である、素数に関するギルブレス予想に挑戦する新しい方法を提案する。
本報告では, 探索に基づく新たなアプローチ, 証明を伴う多数の新たな結果, 解への正確な経路, ソリッドリファレンスを提示することによって, ゲームを変えている。
論文 参考訳(メタデータ) (2026-07-05T08:09:25Z) - Frontier LLMs Still Struggle with Simple Reasoning Tasks [53.497499123166804]
この研究は、フロンティア言語モデルの性能を、幅広い「容易」推論問題に対して研究する。
計算,一階述語論理,証明木,旅行計画など,手続き的に生成された単純な推論タスクのスイートを作成します。
最先端の思考モデルでさえ、このような問題や同様の理由で一貫して失敗することを示します。
論文 参考訳(メタデータ) (2025-07-09T22:22:49Z) - ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge [50.93758649363798]
Impliretは、推論の課題をドキュメント側処理にシフトするベンチマークである。
我々は,この環境下で苦戦している,疎水・密集したレトリバーの幅を評価した。
論文 参考訳(メタデータ) (2025-06-17T11:08:29Z) - One Thousand and One Pairs: A "novel" challenge for long-context language models [56.60667988954638]
NoChaは、67冊の架空の書籍に関する1,001対の真偽の主張のデータセットである。
当社のアノテータは、NoChaにおけるペアの最大シェアは、本全体に対するグローバルな推論を必要としていることを確認しています。
平均的なモデルでは、文レベルの検索しか必要としないペアの方が、グローバルな推論よりもはるかに優れています。
論文 参考訳(メタデータ) (2024-06-24T02:03:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。