論文の概要: Witness: Discovery, Deciphering, and Epiphany in Interactive Puzzle Environments
- arxiv url: http://arxiv.org/abs/2609.32208v1
- Date: Sat, 26 Sep 2026 04:10:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 18:57:15.167666
- Title: Witness: Discovery, Deciphering, and Epiphany in Interactive Puzzle Environments
- Title(参考訳): 知性:対話型パズル環境における発見・解読・啓発
- Abstract要約: WITNESSは、2Dグリッドベースのパズル環境であり、ASCII観測とルールの制御が可能である。
共有ハーネスの下では、18のフロンティアプロプライエタリとオープンウェイトモデルのベストは、プライベートテストレベルのスロットの24%しか解決できない。
WitnessGymのRLは27BモデルのプライベートテストRHAE-L5を2.1から5.4に引き上げ、4つの外部発見ベンチマークで平均4.1ポイント向上する。
- 参考スコア(独自算出の注目度): 17.06906990588691
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated science needs agents that can work out the rules of an unfamiliar environment by interacting with it. Interactive rule-discovery puzzles offer a controlled setting for studying this ability: an agent infers hidden rules through experimentation and uses what it has inferred to reach a stated goal. We ask what limits current language models on these puzzles and whether reinforcement learning (RL) improves performance on rules held out from training. To study both, we introduce WITNESS, a 2D grid-based puzzle environment with ground-truth ASCII observations and controlled access to rules. An agentic pipeline generates games for WitnessGym, the RL training suite, and WitnessBench, comprising public validation and private test games. The validation set separately tests new compositions of trained rule primitives and primitives absent from training. Under a shared harness, the best of 18 frontier proprietary and open-weight models solves only 24\% of private test level slots, with scores sensitive to the observation interface and agent configuration. Providing ground-truth rules raises Opus-5's validation RHAE-L5 (relative human action efficiency over the first five levels) from 59.9 to 97.8, whereas a 27B open-weight model gains only 2.1 points and remains limited even with the rules provided. RL on WitnessGym raises the 27B model's private test RHAE-L5 from 2.1 to 5.4 and yields a mean gain of 4.1 points on four external discovery benchmarks. Together, these results point to rule acquisition as a major difficulty for frontier models like Opus-5 while smaller models further struggle on rule-based execution, and indicate that RL on hidden-rule puzzles transfers to broader rules and real-world tasks beyond training. Benchmark is available at: https://witnessbench.ai
- Abstract(参考訳): 自動化された科学は、不慣れな環境のルールを、それと対話することによって解決できるエージェントを必要とします。
エージェントは実験を通じて隠れたルールを推論し、それが想定した目標を達成するために使用します。
これらのパズルの現在の言語モデルに制限があるのか、強化学習(RL)がトレーニングから守られたルールの性能を改善するのかを問う。
そこで本研究では,2次元グリッド型パズル環境であるWITNESSを紹介した。
エージェントパイプラインは、公開検証とプライベートテストゲームを含むWitnessGym、RLトレーニングスイート、WitnessBench用のゲームを生成する。
検証セットは、トレーニングされていないトレーニングされたルールプリミティブとプリミティブの新しい構成を別々にテストする。
共有ハーネスの下では、18のフロンティアプロプライエタリモデルとオープンウェイトモデルのベストは、プライベートテストレベルのスロットの24倍しか解決せず、スコアは観察インターフェースとエージェント設定に敏感である。
オプス5の検証RHAE-L5は59.9から97.8に上昇する一方、27Bのオープンウェイトモデルでは2.1ポイントしか獲得できず、規定されたルールでも制限されている。
WitnessGymのRLは27BモデルのプライベートテストRHAE-L5を2.1から5.4に引き上げ、4つの外部発見ベンチマークで平均4.1ポイント向上する。
これらの結果は、ルール獲得がOpus-5のようなフロンティアモデルにとって大きな困難であることを示している一方、より小さなモデルはルールベースの実行にさらに苦労し、隠れルールパズル上のRLが、トレーニング以外のより広いルールや現実世界のタスクに移行していることを示している。
Benchmark は https://witnessbench.ai で利用可能である。
関連論文リスト
- GlyphBench: A Playground for Language-Model Reinforcement Learning [33.17394442902942]
本稿では,言語モデルエージェントの強化学習(RL)後学習のための環境スイートであるGlyphBenchを紹介する。
GlyphBenchは2次元Unicodeグリッドとして空間観測をレンダリングし、トレーニング、評価、軌跡再生を接続する。
クラックス実験では,グリフ観察がネイティブテキストやピクセルよりも優れており,BALROG環境がさらに向上していることが示されている。
論文 参考訳(メタデータ) (2026-09-28T03:21:57Z) - Understanding Reasoning from Pretraining to Post-Training [53.890128750021375]
チェスは前訓練から後訓練までのパイプライン全体にわたって推論を研究するための制御テストベッドとして使用します。
所定のRL計算レベルでのポストRL性能は、事前学習損失からよく予測できる。
さらに,数学領域のテキスト上での1B言語モデルの訓練により,我々の研究結果がチェスを超えるか否かを検証した。
論文 参考訳(メタデータ) (2026-07-17T16:31:58Z) - Explore Before You Solve: The Speed--Depth Trade-off in Epistemic Agents for ARC-AGI-3 [0.0]
一般に25のARC-AGI-3ゲームについて検討し、すべてのゲームが非知的な戦略によって到達可能であることを確認する。
このベンチマーク批判は、公開評価セットが知的探索を識別できないことを示唆している。
これら25試合でRHAE=0.2116を達成する三相(EXPLORE / VERIFY / PLAN)エージェントであるAERAを提案する。
論文 参考訳(メタデータ) (2026-05-25T15:13:18Z) - SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild [46.25416990387885]
ロングチェーン・オブ・シント(CoT)推論は、ルールベースの報酬を持つ単純な強化学習フレームワークを通じて自然に現れる。
LLama3-8B,Mistral-7B/24B,DeepSeek-Math-7B,Qwen2.5-math-7B,およびQwen2.5モデル0.5Bから32Bを含む10種類のベースモデルを対象としたゼロRLトレーニングについて検討した。
論文 参考訳(メタデータ) (2025-03-24T17:06:10Z) - Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play [52.3079697845254]
evaは、オフラインとオンラインのRLポストトレーニングの両方で、言語モデルがトレーニングプロンプトを適応的に作成できるようにする最初の方法である。
我々は,エバが有効なRLキュリキュラを作成でき,アブレーションにまたがって堅牢であることを示す。
論文 参考訳(メタデータ) (2024-10-31T08:15:32Z) - Leveraging Reward Consistency for Interpretable Feature Discovery in
Reinforcement Learning [69.19840497497503]
一般的に使われているアクションマッチングの原理は、RLエージェントの解釈よりもディープニューラルネットワーク(DNN)の説明に近いと論じられている。
本稿では,RLエージェントの主目的である報酬を,RLエージェントを解釈する本質的な目的として考察する。
我々は,Atari 2600 ゲームと,挑戦的な自動運転車シミュレータ環境である Duckietown の検証と評価を行った。
論文 参考訳(メタデータ) (2023-09-04T09:09:54Z) - SPRING: Studying the Paper and Reasoning to Play Games [102.5587155284795]
我々は,ゲーム本来の学術論文を読み取るための新しいアプローチ,SPRINGを提案し,大言語モデル(LLM)を通してゲームの説明とプレイの知識を利用する。
実験では,クラフトオープンワールド環境の設定下で,異なる形態のプロンプトによって引き起こされる文脈内「推論」の品質について検討した。
我々の実験は、LLMが一貫したチェーン・オブ・シークレットによって誘導されると、洗練された高レベル軌道の完成に大きな可能性があることを示唆している。
論文 参考訳(メタデータ) (2023-05-24T18:14:35Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。