論文の概要: Codoku: Renewable Program-Reasoning Challenges for Frontier Coding Agents
- arxiv url: http://arxiv.org/abs/2609.34661v1
- Date: Mon, 28 Sep 2026 09:01:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 11:31:35.910545
- Title: Codoku: Renewable Program-Reasoning Challenges for Frontier Coding Agents
- Title(参考訳): Codoku:フロンティアコーディングエージェントのためのプログラム推論の更新
- Abstract要約: コドク(Codoku)は、解法が部分的なプログラムで型付き細胞を埋めるベンチマークである。
我々は,300のパズルに対する5つのフロンティアモデルを,固定予算内で任意のツールを自由に使用できるコーディングエージェントを通じて評価する。
- 参考スコア(独自算出の注目度): 29.52996322888856
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing program-reasoning benchmarks ask large language models to predict a program's behavior on a given input. Coding agents break two assumptions on which these benchmarks rest: an agent can recover the answer by executing the program instead of reasoning about it, and fixed task sets drawn from existing programs are increasingly exposed to contamination, yet costly to renew. We introduce Codoku (code sudoku), a renewable benchmark in which a solver fills typed cells in a partial program to satisfy global static and dynamic constraints, such as a prescribed control-flow graph and execution path. Because a partial program cannot be executed and valid fillings are sparse in an exponentially large space of interdependent choices, neither tool use nor enumeration can substitute for program reasoning. Puzzles are synthesized from scratch via semantic reification, so fresh puzzles of controllable complexity can be generated on demand, each with a witness that guarantees solvability. We evaluate five frontier models on 300 puzzles through a coding agent free to use any tool within a fixed budget. Small puzzles already challenge open-weight models, whereas even proprietary models solve only about half of the large ones. Codoku thus offers a renewable testbed for program reasoning that can keep pace with rapidly improving coding agents. GitHub: https://github.com/connglli/Codoku.
- Abstract(参考訳): 既存のプログラム推論ベンチマークは、与えられた入力に対してプログラムの振る舞いを予測するために大きな言語モデルを要求する。
コーディングエージェントは、これらのベンチマークが残している2つの仮定を破る: エージェントは、推論する代わりにプログラムを実行することで、その答えを回復できる。
コードゥーク (コードスドゥーク) は, 所定の制御フローグラフや実行経路などの大域的静的および動的制約を満たすために, 部分プログラム内の型付きセルを補充する再生可能ベンチマークである。
部分的なプログラムは実行できず、有効なフィリングは指数関数的に大きな相互依存的な選択空間でスパースであるため、ツールの使用や列挙はプログラムの推論に代わることができない。
プラグはスクラッチからセマンティックリフィケーションを通じて合成されるので、必要に応じて制御可能な複雑性の新たなパズルを生成することができ、それぞれが可解性を保証する証人を持つ。
我々は,300のパズルに対する5つのフロンティアモデルを,固定予算内で任意のツールを自由に使用できるコーディングエージェントを通じて評価する。
小さなパズルはすでにオープンウェイトなモデルに挑戦しているが、プロプライエタリなモデルでさえ、大きなモデルの約半分しか解決していない。
Codokuは、プログラム推論のための再生可能テストベッドを提供する。
GitHub: https://github.com/connglli/Codoku.com
関連論文リスト
- Latent Programming Horizons in Coding Agents [6.8463578914435645]
ソフトウェアエンジニアリングタスクを解決するコーディングエージェントは、コードの推論、編集、テストの実行に数十ステップを費やしている。
符号化エージェントによる言語モデルの残余ストリームは、進化するプログラムの特性を線形にエンコードすることを示す。
将来の編集結果を予測するために訓練されたプローブは、パフォーマンスを最大25ステップまで向上させる。
論文 参考訳(メタデータ) (2026-07-06T15:08:26Z) - Self-Questioning Language Models [58.73276539661649]
本稿では,提案者がトピックを与えられ,解答者に対する質問を生成する非対称なセルフプレイフレームワークを提案する。
提案者と解答者はともに強化学習を通じて訓練される。
3桁の乗算、OMEGAベンチマークの代数問題、Codeforcesのプログラミング問題である。
論文 参考訳(メタデータ) (2025-08-05T17:51:33Z) - NAPG: Non-Autoregressive Program Generation for Hybrid Tabular-Textual
Question Answering [52.10214317661547]
現在の数値推論法はプログラムシーケンスを自己回帰的にデコードする。
プログラム生成の精度は、デコードステップがエラー伝搬によって展開されるにつれて急激に低下する。
本稿では,非自己回帰型プログラム生成フレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-07T11:25:21Z) - Language Models Can Teach Themselves to Program Better [4.627023679353507]
近年の言語モデル (LM) は、人間の許可を受けた問題で訓練された場合、コード生成において画期的な性能を達成する。
そこで本研究では,Pythonインタプリタの正しさをフィルタするプログラミング問題と解を,LMが合成可能であることを示す。
LMの性能は、独自の合成問題と検証された解を微調整することで改善される。
論文 参考訳(メタデータ) (2022-07-29T06:43:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。