論文の概要: InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information
- arxiv url: http://arxiv.org/abs/2608.29632v1
- Date: Sun, 30 Aug 2026 07:50:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.025828
- Title: InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information
- Title(参考訳): InteractBench: 未公開情報による競合プログラミングに関するLLMのベンチマーク
- Authors: Jiaze Li, Aocheng Shen, Bing Liu, Boyu Zhang, Xiaoxuan Fan, Qiankun Zhang, Xianjun Deng,
- Abstract要約: Codeforces, AtCoder, IOI, ICPCから算出した322の高品質な対話型問題からなるベンチマークであるInteractBenchを紹介する。
各問題は実行可能ローカルインタラクタでパッケージ化され、完全にオフラインで評価できる。
もっとも先進的な推論モデルでさえ、対話的な問題において限られた成功を達成している。
- 参考スコア(独自算出の注目度): 15.232647622085706
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Competitive programming is increasingly being used to evaluate the algorithmic reasoning capabilities of large language models (LLMs). However, existing benchmarks primarily focus on full-information tasks where all problem inputs are provided upfront. This overlooks a critical dimension of algorithmic reasoning: the ability of generated programs to operate when key information is not revealed upfront. Interactive problems, a distinctive component of competitive programming, embody this challenge. These problems require programs to engage in multi-round interaction with an interactor (a judge program) under strict protocol constraints and limited query budgets, with new information revealed only in response to queries. To address this gap, we introduce InteractBench, a benchmark comprising 322 high-quality interactive problems curated from Codeforces, AtCoder, IOI, and ICPC. Each problem is packaged with executable local interactors, enabling fully offline evaluation. Unlike existing benchmarks, InteractBench assesses whether model-generated code can acquire information and track state dynamically. Our evaluation reveals a significant interaction gap: even the most advanced reasoning models achieve limited success on interactive problems. Beyond success rates, we propose a fine-grained failure taxonomy to diagnose the root causes of these deficiencies. Although algorithmic logic errors remain dominant, protocol violations and query-budget overruns are frequent. Code is available at https://github.com/kmsgk0/InteractBench.
- Abstract(参考訳): 競合プログラミングは、大規模言語モデル(LLM)のアルゴリズム推論能力を評価するために、ますます使われている。
しかし、既存のベンチマークは主に、すべての問題入力が事前に提供される完全な情報タスクに焦点を当てている。
これはアルゴリズム推論の重要な次元を見落としている: キー情報が事前に明らかにされていないときに生成したプログラムを動作させる能力である。
競合プログラミングの独特なコンポーネントであるインタラクティブな問題は、この課題を具現化している。
これらの問題は、厳密なプロトコル制約と限られたクエリ予算の下で、対話者(審査員プログラム)とマルチラウンドの対話を行うプログラムを必要とする。
このギャップに対処するために、Codeforces, AtCoder, IOI, ICPCから算出された322の高品質な対話型問題からなるベンチマークであるInteractBenchを紹介する。
各問題は実行可能ローカルインタラクタでパッケージ化され、完全にオフラインで評価できる。
既存のベンチマークとは異なり、InteractBenchはモデル生成コードが情報を取得し、状態を動的に追跡できるかどうかを評価する。
もっとも先進的な推論モデルでさえ、対話的な問題において限られた成功を達成している。
成功率以外にも、これらの欠陥の根本原因を診断するためのきめ細かい失敗分類法を提案する。
アルゴリズム論理の誤りは依然として支配的であるが、プロトコル違反やクエリ予算オーバーランは頻繁に発生する。
コードはhttps://github.com/kmsgk0/InteractBench.comで入手できる。
関連論文リスト
- CodeGlance: Understanding Code Reasoning Challenges in LLMs through Multi-Dimensional Feature Analysis [14.328535883908176]
CodeGlanceは、3つの現実的なシナリオにわたるコード推論の課題を調査するベンチマークです。
未確認関数推論は,特に小型モデルでは重要な課題となる。
シナリオ間でコード推論の難しさに大きな影響を及ぼす重要なコード複雑性の特徴を特定します。
論文 参考訳(メタデータ) (2026-02-15T02:46:51Z) - FrontierCS: Evolving Challenges for Evolving Intelligence [174.80075821079708]
コンピュータ科学の様々な領域にまたがる156のオープンエンド問題のベンチマークであるFrontierCSを紹介する。
各問題に対して、専門家の参照ソリューションと自動評価器を提供する。
私たちは、アルゴリズムと研究のトラックに関して、フロンティア推論モデルが人間の専門家よりずっと遅れていることに気付きました。
論文 参考訳(メタデータ) (2025-12-17T18:52:45Z) - Interactive Evaluation of Large Language Models for Multi-Requirement Software Engineering Tasks [15.072898489107887]
55のプログラミングタスクのベンチマークであるDevAIの上に構築し、基礎的真実のソリューションを追加し、インタビュアーヒントの妥当性と有用性を評価する。
本研究は,協調型コード生成エージェントの開発における動的評価の重要性を強調した。
論文 参考訳(メタデータ) (2025-08-26T10:22:37Z) - ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering [5.248435832744057]
ALE-Benchは、スコアベースのアルゴリズムプログラミングコンテストでAIシステムを評価するための新しいベンチマークである。
ALE-Bench は計算的に困難であり、正確な解は認めない最適化問題を提示する。
私たちのソフトウェアフレームワークは、テスト実行フィードバックと視覚化を活用する対話型エージェントアーキテクチャをサポートしています。
論文 参考訳(メタデータ) (2025-06-10T17:59:56Z) - ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests [85.72404266850982]
推論のフロンティアを探索するために設計されたトップレベルの競合コーディングベンチマークである textbfICPC-Eval を提案する。
ICPC-Evalは、世界中の各地域で開催されている11のICPCコンテストから、118の慎重にキュレートされた問題を含んでいる。
結果は、複雑な推論能力を評価する上で重要な課題を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-05T11:20:37Z) - CPRet: A Dataset, Benchmark, and Model for Retrieval in Competitive Programming [58.48683464644606]
競合プログラミングのための検索指向ベンチマークスイートであるCPRetを紹介する。
私たちのコントリビューションには、高品質なトレーニングデータと、信頼性評価のための時間的に分離されたテストセットの両方が含まれています。
問題コードアライメントのための新しいGroup-InfoNCE損失で訓練されたCPRetriever-Codeと、問題レベルの類似性を特定するための微調整されたCPRetriever-Probの2つのタスク専用レトリバーを開発する。
論文 参考訳(メタデータ) (2025-05-19T10:07:51Z) - Is Compression Really Linear with Code Intelligence? [60.123628177110206]
textitFormat Annealingは、事前訓練されたモデルの本質的な能力を同等に評価するために設計された、軽量で透明なトレーニング手法である。
我々の経験的結果は、測定されたコードインテリジェンスとビット・パー・キャラクタ(BPC)の基本的な対数関係を明らかにする。
私たちの研究は、コードインテリジェンスの開発における圧縮の役割をより微妙に理解し、コードドメインにおける堅牢な評価フレームワークに貢献します。
論文 参考訳(メタデータ) (2025-05-16T16:59:14Z) - Interactive Agents to Overcome Ambiguity in Software Engineering [61.40183840499932]
AIエージェントは、あいまいで不明確なユーザー指示に基づいて、タスクを自動化するためにますますデプロイされている。
不安定な仮定をし、明確な質問をしないことは、最適以下の結果につながる可能性がある。
対話型コード生成設定において,LLMエージェントが不明瞭な命令を処理する能力について,プロプライエタリモデルとオープンウェイトモデルを評価して検討する。
論文 参考訳(メタデータ) (2025-02-18T17:12:26Z) - PECC: Problem Extraction and Coding Challenges [3.287942619833188]
PECCは、Advent Of Code(AoC)の課題とProject Eulerから派生した、新しいベンチマークである。
従来のベンチマークとは異なり、PECCは物語に埋め込まれた問題を解釈し、要求を抽出し、コードを生成するためにLCMを必要とする。
結果は、ユーラー数に基づく部分集合において、物語的問題と中立的問題の間に様々なモデル性能を示す。
論文 参考訳(メタデータ) (2024-04-29T15:02:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。