論文の概要: Distilling Answer Set Programming Theories from Large Language Models
- arxiv url: http://arxiv.org/abs/2607.28086v1
- Date: Thu, 30 Jul 2026 11:53:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.54575
- Title: Distilling Answer Set Programming Theories from Large Language Models
- Title(参考訳): 大規模言語モデルからの解集合プログラミング理論の蒸留
- Authors: Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei,
- Abstract要約: 固定エージェントがループ内のソルバを固定することにより、モデルが完全かつ正しい理論を抽出できるかどうかを考察する。
このプロトコルはデータセットに依存しない: 1つのプロンプトと1つの空のファイルを出発点として、モデルは完全な理論を導出するために1時間の制限を与えられる。
- 参考スコア(独自算出の注目度): 2.297048595815506
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Writing Answer Set Programming (ASP) theories from scratch is a difficult and time-consuming task. We take a neurosymbolic approach to study whether a model can distill complete and correct theories, given a fixed agent harness with the solver in the loop. The protocol is dataset-agnostic: with a single prompt and an empty file as the starting point the model is given a 1-hour time limit to derive a complete theory. We chose VQA as the application domain, three benchmarks (CLEVR, GQA, CLEVRER), as these are publicly available and non-trivial. In order to study the model scale required for solving this task we nine different models: four frontier (Claude Sonnet 4.6, Claude Opus 4.7, GPT-5, DeepSeek V4 Pro), two mid-tier (DeepSeek V4 Flash, gpt-oss-120b), and three open-weights (qwen3.6-27b, gpt-oss-20b, qwen3.5-9b). Three of four frontier models reach 100% on CLEVR and 92.8%-98.8% on GQA; on CLEVRER, Sonnet, Opus, DeepSeek V4 Pro score 92.7%-95.3%. GPT-5 reaches 98.7% on CLEVR but drops to 41.8% on GQA and to 86.7% on CLEVRER. Adding handwritten reference theories from other datasets moves the other three frontier models by at most +/-3.4 pp but reduces GPT-5's accuracy by 3-19 pp. We release the code, prompts, and theories distilled.
- Abstract(参考訳): ASP(Answer Set Programming)理論をスクラッチから書くのは難しく、時間を要する作業です。
モデルが完全な理論と正しい理論を蒸留できるかどうかを神経象徴的手法で検討する。
このプロトコルはデータセットに依存しない: 1つのプロンプトと1つの空のファイルを出発点として、モデルは完全な理論を導出するために1時間の制限を与えられる。
私たちはVQAをアプリケーションドメインとして3つのベンチマーク(CLEVR、GQA、CLEVRER)を選択しました。
4つのフロンティア(Claude Sonnet 4.6, Claude Opus 4.7, GPT-5, DeepSeek V4 Pro)、2つの中間層(DeepSeek V4 Flash, gpt-oss-120b)、3つのオープンウェイト(qwen3.6-27b, gpt-oss-20b, qwen3.5-9b)である。
4つのフロンティアモデルのうち、100%がCLEVR、92.8%-98.8%がGQA、CLEVRER、Sonnet、Opus、DeepSeek V4 Proが92.7%-95.3%である。
GPT-5はCLEVRで98.7%に達するが、GQAで41.8%、CLEVRERで86.7%に低下する。
他のデータセットから手書きの参照理論を追加することで、他の3つのフロンティアモデルを最大で +/-3.4 pp で移動させるが、GPT-5の精度は 3-19 pp で減少する。
コードを公開し、プロンプトと理論を蒸留します。
関連論文リスト
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD [91.71050339479261]
本稿では,Ascend NPU SuperPODにおけるエンドツーエンド最適化手法を提案する。
モデルレベルの並列性、計算通信オーケストレーション、低レベルのカーネル実行にまたがる階層的最適化フレームワークを開発した。
その結果、34.22%のモデルFLOP(Model FLOP)利用が達成され、オープンソースのベースラインレシピよりも2.93倍改善された。
論文 参考訳(メタデータ) (2026-07-22T13:49:17Z) - A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback [4.062253229926774]
A-ProSは、ハイブリッドマルチモデルフィードバックフレームワークを通じて競合するプログラミング問題を解決する自律AIエージェントである。
A-ProSはベースラインエージェントループに比べて2倍以上のゲインを達成する。
論文 参考訳(メタデータ) (2026-05-18T08:55:30Z) - When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models [2.064923532131528]
デプロイされた言語モデルは、正しいものとフォーマットに準拠した出力を生成する必要がある。
本稿では,GSM8KとMATHという2つの数学的ベンチマークを用いて,この構造化出力信頼性ギャップについて検討する。
対象モデルへのブラックボックスAPIアクセスのみを必要とする反復的なシステムプロンプトであるAloLabを開発した。
論文 参考訳(メタデータ) (2026-05-04T09:07:44Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models [194.64264251080454]
GLM-4.5はオープンソースのMixture-of-Experts(MoE)大言語モデルであり,総パラメータは355B,アクティベートパラメータは32Bである。
23Tトークンのマルチステージトレーニングと、エキスパートモデルのイテレーションと強化学習による総合的なポストトレーニングを通じて、GLM-4.5はエージェント、推論、コーディングタスクにわたって強力なパフォーマンスを実現している。
GLM-4.5(355Bパラメータ)とGLM-4.5-Air(106Bパラメータ)をそれぞれリリースし、推論とエージェントAIシステムの研究を進めた。
論文 参考訳(メタデータ) (2025-08-08T17:21:06Z) - Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction [95.91743732150233]
一連のオープンソースの言語モデルであるGoedel-Prover-V2は、自動定理の新たな最先端を証明した。
我々は、より複雑な定理をマスターするためにモデルを訓練することの困難さを増す合成タスクを生成する。
Goedel-Prover-V2-32Bは、標準モードのpass@32でMiniF2Fの88.1%、自己補正モードの90.4%を達成する。
論文 参考訳(メタデータ) (2025-08-05T16:28:22Z) - I Know Which LLM Wrote Your Code Last Summer: LLM generated Code Stylometry for Authorship Attribution [0.0580448704422069]
本稿では,Cプログラムの著者帰属に関する最初の体系的研究について述べる。
CodeT5-Authorshipは、オリジナルのCodeT5エンコーダ-デコーダアーキテクチャのエンコーダ層のみを使用する新しいモデルです。
本モデルでは,近縁なモデルによって生成されたCプログラムを97.56%の精度で識別する。
論文 参考訳(メタデータ) (2025-06-18T19:49:41Z) - OpenThoughts: Data Recipes for Reasoning Models [215.16652796083164]
OpenThoughtsプロジェクトは、推論モデルをトレーニングするためのオープンソースのデータセットを作成することだ。
OpenThoughts2-1Mデータセットは、公開推論データに基づいてトレーニングされた最初のモデルであるOpenThinker2-32Bに導かれた。
OpenThoughts3-7Bモデル。
論文 参考訳(メタデータ) (2025-06-04T17:25:39Z) - LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models [59.0256377330646]
Lensは3.4Kの現代画像と8つのタスクと12の日次シナリオをカバーする60K以上の人間による質問のベンチマークである。
このデータセットは本質的に、基本的な知覚から構成的推論に至るまで、画像不変のプロンプトを処理するためのMLLMの評価をサポートする。
我々は,Qwen2.5-VL-72B,InternVL3-78B,GPT-4oおよび2つの推論モデルQVQ-72B-previewとKim-VLなどの15以上のフロンティアMLLMを評価する。
論文 参考訳(メタデータ) (2025-05-21T15:06:59Z) - S*: Test Time Scaling for Code Generation [55.11863577956177]
コード生成のための最初のハイブリッドテストタイムスケーリングフレームワークであるS*を提案する。
S*は生成されたコードのカバレッジと選択精度を大幅に改善する。
論文 参考訳(メタデータ) (2025-02-20T09:18:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。