論文の概要: Learning How to Cube
- arxiv url: http://arxiv.org/abs/2605.16632v1
- Date: Fri, 15 May 2026 21:03:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:46.81264
- Title: Learning How to Cube
- Title(参考訳): キューブの作り方を学ぶ
- Authors: Ferhat Erata, Sam Kouteili, Thanos Typaldos, Timos Antonopoulos, Robert B. Jones, Byron Cook, Ruzica Piskac,
- Abstract要約: トランスフォーマーベースのモデルが効果的な満足度を学習できることは、これまでの研究では示されていない。
本稿では,この課題に対するニューロシンボリックポストトレーニングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 3.9559999471688383
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the effectiveness of Cube-and-Conquer (C&C) for solving challenging Boolean Satisfiability (SAT) problems, no prior work has shown that transformer-based models can learn effective cubing heuristics. We introduce a neuro-symbolic post-training framework for this task. We design an MCTS-based data curation pipeline that uses symbolic heuristics to explore splitting decisions over SAT competition formulas, producing preference data grounded in solver statistics and augmented with reasoning traces from a teacher model. Our two-stage post-training, supervised fine-tuning (SFT) followed by direct preference optimization (DPO), enables a 4B-parameter model to achieve a pass@5 score of 53 on 100 SAT competition benchmarks, surpassing frontier LLMs such as Claude-Sonnet-4 (50) and matching the best symbolic heuristic (53). Ablations show that SFT alone improves pass@5 from 46 to 51, with DPO adding 2 additional benchmarks; an entropy/agreement ablation on realized first-cube decisions further shows that SFT, not DPO, accounts for the root-level decision diversity that produces complementary per-run coverage over deterministic symbolic methods. This demonstrates that transformers can be trained to make effective cubing decisions in a domain traditionally dominated by symbolic methods.
- Abstract(参考訳): ブール満足度(SAT)問題の解決にキューブ・アンド・コンカー(C&C)が有効であるにもかかわらず、トランスフォーマーベースのモデルが効果的なキューブヒューリスティックを学習できることは、これまでの研究では示されていない。
本稿では,この課題に対するニューロシンボリックポストトレーニングフレームワークを提案する。
我々は,MCTSに基づくデータキュレーションパイプラインを設計し,シンボリック・ヒューリスティックスを用いてSAT競争公式上の分割決定を探索し,解法統計に基づく嗜好データを生成し,教師モデルからの推論トレースを付加する。
我々の2段階の訓練後、教師付き微調整(SFT)と直接選好最適化(DPO)により、4Bパラメータモデルにより、100個のSATコンペティションベンチマークで53のパス@5スコアを達成でき、Claude-Sonnet-4(50)のようなフロンティアLSMを超越し、最高の記号的ヒューリスティック(53)に適合する。
Ablations shows that SFT alone improves pass@5 from 46 to 51, with DPO add two more benchmarks; an entropy/agreement ablation on real first-cube decisions further shows that SFT, not DPO, account to the root-level decision diversity that produce complementary per-run coverage over deterministic symbolic methods。
これは、トランスフォーマーが伝統的にシンボリックメソッドが支配するドメインで効果的なキューブ決定を行うように訓練できることを示しています。
関連論文リスト
- ARC-AGI-2 Technical Report [0.0846998909761807]
ARC (Abstraction and Reasoning Corpus) はパターンマッチング以上の一般化を評価するために設計された。
本稿では、ニューラルネットワークと構造認識の事前処理とオンラインタスク適応を組み合わせることにより、ARC性能を向上させるトランスフォーマーベースシステムを提案する。
論文 参考訳(メタデータ) (2026-02-04T10:03:56Z) - Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks [48.105258051884384]
本稿では,モデルの自己補正能力を高めるための2段階トレーニングフレームワークを提案する。
最初の段階では、マルチターン対話戦略がモデルをガイドし、長いチェーン・オブ・シント(CoT)データを生成する。
第2段階では、データの分散を動的に最適化する難易度の高い拒絶サンプリング機構を採用している。
論文 参考訳(メタデータ) (2026-01-09T08:19:11Z) - Data Trajectory Alignment for LLM Domain Adaptation: A Two-Phase Synthesis Framework for Telecommunications Mathematics [6.653834890554154]
汎用大規模言語モデル (LLMs) は、電気通信のような垂直に展開されることが増えている。
本稿では2相モデルに依存しないデータキュレーションフレームワークであるData Trajectory Alignment (DTA)を提案する。
DTAはソリューションプロセス(最終回答だけでなく)を第一級の監督として扱います。
論文 参考訳(メタデータ) (2025-11-10T07:05:08Z) - CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization [5.857877898558651]
CoT(Chain-of-Thought)推論は、大規模言語モデル(LLM)の問題解決能力を高めるが、かなりの推論オーバーヘッドをもたらす。
本稿では、適応的推論要約フレームワークを用いて、異なるスケールとアーキテクチャのモデル間での効率的なCoT転送について検討する。
論文 参考訳(メタデータ) (2025-11-07T22:35:31Z) - Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning [71.30276778807068]
サンプルプルーニングとトークンプルーニングを戦略的に協調する統合フレームワークを提案する。
Q-Tuningは、トレーニングデータの12.5%しか使用せず、全データSFTベースラインに対する平均38%の改善を実現している。
論文 参考訳(メタデータ) (2025-09-28T13:27:38Z) - Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling [35.97270347306353]
グループ相対政策最適化(GRPO)に基づく新しいRLフレームワークである textbfEGPO を提案する。
EGPOの中核はエントロピー強化の利点関数であり、モデルのChain-of-Thought(CoT)のエントロピーをポリシー勾配に統合する。
挑戦的なBFCL(Berkeley Function Calling Leaderboard)では、EGPOでトレーニングされた4Bパラメータモデルが、同等サイズのモデルの間で新たな最先端を設定している。
論文 参考訳(メタデータ) (2025-08-07T07:51:38Z) - Accelerated Test-Time Scaling with Model-Free Speculative Sampling [58.69141724095398]
STAND(Stochastic Adaptive N-gram Drafting)は,新しいモデルフリーな投機的デコード手法である。
従来の自己回帰復号法と比較して,STANDは推論遅延を60~65%削減することを示した。
モデルフリーのアプローチとして、STANDは追加のトレーニングなしで既存の言語モデルに適用できる。
論文 参考訳(メタデータ) (2025-06-05T07:31:18Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data [73.04828796123581]
Supervised Fine-tuning (SFT) は、事前訓練された大規模言語モデル (LLM) を整列するための重要なステップとなっている。
本稿では,SFTの改良版であるDFT(Driminative Fine-Tuning)を紹介する。
i) 入力された全ての可能な出力のうち、解答の判別可能性を明示的にモデル化することにより、微調整LDMの判別確率フレームワーク、(ii) この判別可能性を最適化するための効率的なアルゴリズム、(iii) DFTの有効性を実証する広範な実験を含む。
論文 参考訳(メタデータ) (2025-02-25T22:38:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。