論文の概要: Combining LLMs and Genetic Search for ARC-AGI-2
- arxiv url: http://arxiv.org/abs/2609.27242v1
- Date: Wed, 23 Sep 2026 02:25:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.840238
- Title: Combining LLMs and Genetic Search for ARC-AGI-2
- Title(参考訳): LLMと遺伝子検索を組み合わせたARC-AGI-2
- Abstract要約: 遺伝的アルゴリズムは、さらに多くのプログラムを探索し、テストすることができるが、ランダム検索は、ソリューション空間の有用な近傍で始まることは滅多にない。
両手法をコンパクトなドメイン固有言語(5-4)で結合する。
その結果,遺伝子探索はLSMによって生成されたプログラムを改良し,さらに正しい解が得られることがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs can generate programs for ARC-AGI-2 tasks, but the provided compute only allows a small number of attempts to generate, debug and validate solutions. Genetic algorithms can search and test many more programs, but random search rarely starts in a useful neighborhood of the solution space. We combine the two methods through a compact domain specific language (DSL). First, a quantized Qwen3.5-4B LLM generates an initial set of programs for each ARCAGI-2 task. Then, we use those programs to seed an initial population of starting programs, and use genetic algorithms to evolve these programs towards a solution to the given task. The DSL is designed such that every mutated program remains valid and can be executed. The initial programs proposed by the LLM solve 2 (3.3%) of the first 60 tasks of the ARC-2 public evaluation set. The genetic algorithm solves an additional 4, giving 6 correct test outputs in total (10.0%). If we try using evolving solutions without this LLM seeding, we do not arrive at any solutions at all. The results show that genetic search can improve programs generated by LLMs and produce additional correct solutions.
- Abstract(参考訳): LLMはARC-AGI-2タスクのためのプログラムを生成することができるが、提供される計算は、ソリューションの生成、デバッグ、検証のための少数の試みしかできない。
遺伝的アルゴリズムは、さらに多くのプログラムを探索し、テストすることができるが、ランダム検索は、ソリューション空間の有用な近傍で始まることは滅多にない。
コンパクトなドメイン特化言語(DSL)を通して2つのメソッドを組み合わせる。
まず、量子化されたQwen3.5-4B LLMは、各ARCAGI-2タスクの初期プログラムセットを生成する。
そして、これらのプログラムを使用して、開始プログラムの初期集団をシードし、遺伝的アルゴリズムを使ってこれらのプログラムを与えられたタスクに対する解決策へと進化させます。
DSLは、すべての変更されたプログラムが有効であり、実行できるように設計されています。
LLMが提案した初期プログラムは、ARC-2の公開評価セットの最初の60タスクのうち2つ(3.3%)を解決した。
遺伝的アルゴリズムは、合計で6つの正しいテスト出力(10.0%)を与える追加の4を解く。
LLMシードを使わずに進化するソリューションを試しても、どんなソリューションにも到達できません。
その結果,遺伝子探索はLSMによって生成されたプログラムを改良し,さらに正しい解が得られることがわかった。
関連論文リスト
- MultiGA: Leveraging Multi-Source Seeding in Genetic Algorithms [8.975943388046058]
大規模言語モデル(LLM)は、複雑なタスクに対処するために研究領域で広く使われているが、その性能は目前のタスクによって大きく異なる可能性がある。
複雑な自然言語処理や推論問題に遺伝的アルゴリズムの原則を適用した新しいアプローチであるMultiGAを導入する。
我々は,テキストからコードへの生成タスク,旅行計画,大学院レベルの科学問題に対するGPQAベンチマーク,BBQバイアスベンチマークを用いて,我々のアプローチをベンチマークする。
論文 参考訳(メタデータ) (2025-11-21T21:47:33Z) - ExPairT-LLM: Exact Learning for LLM Code Selection by Pairwise Queries [0.22774471443318753]
本稿では,コード選択のための正確な学習アルゴリズムであるExPairT-LLMを提案する。
LLMオラクルの2つの新しいタイプのクエリ、ペアのメンバシップとペアの等価性に反応してプログラムを選択する。
これらのクエリは LLM にとって単純であり、ExPairT-LLM がトーナメントを通じて正しいプログラムを識別できるようにする。
論文 参考訳(メタデータ) (2025-11-13T23:39:18Z) - Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems [62.76627483915117]
大規模言語モデル(LLM)は、最近、数学と推論ベンチマークで印象的なパフォーマンスを達成した。
直感的なパズルにインスパイアされた11のユニークな検索問題を含む新しいベンチマークであるSearchBenchを紹介した。
ステップバイステップで言語のみの推論を用いることで、最も先進的なLLMでさえ、SearchBenchの解決に失敗することを示します。
論文 参考訳(メタデータ) (2024-06-18T00:44:58Z) - CMSA algorithm for solving the prioritized pairwise test data generation
problem in software product lines [1.1970409518725493]
ソフトウェア製品ライン(SPL)では、多数の有効な機能の組み合わせが存在するため、家族のすべての製品をテストするのは難しい、あるいは不可能かもしれない。
本研究では,Construct, Merge, Solve & Adapt というハイブリッド・メピエリスト的アプローチに基づく新しいアプローチを提案する。
論文 参考訳(メタデータ) (2024-02-07T05:43:57Z) - ALGO: Synthesizing Algorithmic Programs with LLM-Generated Oracle
Verifiers [60.6418431624873]
大きな言語モデル(LLM)は、機能記述からコードを実装するのに優れているが、アルゴリズムの問題に悩まされている。
我々は,アルゴリズムプログラムを LLM 生成 Oracle で合成するフレームワーク ALGO を提案し,その生成をガイドし,その正確性を検証する。
実験の結果,ALGOを装着すると,Codexモデルよりも8倍,CodeTよりも2.6倍の1サブミッションパス率が得られることがわかった。
論文 参考訳(メタデータ) (2023-05-24T00:10:15Z) - Learning to Plan with Natural Language [111.76828049344839]
大規模言語モデル(LLM)は、様々な基本自然言語タスクにおいて顕著な性能を示している。
複雑なタスクを完了するためには、ステップごとに特定のソリューションを生成するためにLCMをガイドするタスクの計画が必要です。
本研究では,(1)第1学習課題計画フェーズにおいて,LCMが学習エラーフィードバックから導出するように促した新たなステップバイステップのソリューションと行動指示を用いてタスク計画を反復的に更新する,という2つの段階を含む学習計画手法を提案する。
論文 参考訳(メタデータ) (2023-04-20T17:09:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。