論文の概要: DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models
- arxiv url: http://arxiv.org/abs/2606.26530v2
- Date: Fri, 26 Jun 2026 03:52:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 13:57:07.332032
- Title: DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models
- Title(参考訳): DiARC: 大規模言語モデルのARCライクな推論能力向上を支援する肯定的および否定的なサンプルの排除
- Abstract要約: ARCタスクは、限られたグリッドサンプルからパターンを要約し、出力グリッドを予測する必要がある。
そこで我々は,モデルの識別を可能にするために,選好ペアを構成する方法であるDiARCを提案する。
複数のARCライクなベンチマークでの実験結果から、DiARCはベースラインモデルよりも一貫して性能を改善している。
- 参考スコア(独自算出の注目度): 6.391025049342538
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Abstraction and Reasoning Corpus (ARC) contains tasks that require summarizing patterns from limited grid samples and predicting output grids. Recently, many large language model based approaches have attempted to transform it into a text-based reasoning task. However, methods based on open-source models have generally yielded unsatisfactory results, while those relying on closed-source models are too costly. Current efforts mainly focus on data augmentation, constructing ARC-like data for more comprehensive supervised fine-tuning. In this work, we argue that solving ARC-like problems requires not only positive sample supervision but also the ability to improve model reasoning by distinguishing negative samples. To this end, we draw on the idea of preference alignment and propose DiARC, a method that constructs preference pairs to enable the model to distinguish between them. Specifically, we propose three ways to construct negative samples, including output-level visual transformations, DSL-level rule inversion, and task-specific rule editing. The resulting negative samples provide informative near-miss alternatives while keeping the observed demonstrations unchanged. Experimental results across multiple ARC-like benchmarks show that DiARC consistently improves performance over baseline models. The code is released at https://github.com/szu-tera/DiARC.
- Abstract(参考訳): ARC(Abstraction and Reasoning Corpus)には、限られたグリッドサンプルからのパターンの要約と出力グリッドの予測を必要とするタスクが含まれている。
近年,多くの大規模言語モデルに基づくアプローチがテキストベースの推論タスクに転換しようと試みている。
しかし、オープンソースモデルに基づく手法は一般的に不満足な結果をもたらすが、クローズドソースモデルに依存する手法はコストがかかりすぎる。
現在の取り組みは、主にデータ拡張、より包括的な教師付き微調整のためのARCライクなデータの構築に焦点を当てている。
本研究では, ARCライクな問題を解くためには, 正のサンプル監視だけでなく, 負のサンプルを識別してモデル推論を改善する能力も必要である,と論じる。
この目的のために、我々は好みのアライメントの考え方を描き、モデルの区別を可能にするために、好みのペアを構築する方法であるDiARCを提案する。
具体的には、出力レベルの視覚変換、DSLレベルのルール反転、タスク固有のルール編集を含む、負のサンプルを構築する3つの方法を提案する。
結果として得られた負のサンプルは、観測されたデモンストレーションをそのままに保ちながら、情報的に近い代替手段を提供する。
複数のARCライクなベンチマークでの実験結果から、DiARCはベースラインモデルよりも一貫して性能を改善している。
コードはhttps://github.com/szu-tera/DiARC.comで公開されている。
関連論文リスト
- Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute [0.0]
我々はARC-AGI-1のARC Prize TRMチェックポイントを実験的に分析した。
テストタイムの増大と多数投票の合理化が報告された性能のかなりの部分を占めていることを示す。
また, TRMとLlama 3 8BのQLoRAファインチューンを標準ARC-AGI-1上で比較した。
論文 参考訳(メタデータ) (2025-12-04T06:20:44Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction [2.970904425631548]
ZEBRAは、モデル行動知識を活用することにより、嗜好データを構成するモデルビヘイビアワイドゼロアノテーションフレームワークである。
ZEBRAは、元のモデルの品質と類似性を評価し、完全にインスタンスレベルのアノテーションをバイパスすることで、レスポンスペアをバイナライズする。
論文 参考訳(メタデータ) (2025-02-26T01:36:40Z) - COrAL: Order-Agnostic Language Modeling for Efficient Iterative Refinement [80.18490952057125]
反復改良は、複雑なタスクにおける大規模言語モデル(LLM)の能力を高める効果的なパラダイムとして登場した。
我々はこれらの課題を克服するために、コンテキストワイズ順序非依存言語モデリング(COrAL)を提案する。
当社のアプローチでは、管理可能なコンテキストウィンドウ内で複数のトークン依存関係をモデル化しています。
論文 参考訳(メタデータ) (2024-10-12T23:56:19Z) - Intelligence Analysis of Language Models [0.0]
本研究では,Large Language Models (LLMs) の Abstraction and Reasoning Corpus (ARC) データセットに対する有効性を検証する。
このデータセットは、抽象推論能力をテストするための代表的なベンチマークとして機能する。
モデル性能向上におけるChain-of-Thought(CoT)手法の適用性を検討した。
論文 参考訳(メタデータ) (2024-07-20T13:48:16Z) - Fine-Tuning on Diverse Reasoning Chains Drives Within-Inference CoT Refinement in LLMs [63.36637269634553]
本稿では,LLMを微調整し,一つの推論ステップで思考の逆連鎖(DCoT)を生成する手法を提案する。
DCoTの微調整により,モデルファミリおよびスケール間のCoTベースライン上での性能が向上することを示す。
我々の研究は、定量的解析と手動評価の両方で、観測された利益は、最初の推論連鎖を洗練させるモデルの能力に由来することを明らかにしているため、重要である。
論文 参考訳(メタデータ) (2024-07-03T15:01:18Z) - Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models [0.8399688944263842]
大きな言語モデル(LLM)は、入力クエリから人間のようなテキストを理解し、生成する能力を持つ。
本研究では、この概念を、レトリーバル拡張生成(RAG)パイプライン内のLLMの統合に拡張する。
データ抽出と文脈理解における微調整がLLMの能力に与える影響を評価する。
論文 参考訳(メタデータ) (2024-06-17T04:35:17Z) - Decoupled DETR For Few-shot Object Detection [4.520231308678286]
サンプル不均衡と弱い特徴伝搬の深刻な問題に対処するためにFSODモデルを改善した。
出力機能としてデコーダ層を動的に融合できる統一デコーダモジュールを構築しました。
提案するモジュールは,微調整とメタラーニングの両方のパラダイムにおいて,5%から10%の安定的な改善を達成できる可能性が示唆された。
論文 参考訳(メタデータ) (2023-11-20T07:10:39Z) - ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models [24.867534196627222]
ArcheTypeは、コンテキストサンプリング、即時シリアライゼーション、モデルクエリ、ラベルリマッピングのための、シンプルで実用的な方法である。
ゼロショットCTAベンチマークに最先端の性能を新たに確立する。
論文 参考訳(メタデータ) (2023-10-27T15:31:22Z) - LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and
the Importance of Object-based Representations [50.431003245201644]
GPT-4 は 1D-ARC や単純な ARC サブセットのような非言語領域で完全に「推論」できないことを示す。
本稿では,外部ツールから得られるオブジェクトベース表現を提案する。これにより,解決されたARCタスクのパフォーマンスがほぼ倍増し,より簡単な1D-ARC上でのほぼ完璧なスコアが得られた。
論文 参考訳(メタデータ) (2023-05-26T16:32:17Z) - RetICL: Sequential Retrieval of In-Context Examples with Reinforcement Learning [53.52699766206808]
In-Context Learning (RetICL) のための検索式を提案する。
RetICLは数学用語の問題解決と科学的質問応答のタスクに基づいて評価し,一貫した性能や一致,学習可能なベースラインを示す。
論文 参考訳(メタデータ) (2023-05-23T20:15:56Z) - DORE: Document Ordered Relation Extraction based on Generative Framework [56.537386636819626]
本稿では,既存のDocREモデルの根本原因について検討する。
本稿では,モデルが学習しやすく,決定論的な関係行列から記号列と順序列を生成することを提案する。
4つのデータセットに対する実験結果から,提案手法は生成型DocREモデルの性能を向上させることができることが示された。
論文 参考訳(メタデータ) (2022-10-28T11:18:10Z) - Improving Contrastive Learning with Model Augmentation [123.05700988581806]
このシーケンシャルレコメンデーションは,ユーザ行動における次の項目を予測することを目的としている。
シーケンスにおけるデータの分散性やノイズの問題から,新たな自己教師付き学習(SSL)パラダイムが提案され,性能が向上した。
論文 参考訳(メタデータ) (2022-03-25T06:12:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。