論文の概要: Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning
- arxiv url: http://arxiv.org/abs/2609.00759v1
- Date: Tue, 01 Sep 2026 05:42:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.405258
- Title: Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning
- Title(参考訳): コンパイル, 覚えるな - 文脈内学習のためのコンテキストコンパイルアーキテクチャ(CCA)
- Authors: Jinhu Qi, Minda Hu, Wentao Zhang, Weiqiang Jin, Yanyu Chen, Junli Wang, Irwin King,
- Abstract要約: 大規模言語モデル(LLM)は、コンテキスト内学習タスクをますます扱う。
文脈のあらゆる詳細に比較して評価されるベンチマークでは、強力なオープンウェイトモデルでさえ、タスクの12-16%しかパスしていない。
本稿では,固定スロットを持つ型付き中間表現(IR)を中心とするコンテキストコンパイルアーキテクチャ(CCA)を提案する。
- 参考スコア(独自算出の注目度): 43.93798132732854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) increasingly handle in-context learning (ICL) tasks where a long, novel context defines the rules, knowledge, and output schema for a series of questions. On benchmarks that grade against every detail of the context, even strong open-weights models pass only 12-16% of tasks: a single overlooked rule fails the whole response. We argue this brittleness is structural: the dominant "read-and-reason" paradigm asks the model to extract, plan, generate, and self-verify in one forward pass. We therefore ask whether explicit context compilation can fix it, how it compares to existing long-context strategies (gist retrieval, multi-agent self-play), and where the resulting harness benefit holds across task structure and model scale. We propose the Context Compilation Architecture (CCA), whose central novelty is a typed intermediate representation (IR) with fixed slots (rules.{must_do, must_not, conditional}, output_spec, available_tools, data_profile) into which any prose context is compiled once; executable verifiers and a violation-gated correction loop follow as downstream consequences. On CL-bench (1,899 tasks across 4 open base models), CCA outperforms vanilla prompting and two long-context baselines (ReadAgent-P, Ctx2Skill) on every base model, lifting Kimi K2.5 from 15.4% to 21.4% with gains concentrated on rule-dense sub-categories. Code and cached completions are available at https://github.com/TonyQJH/cca-emnlp2026.
- Abstract(参考訳): 大規模言語モデル(LLM)は、長い新しいコンテキストが一連の質問に対するルール、知識、出力スキーマを定義するような、コンテキスト内学習(ICL)タスクをますます扱う。
文脈のあらゆる詳細に比較して評価されるベンチマークでは、強力なオープンウェイトモデルでさえたったの12-16%のタスクをパスしている。
支配的な"read-and-reason"パラダイムは、モデルを1つの前方パスで抽出し、計画し、生成し、自己検証するように求めます。
したがって、明示的なコンテキストコンパイルがそれを修正できるかどうか、それが既存の長期コンテキスト戦略とどのように比べられるか(ギスト検索、マルチエージェント・セルフプレイ)、タスク構造やモデルスケールにまたがるハーネスの利点がどこにあるのかを問う。
本稿では、任意の散文コンテキストが一度にコンパイルされるような固定スロット(rules.{must_do, must_not, conditional}, output_spec, available_tools, data_known)を持つ型中間表現(IR)を中心とするコンテキストコンパイルアーキテクチャ(CCA)を提案する。
CLベンチ(4つのオープンベースモデルで1,899のタスク)では、CAAはバニラプロンプトと2つの長文ベースライン(ReadAgent-P, Ctx2Skill)をベースモデルで上回り、K2.5を15.4%から21.4%に引き上げた。
コードとキャッシュの完了はhttps://github.com/TonyQJH/cca-emnlp2026で確認できる。
関連論文リスト
- Context-Aware RL for Agentic and Multimodal LLMs [45.19288531697759]
コンテキスト認識型強化学習手法であるContextRLを提案する。
クエリー・アンサー・ペアをサポートするコンテキストを選択するモデルに報酬を与える。
5つのロングホライゾンベンチマークで標準GRPOの+2.2%、12種類の視覚的質問応答ベンチマークで+1.8%の平均ゲインを達成している。
論文 参考訳(メタデータ) (2026-06-15T17:59:28Z) - Agentic Framework for Deep Learning workload migration via In-Context Learning [0.5496900364175868]
大規模言語モデル(LLM)は、正確な操作のミスをしがちである。
In-Context Learning(ICL)とオラクル駆動の自己老化を組み合わせた完全自律システムを提案する。
我々のパイプラインは、ニューラルネットワークモジュール上で91%の数値等価性(ベースライン:9%、命令+自己老化:27%)を達成する。
論文 参考訳(メタデータ) (2026-06-14T19:41:57Z) - Scaling Multi-Hop Training Data via Graph-Constrained Path Selection [40.133031562641044]
推論パスは文脈キーワードであるCentroidのグラフ上でオフラインに列挙され、教師は事前に検証されたパスにのみ呼び出される。
等訓練スケールでは、制約された鎖と制約のない鎖は区別不能な下流のパフォーマンスをもたらし、フルスケールでの利得は使用可能なコーパスの4.4$times$拡張から得られる。
Qwen3-32B CUAD法定契約コーパスから構築された80K のファインチューニングの Qwen3-32B は、クローズドブックの Token F1 を 21.66% から 38.58% に改善した。
論文 参考訳(メタデータ) (2026-05-29T12:39:03Z) - Core Context Aware Transformers for Long Context Language Modeling [50.774702091154204]
高速な長文モデリングのためのCCAアテンションを提案する。
本手法は,学習過程における冗長性を低下させながら,コアコンテキストに自動的に焦点を合わせ,強化する。
提案手法は,既存の大規模言語モデルにおける自己注意モジュールを最小限の微調整コストで置き換えることができる。
論文 参考訳(メタデータ) (2024-12-17T01:54:08Z) - ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities [53.97515452727115]
ChatQA 2は、128Kコンテキストウィンドウを備えたLlama 3.0ベースのモデルである。
Llama3-70Bベースのコンテキストウィンドウを8Kから128Kまで拡張するためのトレーニングレシピを提案する。
RAGを用いた長文LLMの性能は,多数のチャンクを検索した場合に向上することがわかった。
論文 参考訳(メタデータ) (2024-07-19T17:35:47Z) - Dual Process Learning: Controlling Use of In-Context vs. In-Weights Strategies with Weight Forgetting [15.69952375347308]
言語モデルは、文脈内学習(ICL)を実行する能力を持つ
言語モデルは、コンテキスト内で学習する能力があるにもかかわらず、目に見えないか、めったに見られないトークンに直面したときに苦労することが知られている。
本研究では,玩具モデル,マスク言語モデル,自己回帰言語モデルを用いて,合成タスクと自然主義タスクの両方に関する構造的インコンテキストアルゴリズムについて検討する。
論文 参考訳(メタデータ) (2024-05-28T21:38:20Z) - KILT: a Benchmark for Knowledge Intensive Language Tasks [102.33046195554886]
知識集約型言語タスク(KILT)のベンチマークを示す。
KILTのすべてのタスクはウィキペディアのスナップショットと同じだ。
共有密度ベクトル指数とSeq2seqモデルとの結合が強いベースラインであることが分かる。
論文 参考訳(メタデータ) (2020-09-04T15:32:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。