論文の概要: Trained Agentic Context Management
- arxiv url: http://arxiv.org/abs/2610.02404v1
- Date: Thu, 01 Oct 2026 19:32:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.06915
- Title: Trained Agentic Context Management
- Title(参考訳): 訓練されたエージェントコンテキスト管理
- Abstract要約: 最も単純なハーネスよりもモデルをトレーニングします。特定のプロンプトで自分自身を呼び出すツールと、入力コンテキストからの範囲でトークンを読むツールです。
我々はこのハーネスを用いて、多様な合成データセット上でQwen3.6-35B-A3Bを微調整する。
- 参考スコア(独自算出の注目度): 0.17188280334580194
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study long context language models. Instead of training long context natively, or designing a long context harness, we train a model over the simplest possible harness: a tool to call itself with any specified prompt and a tool to read tokens in a range from the input context. We finetune Qwen3.6-35B-A3B on a diverse synthetic dataset using this harness. With only 8,000 tokens of context, our small model is as strong as GPT-5.4 with 1M tokens of context on the OOLONG-synth benchmark when document length exceeds 40K tokens.
- Abstract(参考訳): 長い文脈言語モデルについて研究する。
長いコンテキストをネイティブにトレーニングしたり、長いコンテキストハーネスを設計する代わりに、最も単純なハーネスよりもモデルをトレーニングします。
我々はこのハーネスを用いて、多様な合成データセット上でQwen3.6-35B-A3Bを微調整する。
8,000個のコンテキストのトークンしか持たず、文書長が40Kを超えると、OOLONG-synthベンチマークで1M個のコンテキストのトークンを持つGPT-5.4と同等に強い。
関連論文リスト
- Too Long, Didn't Model: Decomposing LLM Long-Context Understanding With Novels [3.537369004801589]
Too Long, Didn't Modelベンチマークをリリースしました。
プロットサマリー、ストーリーワールド構成、経過したストーリータイムを報告するモデルの能力をテストする。
テストされた7つのフロンティアLSMのうち、64kトークン以上の安定な理解は得られていない。
論文 参考訳(メタデータ) (2025-05-20T21:21:09Z) - NoLiMa: Long-Context Evaluation Beyond Literal Matching [100.00398424275501]
NoLiMaは、NIAHテストを拡張したベンチマークである。
干し草の山の中に針を見つけるためには、潜伏関係を推測するモデルが必要である。
我々は、少なくとも128Kトークンのコンテキストをサポートすると主張する13の人気のある大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-02-07T18:49:46Z) - Bootstrap Your Own Context Length [74.61148597039248]
長文言語モデルを学習するためのブートストラップ手法を提案する。
提案したデータ合成ワークフローは、短いコンテキスト言語モデル、テキスト検索、文書収集のみを必要とする。
我々は,オープンソースのLlama-3ファミリを用いて実験を行い,最大100万トークンまでコンテキスト長を拡張できることを実証した。
論文 参考訳(メタデータ) (2024-12-25T10:08:54Z) - Data Engineering for Scaling Language Models to 128K Context [98.41554785106902]
本研究では,言語モデルの文脈長を128Kまで拡張するための継続事前学習法について検討する。
既存の作業の一般的な実践である書籍のような特定のドメインで、より長いデータを鼻でサンプリングすることで、パフォーマンスが最適以下であることが分かりました。
我々のレシピは強力なオープンソース長文モデルより優れており、GPT-4 128Kのようなフロンティアモデルとのギャップを埋めている。
論文 参考訳(メタデータ) (2024-02-15T18:19:16Z) - Training With "Paraphrasing the Original Text" Improves Long-Context Performance [19.48556587305737]
大きな言語モデル(LLM)は進化を続けており、長いコンテキスト入力を扱うように設計されている。
本研究では,LLMの学習能力を高めることを目的とした長文タスクのための学習データ設計手法を提案する。
LlamaおよびQwenのモデルを用いたLongBenchおよびNaturalQuestions Multi-document-QAデータセットの実験により,平均スコアが最大8.48%,4.48%向上した。
論文 参考訳(メタデータ) (2023-12-18T13:40:16Z) - FewshotQA: A simple framework for few-shot learning of question
answering tasks using pre-trained text-to-text models [0.0]
現在の最先端の事前訓練モデルでは、良い結果を得るためには、何万ものサンプルを微調整する必要がある。
本稿では,事前学習したテキスト・テキスト・モデルを利用した簡易な微調整フレームワークを提案する。
我々のモデルでは、XLM-Roberta-largeを最大40F1ポイント、平均33F1ポイントで上回ります。
論文 参考訳(メタデータ) (2021-09-04T23:08:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。