論文の概要: Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench
- arxiv url: http://arxiv.org/abs/2607.08284v1
- Date: Thu, 09 Jul 2026 09:28:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.490462
- Title: Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench
- Title(参考訳): PredicateLongBenchによる長期タスクの難易度理解
- Authors: Siddhartha Jain, Ameya Velingker,
- Abstract要約: 大規模言語モデル評価のためのベンチマークとしてPredicateLongBenchを提案する。
それは、与えられた述語/制約を満たす長い入力において、最も長い連続した単語列を特定するようモデルに求める。
私たちは、フロンティアモデルが、軸に沿ったタスクの難しさをスケールアップする上で、パフォーマンスに苦労していることに気付きました。
- 参考スコア(独自算出の注目度): 6.490490294075993
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have demonstrated rapidly improving long-context capabilities, prompting a wave of benchmarks designed to evaluate them. However, existing long-context evaluations - from Needle-in-a-Haystack (NIAH) tests to more recent multi-hop reasoning and summarization tasks - predominantly measure average-case performance, and many are either saturated or lack robustness. Notably absent is a systematic way to probe how models perform as we scale up the difficulty of tasks along various axes. We address this gap by proposing PredicateLongBench, a benchmark that stress-tests long-context reasoning by asking models to identify the longest contiguous subsequence of words in a long input that satisfies given predicates/constraints (e.g., lexicographic ordering), drawn from a broader predicate class. The central innovation of our benchmark is the identification and systematic exploration of multiple different axes of difficulty which test multiple aspects of long context understanding. We provide two complementary generation pipelines - a fully synthetic setup using random word-like strings, and a real-world setup that samples words from natural documents while preserving their distributional properties. We find that frontier models struggle to perform well as we scale up the difficulty of tasks along our axes, demonstrating the utility of our benchmark in understanding the limitations of current long-context capabilities. Furthermore, the tasks in PredicateLongBench, though challenging, are conceptually simple and do not require LLM-based generations or judges.
- Abstract(参考訳): 大規模言語モデル(LLM)は、長期コンテキスト能力を急速に向上させ、それらを評価するために設計されたベンチマークの波を誘発している。
しかしながら、NIAH(Needle-in-a-Haystack)テストから、より最近のマルチホップ推論や要約タスクに至るまで、既存の長期コンテキスト評価は、主に平均ケースのパフォーマンスを計測する。
特に欠落は、さまざまな軸に沿ったタスクの難しさをスケールアップする上で、モデルがどのように機能するかを調査する体系的な方法である。
このギャップに対処するベンチマークであるPredicateLongBenchは、より広い述語クラスから引き出された述語/制約(例えば、語彙順順)を満足する長い入力において、単語の長い連続部分列を特定するようモデルに求めることで、長文推論をストレステストする。
我々のベンチマークの中心的な革新は、長い文脈理解の複数の側面をテストする複数の異なる困難軸の同定と体系的な探索である。
2つの補完的な生成パイプライン – ランダムな単語のような文字列を用いた完全に合成されたセットアップ – と,その分散特性を保ちながら,自然文書から単語をサンプリングする実世界のセットアップ – を提供する。
私たちは、フロンティアモデルが、現在の長期コンテキスト能力の限界を理解する上でのベンチマークの有用性を実証し、軸に沿ったタスクの難しさをスケールアップする上で、パフォーマンスの面で苦労していることに気付きました。
さらに、PredicateLongBenchのタスクは難しいが概念的にはシンプルであり、LLMベースの世代や判断を必要としない。
関連論文リスト
- Context-Length Robustness in Question Answering Models: A Comparative Empirical Study [0.0]
本稿では,SQuADとHotpotQAの2つのベンチマークを用いて,大規模言語モデルにおける文脈長頑健性の実証的研究を行った。
モデル精度を全文脈長の関数として評価し,応答を含む信号を保持しながら,無関係な文脈の量を体系的に増加させることで評価する。
その結果、コンテキスト長が増加するにつれて性能が一貫した低下を示し、マルチホップ推論タスクではシングルスパン抽出タスクよりもはるかに大きな低下が観測された。
論文 参考訳(メタデータ) (2026-03-16T17:14:05Z) - LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark [24.104346815675886]
LongBench Proは、英語と中国語で自然に発生する1500の長文サンプルのより現実的なベンチマークである。
タスク固有のメトリクスによるきめ細かい分析と、コンテキスト要求の多次元分類をサポートする。
LongBench Proは、長いコンテキスト理解を進めるための堅牢なテストベッドを提供する。
論文 参考訳(メタデータ) (2026-01-06T10:01:59Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - 100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability? [28.694112253150983]
リアルタイムベースの長期コンテキスト評価ベンチマークには2つの大きな欠点がある。
LongBenchのようなベンチマークは、しばしばモデルのベースライン能力とロングコンテキストのパフォーマンスを分離するための適切なメトリクスを提供しない。
長さ制御可能な長文ベンチマークと,ベースライン知識を真の長文能力から切り離す新しいメトリクスを導入する。
論文 参考訳(メタデータ) (2025-05-25T19:58:31Z) - LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams [4.917265821383127]
実世界のシナリオの冗長性に富む会話の性質を反映した,ライブストリームから派生した最初の音声長文データセットを構築した。
我々は、これらのタスクにおける長文理解能力を評価するために、人気のあるLLMと特殊手法の両方を評価した。
本研究は,現在の手法の限界を浮き彫りにし,長文理解の改善に向けた今後の方向性を示唆するものである。
論文 参考訳(メタデータ) (2025-04-24T08:27:48Z) - GATEAU: Selecting Influential Samples for Long Context Alignment [59.579128690086385]
GATEAUは、長距離依存関係に富む影響力のあるサンプルを同定する。
選択されたサンプルに基づいて訓練されたモデルは、より良い指示追従と長文理解能力を示す。
論文 参考訳(メタデータ) (2024-10-21T04:30:53Z) - Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA [71.04146366608904]
長いコンテキストモデリング能力は広く注目を集めており、超コンテキストウィンドウを持つLarge Language Models (LLMs) の出現につながっている。
拡張多文書質問応答(QA)によって現実的なシナリオに整合する新しい長文ベンチマークであるLoongを提案する。
Loong氏は、Spotlight Locating, Comparison, Clustering, Chain of Reasoningという、コンテキスト長の4つのタスクを紹介している。
論文 参考訳(メタデータ) (2024-06-25T09:42:56Z) - Effective Long-Context Scaling of Foundation Models [90.57254298730923]
最大32,768個のトークンの効率的なコンテキストウィンドウをサポートする長文LLMを提示する。
我々のモデルは、ほとんどの通常のタスクにおいて一貫した改善を達成し、Llama 2よりも長いコンテキストタスクを大幅に改善します。
論文 参考訳(メタデータ) (2023-09-27T21:41:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。