論文の概要: The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning
- arxiv url: http://arxiv.org/abs/2608.26602v1
- Date: Thu, 27 Aug 2026 04:33:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.242905
- Title: The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning
- Title(参考訳): 千グラフ仮説:レポジトリレベルコード推論におけるタスク記述型関係物質化の検証可能な仮説
- Authors: Fei Ding,
- Abstract要約: モデルに対するリポジトリの知識のトレーニングは費用がかかり、すぐに停滞するが、ローカル検索は散在する要求を見逃す可能性がある。
推論中にタスク条件付き関係を実体化するエンティティのみの外部インタフェースを提案する。
- 参考スコア(独自算出の注目度): 2.7787094635105185
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large software repositories are often beyond model context limits. Training repository knowledge into models is costly and quickly stale, while local retrieval can miss scattered requirements, and explicit relation graphs add ongoing maintenance burden. We propose an entity-only external interface with task-conditioned relation materialization during inference. A two-layer index separates global routing from local entity focus and is evaluated on DeepSeek-V4-Flash and SWE-bench Verified. The base, one-layer, and two-layer conditions achieve 92.1%, 94.2%, and 95.6% success, respectively, under zero pre-built entity-relation edges.
- Abstract(参考訳): 大規模なソフトウェアリポジトリは、しばしばモデルコンテキストの限界を超えます。
モデルに対するリポジトリの知識のトレーニングは費用がかかり、すぐに停滞するが、ローカル検索は散在する要求を見逃しかねず、明示的な関係グラフは継続的なメンテナンスの負担を増す。
推論中にタスク条件付き関係を実体化するエンティティのみの外部インタフェースを提案する。
2層インデックスは、グローバルルーティングをローカルエンティティフォーカスから分離し、DeepSeek-V4-FlashとSWE-bench Verifiedで評価する。
基数、単層条件、二層条件はそれぞれ92.1%、94.2%、95.6%が成功し、既製の実体相関エッジはゼロである。
関連論文リスト
- DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection [16.007199928732614]
DREAはリポジトリレベルの脆弱性検出のための仮説駆動型フレームワークである。
ゴール指向コンテキスト取得は、この設計における検出改善の主な原因である。
RepoPairBenchは,実世界のプロジェクトから検証済みのPython脆弱性修正ペアの,リポジトリを基盤としたベンチマークである。
論文 参考訳(メタデータ) (2026-07-15T04:49:05Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models [13.478990954968316]
Retrieval-Augmented Generationモデルは、検索されたコンテキストではなく、パラメトリックメモリにグラウンドされた回答を生成する。
本稿では,99,094サンプルの大規模データセットであるFithfulness-QAについて紹介する。
論文 参考訳(メタデータ) (2026-04-28T07:21:46Z) - CCTU: A Benchmark for Tool Use under Complex Constraints [66.87622847854337]
複雑な制約下での大規模言語モデル(LLM)を評価するためのベンチマークであるCCTUを紹介する。
ベンチマークは、さまざまなツール使用シナリオに対して、慎重にキュレートされ、挑戦的なテストケースが200から成っている。
ステップレベルの検証を行い、コンプライアンスを強制する実行可能な制約検証モジュールを開発する。
論文 参考訳(メタデータ) (2026-03-16T14:05:13Z) - Beyond Memorization: Reasoning-Driven Synthesis as a Mitigation Strategy Against Benchmark Contamination [77.69093448529455]
本稿では,arXiv論文から直接研究レベルのQAを合成するために,無限にスケーラブルなフレームワークを用いて実証的研究を行う。
各種サイズ,開発者,リリース日といったモデルについて,知識カットオフ日に近い性能劣化の欠如を評価した。
合成パイプラインで要求される多段階の推論は、浅い記憶よりも深い複雑さをもたらしたと仮定する。
論文 参考訳(メタデータ) (2025-08-26T16:41:37Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - A Frustratingly Easy Approach for Entity and Relation Extraction [25.797992240847833]
本稿では,エンティティと関係抽出のための簡単なパイプライン化手法を提案する。
標準ベンチマーク(ACE04、ACE05、SciERC)における新しい最先端技術を確立する。
このアプローチは基本的に2つの独立したエンコーダ上に構築され、単にエンティティモデルを使用して関係モデルの入力を構築します。
論文 参考訳(メタデータ) (2020-10-24T07:14:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。