論文の概要: TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference
- arxiv url: http://arxiv.org/abs/2608.01975v1
- Date: Mon, 03 Aug 2026 09:39:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.47289
- Title: TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference
- Title(参考訳): TELLER: LLM推論のための非侵入型クロスレイヤ根管解析
- Abstract要約: 本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
- 参考スコア(独自算出の注目度): 47.62941623025392
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language model (LLM) inference has evolved from an offline workload into a continuously operated software service, yet root-cause analysis remains difficult because a single request spans the inference engine, Python/C++ backend, host CUDA APIs, GPU kernels, and distributed communication. Existing profilers expose raw timelines, while log-based diagnosis often misses cross-layer execution semantics and request-level structure. We present TELLER, a non-intrusive Trace- and Log-aware LLM inference Root-cause analysis framework. TELLER first collects NVTX/CUPTI traces and service logs without modifying model binaries, then reconstructs per-request call-chain trees and aligns log lines with the corresponding execution steps. We introduce a dependency-aware causal-context slice that preserves parent-child structure, temporal order, and communication relations, and a Trace Pair Encoding (TPE) tokenizer that compresses such slices into compact structural token sequences with parent, depth, and duration attributes. On top of these representations, TELLER combines numeric candidate localization with a multimodal root-cause model that jointly predicts abnormal steps, localizes suspicious operators, and generates natural-language explanations. Experiments on multi-node GPU inference workloads show a clear compression-accuracy trade-off: a moderate TPE vocabulary reduces per-step trace length by more than 80% while achieving the best overall performance on both horizontal (cross-node communication) and vertical (within-node execution stack) views, whereas more aggressive compression substantially degrades diagnosis quality. Further analyses under low-fault priors, strengthened baselines, modality ablations, explanation-quality checks, and tracing overhead show that TELLER provides a practical triage and evidence-localization substrate for LLM inference RCA.
- Abstract(参考訳): 大規模言語モデル(LLM)推論は、オフラインのワークロードから継続的に動作するソフトウェアサービスへと進化してきたが、単一の要求が推論エンジン、Python/C++バックエンド、CUDA APIのホスト、GPUカーネル、分散通信にまたがるため、根本原因の分析は難しいままである。
既存のプロファイラは生のタイムラインを公開するが、ログベースの診断は層間実行セマンティクスや要求レベルの構造を見逃すことが多い。
本稿では,非侵入的トレース・ログ対応LPM推論手法であるTELLERについて述べる。
TELLERはまず、モデルバイナリを変更することなくNVTX/CUPTIトレースとサービスログを収集し、その後、リクエスト毎のコールチェーンツリーを再構築し、ログ行を対応する実行ステップにアライメントする。
本稿では,親子構造,時間的順序,通信関係を保存する依存型因果関係スライスと,そのスライスを親,深さ,持続時間属性でコンパクトな構造トークンシーケンスに圧縮するトレースペアエンコード(TPE)トークンライザを紹介する。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションと、異常なステップを共同で予測し、不審な演算子をローカライズし、自然言語による説明を生成するマルチモーダル根起点モデルを組み合わせる。
適度なTPE語彙は、ステップ毎のトレース長を80%以上削減し、水平(クロスノード通信)と垂直(ノード内実行スタック)の両方のビューで最高のパフォーマンスを達成する一方で、より積極的な圧縮は診断品質を著しく低下させる。
LLM推論のための実用的トリアージおよびエビデンス・ローカライゼーション・基板を提供することを示すために,低周波前処理,強化ベースライン,モダリティ改善,説明品質チェック,トレーシングオーバヘッドのさらなる解析を行った。
関連論文リスト
- When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models [92.71325249013535]
テスト時間スケーリング(TTS)は、推論時間計算を固定モデルに割り当てることで推論を改善する重要な方向として登場した。
この調査は、木探索に基づく推論の最近の進歩を体系化し、推論をデコードではなく、インスタンス固有の最適化と見なす。
論文 参考訳(メタデータ) (2026-08-31T07:49:56Z) - RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing [65.59464371673623]
Local Branch Routing (LBR)はトークンレベルのテストタイムスケーリングフレームワークである。
小さなローカルなルックアヘッドツリーを拡張し、言語モデルを通じてすべてのサンプルブランチを転送し、軽量ルータを使用してコミットするdeep-1サブツリーを選択する。
LBRにより、各トークン決定は、完全なソリューションレベルの検索を避けながら、ルート次トーケン分布を超えるエビデンスを使用することができる。
論文 参考訳(メタデータ) (2026-06-24T03:42:44Z) - Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams [1.0971997884861282]
LLMエージェントは、呼び出しが有向依存グラフを形成するトラジェクトリを生成する。
以前の構造プローブは、エージェントのランタイムコールグラフではなく、静的コードやチェーン・オブ・シンクテキストをターゲットにしていた。
Qwen3-32Bの残ストリーム上の低容量エッジプローブは、ツールコール依存性グラフをデコードする。
論文 参考訳(メタデータ) (2026-05-25T00:16:32Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - FeedbackLLM: Metadata driven Multi-Agentic Language Agnostic Test Case Generator with Evolving prompt and Coverage Feedback [0.0]
テストケース生成に対する従来のアプローチは、しばしば手作業と計算オーバーヘッドの増大を伴う。
We propose FeedbackLLM, a novel language-agnostic test case generation framework based on tightly coupled two-stage approach。
提案アーキテクチャの性能は,CプログラムとPythonプログラムに関連する標準ベンチマークプログラムで評価される。
論文 参考訳(メタデータ) (2026-05-02T05:43:29Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes [10.877713536966601]
Longestahead Prefix(LSP)スケジューラは、モノリシックプレフィックスの吸収に基づく、トレーニング不要でモデルに依存しない推論パラダイムである。
LSPは1つのフォワードパスを介してトークンの安定性を評価し、安定な予測の連続した左整列ブロックを動的に識別する。
原子のコミットメントの前に、言語や構造的受容の境界を画定する。
論文 参考訳(メタデータ) (2026-03-05T18:25:26Z) - Med-CRAFT: Automated Construction of Interpretable and Multi-Hop Video Workloads via Knowledge Graph Traversal [13.216513001286812]
textbfPipelineNameは、新しいニューロシンボリックデータエンジニアリングフレームワークである。
Med-CRAFTは生のビデオストリームから構造化されたビジュアルプリミティブを抽出し、動的時空間知識グラフにインスタンス化する。
このパイプラインをインスタンス化し、大規模な医療ビデオ推論ベンチマークであるM3-Med-Autoを生成します。
論文 参考訳(メタデータ) (2025-11-30T19:24:10Z) - FVDebug: An LLM-Driven Debugging Assistant for Automated Root Cause Analysis of Formal Verification Failures [8.530369312832084]
障害トレースを実行可能な洞察に変換するインテリジェントなシステムであるFV Debugを紹介します。
提案手法は,(1)非巡回グラフに障害トレースを構造化する因果グラフ合成,(2)不審なノードの特定を促すバッチ型Large Language Model (LLM)解析を用いたグラフスキャナ,(3)高レベルの因果説明を生成するためのエージェント的物語探索を活用したInsight Roverを特徴とする。
論文 参考訳(メタデータ) (2025-09-16T20:22:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。