論文の概要: ITHICA: Intra-Thread Instruction Checking Approach for Defect-Induced Silent Data Corruptions
- arxiv url: http://arxiv.org/abs/2605.15638v1
- Date: Fri, 15 May 2026 05:43:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 21:22:26.184056
- Title: ITHICA: Intra-Thread Instruction Checking Approach for Defect-Induced Silent Data Corruptions
- Title(参考訳): ITHICA: 欠陥誘発無声データ破壊に対するスレッド内インストラクションチェックアプローチ
- Authors: Ioanna Vavelidou, Subho S. Banerjee, Eric X. Liu, Mike Fuller, Subhasish Mitra, Caroline Trippel,
- Abstract要約: サイレントデータ破損(SDC)に関するハイパースケーラレポートは、欠陥CPUを検出する機能テストの開発を動機付けている。
ITHICAは、任意のプログラムから欠陥発生エラーの関数的テストを自動的に生成する手法である。
ITHICAエラーチェックは、ITHICAテスト内のネイティブチェックよりも39%の障害サーバを検出する。
- 参考スコア(独自算出の注目度): 1.6833374932545138
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hyperscaler reports of silent data corruptions (SDCs), presumed to be caused by silicon manufacturing defects, have motivated the development of functional tests for detecting defective CPUs. We present ITHICA, an approach for automatically generating functional tests for defect-induced errors from arbitrary programs by inserting intra-thread, instruction-level error checks, primarily leveraging instruction duplication and output comparison. Our key insight is that the most pernicious defects cause inconsistent errors: two executions of the same instruction within the same thread, given the same inputs, can produce different architectural outputs depending on the execution context in which they run. By exploiting this insight, ITHICA enables arbitrary programs to serve as tests and identifies affected instructions upon error detections. We use ITHICA to transform industrial hyperscaler test programs (our baseline), datacenter workloads, and common libraries into functional tests, and evaluate them on over 3,000 CPU servers. ITHICA error checks detect 39% more defective servers than native checks within the ITHICA tests derived from our baseline programs, and enable novel findings on defect behavior that challenge conclusions drawn by prior hyperscaler fleet studies.
- Abstract(参考訳): シリコン製造欠陥に起因すると推定されるサイレントデータ破損(SDC)のハイパースケーラ報告は、欠陥CPUを検出する機能テストの開発を動機付けている。
ITHICAは、スレッド内、命令レベルのエラーチェックを挿入し、主に命令重複と出力比較を利用して、任意のプログラムから欠陥発生エラーの関数的テストを自動的に生成する手法である。
同じスレッド内で同じ命令を実行する2つの同じ入力が与えられた場合、実行状況に応じて異なるアーキテクチャ出力を生成することができます。
この洞察を利用して、ITHICAは任意のプログラムをテストとして機能させ、エラー検出時に影響を受ける命令を識別する。
ITHICAを使用して、産業用ハイパースケーラテストプログラム(私たちのベースライン)、データセンタワークロード、一般的なライブラリを機能テストに変換し、3,000以上のCPUサーバ上で評価します。
ITHICAエラーチェックは、我々のベースラインプログラムから得られたITHICAテストのネイティブチェックよりも39%の欠陥サーバを検出し、以前のハイパースケーラ・フリート研究によって引き起こされた結論に挑戦する欠陥挙動に関する新たな発見を可能にする。
関連論文リスト
- Scaling Agentic Verifier for Competitive Coding [66.11758166379092]
大規模言語モデル(LLM)は強力なコーディング能力を示しているが、1回の試行で競合するプログラミング問題を正しく解くのに苦戦している。
実行ベースの再ランク付けは、有望なテスト時間スケーリング戦略を提供するが、既存のメソッドは、難しいテストケースの生成または非効率的なランダム入力サンプリングによって制約される。
本稿では,プログラムの動作を積極的に推論し,高い差別性のあるテスト入力を検索するエージェント検証手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:30:40Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - A Multi-stage Error Diagnosis for APB Transaction [7.048835022222235]
本研究では,階層型ランダムフォレストアーキテクチャを用いた自動エラー診断フレームワークを提案する。
マルチステージエラー診断では、事前訓練された4つのバイナリ分類器を使用して、外乱アクセス、アドレス破壊、データ破壊エラーを逐次検出する。
実験の結果、全体の精度は91.36%で、ほぼ完全な精度とアドレスエラーのリコールが得られた。
論文 参考訳(メタデータ) (2025-09-03T05:07:56Z) - An Automated Blackbox Noncompliance Checker for QUIC Server Implementations [2.9248916859490173]
QUICtesterは、承認されたQUICプロトコル実装(RFC 9000/)における非準拠の動作を明らかにするための自動化アプローチである。
我々はQUICtesterを用いて、19のQUIC実装から得られた186個の学習モデルを5つのセキュリティ設定で解析し、55個の実装エラーを発見した。
論文 参考訳(メタデータ) (2025-05-19T04:28:49Z) - Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios [31.749442120603774]
問題解決フェーズにおけるPythonの実行エラーは、低解像度率と推論オーバーヘッドの増加と相関している。
私たちは、ModuleNotFoundErrorやTypeErrorのような最も一般的なエラーを特定し、OSErrorやデータベース関連の問題のような特に困難なエラーを強調しました。
論文 参考訳(メタデータ) (2025-03-16T06:24:51Z) - What You See Is What You Get: Attention-based Self-guided Automatic Unit Test Generation [3.8244417073114003]
本稿では,AUGER(Attention-based Self-guided Automatic Unit Test GenERation)アプローチを提案する。
AUGERには欠陥検出とエラートリガーという2つのステージがある。
F1スコアと欠陥検出精度で4.7%から35.3%向上した。
ユニットテスト生成において、最先端(SOTA)アプローチよりも23から84のエラーを発生させることができる。
論文 参考訳(メタデータ) (2024-12-01T14:28:48Z) - Mind the Error! Detection and Localization of Instruction Errors in Vision-and-Language Navigation [65.25839671641218]
そこで本研究では,潜在的な人的原因を考慮に入れた各種命令誤りを導入した新しいベンチマークデータセットを提案する。
我々のベンチマークで最先端のVLN-CE法を評価する場合、成功率において顕著な性能低下(最大-25%)が観測される。
また, エラー検出とローカライゼーションにおいて, 最適な性能を実現するための, クロスモーダルトランスフォーマーアーキテクチャに基づく効率的な手法を提案する。
論文 参考訳(メタデータ) (2024-03-15T21:36:15Z) - Fast and Accurate Error Simulation for CNNs against Soft Errors [64.54260986994163]
本稿では,誤りシミュレーションエンジンを用いて,コナールニューラルネットワーク(CNN)の信頼性解析のためのフレームワークを提案する。
これらの誤差モデルは、故障によって誘導されるCNN演算子の出力の破損パターンに基づいて定義される。
提案手法は,SASSIFIの欠陥効果の約99%の精度と,限定的なエラーモデルのみを実装した44倍から63倍までのスピードアップを実現する。
論文 参考訳(メタデータ) (2022-06-04T19:45:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。