論文の概要: Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering
- arxiv url: http://arxiv.org/abs/2608.07038v1
- Date: Fri, 07 Aug 2026 09:48:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.455705
- Title: Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering
- Title(参考訳): テキストマッチングを超えて:人間指向のバイナリリバースエンジニアリングのための参照フリー評価を目指して
- Abstract要約: 我々は,多次元の人的判断に基づく最初の専門家による基準のない評価ベンチマークであるBinJudgeBenchを紹介する。
BinJudgeは、人間の専門家との相関を4.5%-24.7%改善し、APIコストを0.06$times$-0.84$times$に削減する。
- 参考スコア(独自算出の注目度): 30.567931362297553
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-Oriented Binary Reverse Engineering (HOBRE) aims to transform decompiled pseudocode into a more human-friendly representation, thereby reducing the cognitive burden of reverse analysis and improving efficiency. However, reliably evaluating HOBRE outputs remains a fundamental challenge: human evaluation is costly, time-consuming, and difficult to scale, while existing automated metrics either require executable test cases and runtime environments that are often unavailable for real-world binaries, or rely on high-quality source code references that are typically inaccessible and fail to capture semantically equivalent but lexically diverse outputs. Although LLM-as-a-Judge paradigm is naturally well-suited to HOBRE evaluation, its effectiveness remains underexplored. This paper presents the first systematic investigation of the LLM-as-a-Judge paradigm for HOBRE across three representative tasks: function name recovery, binary code summarization, and decompilation optimization. We introduce BinJudgeBench, the first expert-annotated, reference-free evaluation benchmark based on multi-dimensional human judgment, where LLM-as-a-Judge achieves an average correlation of 63.20\% with human judgment, outperforming traditional automated metrics at 35.04\%. By analyzing judge configurations across backbone LLMs, prompting strategies, and decoding temperatures, we find that no ``one-size-fits-all'' configuration exists, as the optimal setup varies across tasks and individual samples. To address this, we propose BinJudge, which employs a lightweight routing mechanism to adaptively select the optimal judge configuration for each task and sample. BinJudge improves correlation with human experts by 4.5\%-24.7\% and reduces API cost to 0.06$\times$-0.84$\times$ of that of static best configurations, providing a scalable, cost-effective, and high-fidelity automated evaluation scheme for HOBRE.
- Abstract(参考訳): Human-Oriented Binary Reverse Engineering (HOBRE)は、逆解析の認知負担を軽減し、効率を向上させることを目的としている。
しかし、HOBREのアウトプットを確実に評価することは、基本的な課題である: 人間の評価はコストがかかり、時間がかかり、スケールが難しい。一方、既存の自動メトリクスは、現実のバイナリでは利用できない実行可能なテストケースと実行環境を必要としている。
LLM-as-a-JudgeパラダイムはHOBRE評価に自然に適しているが,その有効性は未検討である。
本稿では,HOBREのLLM-as-a-Judgeパラダイムを,関数名回復,バイナリコード要約,逆コンパイル最適化の3つのタスクに対して,初めて体系的に検討した。
我々は,LLM-as-a-Judgeが人的判断と63.20\%の平均相関を達成し,従来の自動測定値の35.04\%を上回った,多次元人的判断に基づく最初の専門家による基準なし評価ベンチマークであるBinJudgeBenchを紹介する。
バックボーンLCM間の判定設定の解析,戦略の推進,温度の復号化などにより,最適な設定がタスクや個々のサンプルによって異なるため,‘1サイズフィット’の構成は存在しないことがわかった。
そこで本研究では,タスクとサンプル毎に最適な判断設定を適応的に選択する,軽量なルーティング機構を用いたBinJudgeを提案する。
BinJudgeは、人間専門家との相関を4.5\%-24.7\%改善し、APIコストを0.06$\times$-0.84$\times$に削減し、HOBREのスケーラブルで費用対効果の高い高忠実度自動評価スキームを提供する。
関連論文リスト
- Adaptive Error Budget Allocation for Fault-Tolerant Quantum Resource Estimation: A Metaheuristic Approach [0.14323566945483496]
システムレベルのリソース推定は、フォールトトレラントな量子コンピューティングツールチェーンの重要なコンポーネントである。
そこで我々は,Azure Quantum Resource Estor上で,微分自由探索を直接行うトレーニングフリー最適化フレームワークを提案する。
MQTベンチの31ファミリーから2から91キュービットに及ぶ433個の回路上で,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-08-16T07:14:29Z) - FASE: Fast Adaptive Semantic Entropy for Code Quality [0.28647133890966986]
本稿では,FASE(Fast Adaptive Semantic Entropy)について紹介する。
HumanEvalとBigCodeBenchの評価は、FASEがLLMエンテーメントにより最先端のセマンティックエントロピーより優れていることを示している。
FASEは計算オーバーヘッドを無視し、従来のセマンティックエントロピーアプローチのランタイムコストの約0.3%しか必要としない。
論文 参考訳(メタデータ) (2026-06-08T17:53:05Z) - BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation [11.37493959290663]
本稿では,参照型生成環境における回答の正当性を評価するためのエンコーダ駆動方式であるBERT-as-a-Judgeを紹介する。
より大規模なLLM審査員のパフォーマンスに適合しながら,語彙ベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-04-10T17:08:40Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - LLM-guided Hierarchical Retrieval [54.73080745446999]
LATTICEは階層的な検索フレームワークであり、LLMは対数探索の複雑さで大きなコーパスを推論し、ナビゲートすることができる。
LLM誘導探索における中心的な課題は、モデルの関連性判断がノイズが多く、文脈に依存し、階層性に気付かないことである。
我々のフレームワークは、推論集約型BRIGHTベンチマークで最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2025-10-15T07:05:17Z) - Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data? [82.09573568241724]
EssenceBenchは反復遺伝的アルゴリズム(GA)を利用した粗粒度フレームワーク
提案手法は, 再構成誤差が低く, 効率が著しく向上した, 優れた圧縮結果が得られる。
HellaSwagベンチマーク(10Kサンプル)では,25倍少ないサンプルを用いて,全モデルが5%以内の順位を保ち,わずか200倍少ないサンプルを用いて,95%未満のランキング保持シフトを達成している。
論文 参考訳(メタデータ) (2025-10-12T05:38:10Z) - An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks [15.820416019287622]
SE-JuryはLLM-as-Ensemble-Judgeの最初の評価基準である。
さまざまなソフトウェアエンジニアリング(SE)ベンチマークでSE-Juryを評価します。
論文 参考訳(メタデータ) (2025-05-27T08:04:34Z) - CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution [74.41064280094064]
textbfJudger-1は、最初のオープンソースのtextbfall-in-one judge LLMである。
CompassJudger-1は、優れた汎用性を示す汎用LLMである。
textbfJudgerBenchは、様々な主観評価タスクを含む新しいベンチマークである。
論文 参考訳(メタデータ) (2024-10-21T17:56:51Z) - BatchEval: Towards Human-like Text Evaluation [12.187982795098623]
BatchEvalは、上記の問題を緩和するために、バッチ単位で反復的に評価するパラダイムである。
BatchEvalはPearson相関で10.5%,APIコストは64%,最先端の手法では10.5%向上している。
論文 参考訳(メタデータ) (2023-12-31T09:34:51Z) - Maximize to Explore: One Objective Function Fusing Estimation, Planning,
and Exploration [87.53543137162488]
我々はtextttMEX というオンライン強化学習(オンラインRL)フレームワークを提案する。
textttMEXは、自動的に探索エクスプロイトのバランスをとりながら、見積もりと計画コンポーネントを統合する。
様々な MuJoCo 環境では,ベースラインを安定的なマージンで上回り,十分な報酬を得られる。
論文 参考訳(メタデータ) (2023-05-29T17:25:26Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。