論文の概要: A Controlled Candidate-Set Benchmark for Offline Satellite-Security Plan Decomposition
- arxiv url: http://arxiv.org/abs/2607.26371v1
- Date: Wed, 29 Jul 2026 01:18:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.506392
- Title: A Controlled Candidate-Set Benchmark for Offline Satellite-Security Plan Decomposition
- Title(参考訳): オフライン衛星安全計画分割のための制御された候補セットベンチマーク
- Abstract要約: いくつかのセキュリティ開発設定では、オブジェクトを順序付き、チェック可能なプランにマッピングするローカルモデルが必要です。
本報告では,低ランク分解アダプタを用いて,24件のオーソリケーションと83件のオーソリケーションを含むケース分離コーパスを,24件のサテライトセキュリティケースに対して次段階の事例として公開する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Some security-development settings require local models that map an objective to an ordered, checkable plan. We present a low-rank decomposition adapter and release a case-disjoint corpus with 24 authored decompositions and 83 derived next-step examples across 24 satellite-security cases. To prevent reference-plan leakage, prompts contain one objective and eight shuffled SPARTA candidates. The evaluation candidate sets are constructed with oracle inclusion of every reference technique, so this study measures selection from a controlled set, not retrieval. On six fixed cases and five decoding seeds, mean scores vary across adapters and prompted Qwen2.5 baselines; a separate greedy check over three adapter training seeds shows non-negligible training variance. A 24-fold greedy leave-one-case-out control at the two compact sizes likewise shows tradeoffs: at 1.5B, adapter precision is 0.583 against 0.480 for two-shot prompting, while recall is 0.586 against 0.660. Case-resampling intervals for adapter precision relative to the strongest prompted baseline cross zero at 1.5B and 7B. The adapter is also substantially more format-compliant, which prevents attributing all score differences to selection. Autoregressive next-step accuracy is 0.08, 0.06, and 0.29 at 0.5B, 1.5B, and 7B. We therefore offer the formulation, leakage-controlled dataset, reproducibility package, and descriptive analysis as a proof of concept, not evidence of a reliable stand-alone decomposition system or a general adapter advantage. A separate diagnostic tests contract reuse.
- Abstract(参考訳): いくつかのセキュリティ開発設定では、オブジェクトを順序付き、チェック可能なプランにマッピングするローカルモデルが必要です。
本報告では,低ランク分解アダプタを用いて,24件のオーソリケーションと83件のオーソリケーションを含むケース分離コーパスを,24件のサテライトセキュリティケースに対して次段階の事例として公開する。
リファレンスプランリークを防止するため、プロンプトは1つの目的と8つのシャッフルされたSPARTA候補を含む。
評価候補集合は,すべての基準手法を包含して構成されるので,検索ではなく,制御された集合からの選択を計測する。
6つの固定ケースと5つのデコードシードでは、平均スコアはアダプタによって異なり、Qwen2.5ベースラインが誘導される。
1.5Bでは、アダプタの精度は0.583対0.480対2ショットプロンプト、リコールは0.586対0.660である。
最強励磁基線クロスゼロに対するアダプタ精度のケースサンプリング間隔は1.5B, 7Bであった。
アダプタもかなりフォーマットに準拠しており、すべてのスコアの違いが選択に結びつくのを防いでいる。
自己回帰次のステップ精度は0.5B、1.5B、7Bで0.08、0.06、0.29である。
そこで我々は, 定式化, 漏洩制御されたデータセット, 再現性パッケージ, 記述的解析を概念実証として提供し, 信頼性の高いスタンドアローン分解システムや一般アダプタの利点を示す。
別個の診断テストは再利用を契約する。
関連論文リスト
- The Deception Delta: Adversarial Evaluation of LLM-Based Smart Contract Bytecode Forensics [0.0]
大規模な言語モデルは、ブロックチェーンの法医学的な調査でますます使われている。
逆行性騙しは ドレインの検出を 20.0ポイント減らす
モデルは、隠されたドレインメカニズムを正しく記述するが、契約のフレーミングを受け入れ、それを良心として無視する。
論文 参考訳(メタデータ) (2026-09-12T18:45:24Z) - GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures [0.0]
コンパニオン評価により、8つの視覚言語モデルにおいて、操作中の対象部位の命名により動作精度が0.32-0.63向上することが判明した。
しかし、部品の命名は、実際のシステムが推論し、視覚的接地、機械的推論、カテゴリー対アクションの関連性を見極めなければならない情報を提供する。
GroundBenchは、これらの説明を6つのブランチ・アンド・マージ条件で分離する診断ベンチマークである。
論文 参考訳(メタデータ) (2026-09-10T14:52:26Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - RecGPT-Mobile-V2 Technical Report [22.10290138930905]
RecGPT-Mobile-V2は、意図的品質と実行効率をステージド設計の目的として扱うエンドツーエンドフレームワークである。
このフレームワークは異種間相互作用をエビデンス保存軌道に変換し、ドメイン適応と教師付きアライメントを通じてレコメンデーションネイティブ基盤を確立する。
オンライン検索分析では、クエリリコールチャネルは、確立されたリコールチャネルによってサーフェスされたインベントリに補完されるインベントリを検索することを示している。
論文 参考訳(メタデータ) (2026-08-25T09:23:17Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability [16.27940179594792]
AdversaBenchは、5つの構造化演算子でシードプロンプトをミュートするエンドツーエンドの赤チームパイプラインである。
本報告では, 推論, 指示追従, ツール利用の3つのカテゴリにまたがる45種の種子について実験を行った。
論文 参考訳(メタデータ) (2026-06-23T13:50:51Z) - Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense [37.10272384523361]
我々は、各検出器のサンプルごとの信頼性と遅延を、同様の過去の入力に対する動作から予測するためのフレームワークを開発する。
SCOUT-450は、古いプロンプトインジェクションが表現下にある構造的に複雑でエージェント対応のインジェクションをキャプチャするベンチマークである。
SCOUT-450では、安全指向の動作点が攻撃発生率を46%減らし、壁時計全体の40%減らした。
論文 参考訳(メタデータ) (2026-05-29T04:49:20Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives [48.545980031973556]
GAMBITは、インポスタ検出器を評価するための3つの評価モードと2つの独立したスコアを持つベンチマークである。
ベンチマークには、240の共進化型インポスタ戦略にまたがる27,804のラベル付きインスタンスのデータセットが付属している。
論文 参考訳(メタデータ) (2026-05-09T16:07:23Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking [0.0]
本稿では,トークン制御プロトコル下での分散について検討し,FSI(Format Sensitivity Index),ラッパー選択による精度範囲,PSI(Parseability Sensitivity Index)の2つの相補的指標を紹介する。
FSIはモデルによって30倍以上の違いがあり、コンプライアンスの失敗によって大きく説明されています。
固定効果回帰は、タスク、モデル、ラッパーを制御した後でも、パーセビリティが高い精度の予測因子であることを示している。
論文 参考訳(メタデータ) (2026-05-02T22:51:41Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - One Sample is Enough to Make Conformal Prediction Robust [53.78604391939934]
共形予測は, 1つのランダムな摂動入力に対して前方通過しても, ある程度の堅牢性が得られることを示す。
提案手法は,入力毎に多数のパス(例えば100回程度)を使用するSOTA法と比較して,平均セットサイズが小さいロバストな集合を返す。
論文 参考訳(メタデータ) (2025-06-19T19:14:25Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z) - Detection Transformer with Stable Matching [48.963171068785435]
もっとも重要な設計は, 肯定的な事例の分類スコアを監督するために, 位置測定値のみを使用することである。
本原理では,DTRの分類損失とマッチングコストに位置測定値を統合することで,簡易かつ効果的な2つの修正を提案する。
12エポックおよび24エポックのトレーニング設定の下でResNet-50バックボーンを用いてCOCO検出ベンチマークで50.4および51.5APを達成する。
論文 参考訳(メタデータ) (2023-04-10T17:55:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。