論文の概要: Fixed-Set Robustness in Programming by Example: Example Corruption and Semantic Partition Recovery
- arxiv url: http://arxiv.org/abs/2607.01280v1
- Date: Wed, 01 Jul 2026 07:38:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.521938
- Title: Fixed-Set Robustness in Programming by Example: Example Corruption and Semantic Partition Recovery
- Title(参考訳): プログラミングにおける固定セットロバストネスの例: 破損例とセマンティック分割回復例
- Authors: Yuan Si, Jialu Zhang,
- Abstract要約: 本稿では,異なる障害モード,つまり合成器を目にした相手が,復帰プログラムを最も損なうような事例を選択することについて検討する。
我々は,有限 PBE バージョン空間の最悪ケースを固定セットし,厳密なバウンドプールを実装し,文字列変換 DSL の汚職検索を行った。
- 参考スコア(独自算出の注目度): 2.054408744752205
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Programming-by-example systems infer programs from a small set of input-output examples. Robust PBE work usually models wrong examples as samples from a stochastic noise process and then minimizes an expected or empirical loss. This paper studies a different failure mode: an adversary who sees the synthesizer and chooses the examples whose corruption most damages the returned program. We formalize fixed-set worst-case corruption for finite PBE version spaces, implement exact-within-bounded-pool and heuristic corruption searches for a string-transformation DSL, and introduce version-space partition aggregation (VPA), a defense that synthesizes on disjoint example groups and votes by semantic signatures. The central claim is deliberately bounded and partly negative: low-margin PBE tasks have an adversarial robustness dimension that random-typo and noisy-PBE evaluations miss, while semantic partition aggregation helps only when the clean semantics keep a partition vote margin, which often fails on realistic tasks. Evidence from curated/generated DSL tasks, accepted public SyGuS PBE_SLIA slices, SYNTRA Playgol v2, and noisy-PBE objective baselines supports that boundary. One curated edit flips all 8 spike tasks while 200-trial typo, DSL-pool, and distance-matched random controls succeed on 10.3%, 11.0%, and 16.7%; generated margin-1 rows flip under budget 1 yet VPA recovers them; on public SyGuS the vote margin is near one, so an adaptive attacker drives VPA accuracy to zero; accepted public SyGuS slices move across exact-within-pool budget boundaries; and Playgol shows positive paired-bootstrap gaps against typo and same-pool random controls on the 141 accepted rows. A small exact-output prompt harness over 20 controlled margin-1 tasks shows the same qualitative clean-to-attacked pattern across local and API models, while it is treated as a scope check, not a broad LLM benchmark.
- Abstract(参考訳): プログラミング・バイ・サンプル・システムは、入力出力の小さな例からプログラムを推論する。
ロバストPBEの作業は通常、確率的ノイズプロセスのサンプルとして間違った例をモデル化し、予測された、または経験的な損失を最小限にする。
本稿では,異なる障害モード,つまり合成器を目にした相手が,復帰プログラムを最も損なうような事例を選択することについて検討する。
有限な PBE バージョン空間に対する固定セットの最悪の汚職を形式化し、文字列変換 DSL に対する厳密なバウンドプールとヒューリスティックな汚職検索を実装し、非結合なサンプルグループとセマンティックセマンティクスによる投票を合成するバージョン空間分割アグリゲーション(VPA)を導入する。
低マージン PBE タスクは、ランダムなタイポとノイズの多い PBE 評価が見逃すような敵意的な堅牢性次元を持ち、セマンティックパーティションアグリゲーションは、クリーンなセマンティクスがパーティション投票のマージンを保持し、しばしば現実的なタスクで失敗する場合にのみ有効である。
キュレート/生成されたDSLタスクの証拠、SyGuS PBE_SLIAスライス、SynTRA Playgol v2、ノイズとPBEの客観的ベースラインは、その境界をサポートする。
1つの修正版は8つのスパイクタスクをすべてフリップし、200回のタイポ、DSLプール、距離整合ランダムコントロールは10.3%、11.0%、16.7%で成功し、生成されたマージン-1行は予算の下でフリップするが、VPAはそれを回復する。
20以上の制御されたマージン-1タスクの小さな正確な出力プロンプトは、ローカルモデルとAPIモデルで同じ質的なクリーン・ツー・アタックパターンを示しているが、広いLLMベンチマークではなくスコープチェックとして扱われている。
関連論文リスト
- BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents [10.767742708000897]
ステップワイズグループベースのRLは、学習評論家なしで長期のLDMエージェントを訓練する魅力的な方法である。
現在のエージェントの変種は、状態-アクションの信用ミスマッチによってこの仮定に反することを示す。
批判や補助的な損失、余分なロールアウトを加えることなく、双方を修正できる、ドロップインの利点推定ツールであるBiPACEを紹介します。
論文 参考訳(メタデータ) (2026-06-24T08:32:42Z) - How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks [0.0]
マルチエージェント調整の論文は、小さなベンチマークデルタを、1つのアーキテクチャがもう1つのアーキテクチャに勝っている証拠として報告している。
以前の質問は、APIインプットが設定等価である場合、2つのプロトコルが同じモデルとベンチマークでどれだけ異なるかである。
クロードハイク4.5とタウ2ベンチ小売では、クリーン等価コントラスト(no_coord vs. インターセプト)は2つのn=100種に+10ppと0ppの符号付きギャップを与える。
論文 参考訳(メタデータ) (2026-06-15T07:25:11Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence [22.315546054051143]
大規模言語モデルのバイアス監査は、EU AI Actなどのガバナンスフレームワーク内で運用されている。
このプロトコルでは、各バイアススコアを2つの軸上での信頼性推定とともに報告する。
論文 参考訳(メタデータ) (2026-05-09T16:26:49Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - One Sample is Enough to Make Conformal Prediction Robust [53.78604391939934]
共形予測は, 1つのランダムな摂動入力に対して前方通過しても, ある程度の堅牢性が得られることを示す。
提案手法は,入力毎に多数のパス(例えば100回程度)を使用するSOTA法と比較して,平均セットサイズが小さいロバストな集合を返す。
論文 参考訳(メタデータ) (2025-06-19T19:14:25Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。