論文の概要: Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
- arxiv url: http://arxiv.org/abs/2610.02142v1
- Date: Thu, 01 Oct 2026 17:46:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.35236
- Title: Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
- Title(参考訳): キーワードHarnesses Fail Open:小言語モデルにおけるツール使用クレームのチープ診断ラダー
- Abstract要約: キーワードマッチングベンチマークは、決して実行しないツール使用のために、小さなモデルをクレジットすることができる。
661.6Mのパラメータモデルと1,109Mのモデルがデコーダ、トークン化器、および特別なトークンを共有し、非常に優れたツール使用メトリクスでほぼ同じスコアを付ける。
ファースト・ツーケン・プローブは1Bの故障を前の失点にローカライズする。
どちらのモデルもオーバートリガーであり、呼び出しなしでネガティブなプロンプトに答えることは滅多にない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Keyword-matching benchmarks can credit small models for tool use they never perform. We document such a false positive in a matched-architecture pair of Spanish security language models and propose a ladder of strict, cheap diagnostics. A 661.6M parameter model (approx. 65% code/technical text; no dedicated SFT) and a 1,109M model (web-heavy multi-phase curriculum; 6B-token tool-SFT) share decoder, tokenizer, and special tokens, scoring almost identically on lenient tool-use metrics (B4: 0.660 vs. 0.650). Verbatim-reproduction checks on training examples separate them completely: the 600M emits valid tool calls with generalized arguments on 6/6 examples; the 1B does so on 0/6 across checkpoints. A first-token probe localizes the 1B's failure to a missing prior (prob. $10^{-4}$--$10^{-5}$ on <|tool_call|>), which was erased by its web-heavy training phase. A targeted SFT recipe (diverse corpus, 5x higher learning rate, 2,202 steps, ~3.3 GPU-hours) repairs the 1B using three orders of magnitude fewer tokens than the failed phase. On all 269 corpus rows, valid emission rises from 0.100 to 0.959 (600M: 0.926). On 238 unseen prompts, the repaired 1B passes 0.536 vs. the 600M's 0.428 ($p = 0.004$). Embedding-drift checks show the repair did not move the trigger token's tied embedding (97.7% of the bf16 table remains bit-identical), meaning changes live in the surrounding network. Both models over-trigger, rarely answering negative prompts without a call (0.09 for 600M, 0.17 for repaired 1B). Factorial analyses confirm all repair configurations install the format, though suppression benefits from a diverse corpus remain a hypothesis due to seed sensitivity. This cheap diagnostic ladder costs minutes of CPU time and should gate tool-use claims on small models.
- Abstract(参考訳): キーワードマッチングベンチマークは、決して実行しないツール使用のために、小さなモデルをクレジットすることができる。
スペインのセキュリティ言語モデルと一致したアーキテクチャのペアにおいて、そのような偽陽性を文書化し、厳格で安価な診断のはしごを提案する。
661.6Mパラメータモデル(約65%のコード/技術テキスト、専用のSFTなし)と1,109Mモデル(Web重大なマルチフェーズカリキュラム、6BTokenツール-SFT)はデコーダ、トークン化器、および特別なトークンを共有し、寛大なツール使用メトリクス(B4: 0.660 vs. 0.650)でほぼ同じスコアを付けている。
600Mは6/6の例で一般的な引数を持つ有効なツールコールを出力します。
ファースト・ツーケン・プローブは1Bの失敗を欠落した前者にローカライズする(pb.10^{-4}$--$10^{-5}$ on <|tool_call|>)。
ターゲットのSFTレシピ(多変量コーパス、5倍高い学習率、2,202ステップ、約3.3GPU時間)は、失敗したフェーズよりも3桁少ないトークンを使用して1Bを修復する。
269個のコーパス列では、有効放射は0.100から0.959(600M:0.926)に上昇する。
238の未確認プロンプトでは、修理された1Bは0.536をパスし、600Mの0.428(p = 0.004$)をパスした。
埋め込み・ドリフトチェックは、修理がトリガートークンの束縛された埋め込み(bf16テーブルの97.7%はビットIDのまま)を動かさなかったことを示している。
どちらのモデルもオーバートリガーであり、コールなしで負のプロンプトに答えることは滅多にない(0.09回600M回、修理1B回は0.17回)。
因子分析により、すべての修復構成がこのフォーマットをインストールすることを確認したが、多種多様なコーパスからの抑制効果は、シード感度による仮説のままである。
この安価な診断はしごはCPU時間の数分を要し、小さなモデルのツール使用要求をゲートする必要がある。
関連論文リスト
- Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models [67.72077328700088]
本稿では,2次元の異なるデコーダのみの高密度変圧器モデルについて検討した。
Token-1B モデルは低FLOP 方式ではバイトモデル (End-Of-Token-1B と Bytes-1B) より優れていたが、最終的には高原となる。
100Kトークンの順序ではなく256バイトの小さな語彙で操作することで、ログダンピング時にトップクランケーションの必要性を回避することができる。
論文 参考訳(メタデータ) (2026-09-11T00:17:22Z) - Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles [86.41218924166775]
LLM生成のGPUカーネルのベンチマークは、ランダムな入力とゆるやかな浮動小数点耐性で正確性を決定する。
最近の研究は、これらのチェッカーは弱く、手動でパッチを当てることに同意している。
本稿では,カーネルベンチマークの精度指標として突然変異解析を導入する。
論文 参考訳(メタデータ) (2026-09-02T10:30:05Z) - Do System Prompts Leave Behavioral Fingerprints? A Large-Scale Empirical Study of Clone Detection via Output Similarity [12.32748486531306]
システムプロンプトのためのBBF(Black-Box Behavioral Fingerprinting)を提案する。
BBFはモデル出力から振る舞いのシグネチャを登録し、後に被疑者のデプロイメントがそのシグネチャと一致するかどうかをテストする。
BBFは非適応的なプロンプトパラフレーズ(AUC $geq 0.889$)に抵抗し、不完全な抽出に頑健である。
論文 参考訳(メタデータ) (2026-08-25T12:12:22Z) - Invocation-Level Reliability of Tool-Using Agents [0.7874708385247353]
クリーンな教師強化コンテキストと,モデル独自のフリーランニングコンテキストの両方の下で,その2つを分離する,正しい起動率を測定する。
深さ6では、モデル自身のクリーンコンテキスト能力の約70%が、以前の失敗に失われる。
論文 参考訳(メタデータ) (2026-08-23T09:04:59Z) - Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use [0.0]
textbfCARL(textbfCompetence-textbfAware textbfReinforcement textbfL)を提案する。
モデル自身のロールアウトに対して、パラメトリックな知識がどこに十分で、外部の助けを必要とするかを学ぶために、評論家を訓練する。
AUC 0.93の7Bでのツール依存の質問とパラメトリックで解ける質問を分離する。
論文 参考訳(メタデータ) (2026-05-27T00:11:31Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect [0.0]
本研究は,小言語モデルが内的アクティベーションを検出・報告できるかどうかを考察する。
まず,先行研究で使用される二項検出パラダイムが,質問内容に関係なく肯定的応答に偏りを示すため,小さなモデルで構築されていることを示す。
次に、モデル自身の摂動前進パスから構築した文局在化例を教師付き微調整するEmphIntrospection Fine-Tuning(IFT)を導入する。
論文 参考訳(メタデータ) (2026-05-08T05:30:26Z) - Self-Calibrating Language Models via Test-Time Discriminative Distillation [18.46710400838861]
大規模言語モデル(LLM)は、しばしば間違って答える質問に対して体系的に過度に信頼されている。
我々は、テスト時間トレーニング(TTT)パイプラインである$textbfSECL$ ($textbfSE$lf-$textbfC$alibrating $textbfL$anguage Modelsを紹介します。
論文 参考訳(メタデータ) (2026-03-18T13:28:50Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。