論文の概要: Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5
- arxiv url: http://arxiv.org/abs/2608.14992v1
- Date: Sat, 15 Aug 2026 02:43:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.143265
- Title: Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5
- Title(参考訳): ツールはプレーンテキストよりも権限を持てるか? クロードオプス5を用いた合成代入課題における偽クレーム導入の3つの前向き研究
- Abstract要約: モデルが合成ルックアップタスクで与える応答に、不要な代入を含むメッセージパッケージが変更するかどうかを検証した。
探索的四腕試験では, 偽符号採用率は0/24で, 対象は認められなかった。
この結果から,本実験はインラインテキストよりも,結果パッケージの行動重みが大きかったことが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language-model systems increasingly read from stores they also write to, so a claim that was merely written earlier can return looking retrieved. We tested whether the message package carrying an unsupported assignment changes which answer a model gives in a synthetic lookup task. Claude Opus 5 selected a color code for a named item or abstained. In an exploratory four-arm study, false-code adoption was 0/24 with no target claim, 0/22 scorable trials when a prior assistant assertion named the target, 14/24 when a tool-result record named it, and 15/24 when that result used a ten-field metadata wrapper that marked it unchecked. The tool-result arm selected the record's code in 11/12 supported trials and 14/24 unsupported trials, ruling out a fixed output-token bias while leaving substantial planted-token heterogeneity. A document-preregistered replication reproduced the tool-result versus assistant-assertion gap, 7/24 against 0/24, one-sided Fisher exact p = 0.0047. The tool-result rate nevertheless fell from 14/24 to 7/24 across runs made four days apart. A second preregistered study gave the earlier comparison a live text control: both records were announced in advance and placed in the same final user turn, then target binding was swapped between the linked tool result and later inline JSON. Inline text was sufficient for false-code adoption in 60/60 trials; the tool-result condition produced 57/60, so the registered result-first superiority criterion failed, p = 1. The result does not show that tool results have no effect. It shows that native tool-result placement was not necessary and that this experiment did not find greater behavioral weight for the result package than for announced inline text. The findings concern a single model on one synthetic task template, accessed through one API.
- Abstract(参考訳): 言語モデルシステムは、書き込んだストアから読み取る傾向にあるため、単に前に書かれたクレームは、検索された状態に戻ることができる。
モデルが合成ルックアップタスクで与える応答に、不要な代入を含むメッセージパッケージが変更するかどうかを検証した。
クロード・オプス5は、名前付きアイテムのカラーコードを選択した。
探索的四腕試験では、偽コード適用は0/24で、対象のクレームは0/22で、前者のアシスタントアサーションがターゲットと名づけた場合には0/22で、ツールリサートレコードが名付けた場合は14/24で、その結果が10フィールドのメタデータラッパーを使用して未確認の場合には15/24であった。
ツール・リサート・アームは11/12の支持試験と14/24の支持試験で記録のコードを選択し、一定の出力・トケンバイアスを排除し、実質的な植木・トケンの不均一性を残した。
文書を事前登録した複製では、ツールとアシスタントの差、7/24対0/24、一方のフィッシャーの正確なp = 0.0047が再現された。
それにもかかわらず、ツールの反発率は4日遅れて14/24から7/24に低下した。
両方のレコードが事前に発表され、同じ最終ユーザーターンに配置された後、ターゲットバインディングがリンクされたツール結果と後にインラインJSONの間でスワップされた。
インラインテキストは60/60試験において偽コード導入に十分であり, ツールレスト条件では57/60が生成され, 登録結果優先の判定基準が失敗し, p = 1。
結果は、ツールの結果に効果がないことを示すものではない。
この結果から,本実験はインラインテキストよりも,結果パッケージの行動重みが大きかったことが示唆された。
この結果は、ひとつのAPIを通じてアクセスされる、ひとつの合成タスクテンプレート上の1つのモデルに関するものだ。
関連論文リスト
- Threshold Choice, Not Sample Size, Bounds Trustless Verification of Nondeterministic Compound AI Workflows [0.0]
複合AIパイプライン LLMコール、レトリバー、ツールは非決定論的である。
各ステージのインプット、アウトプット、コンテキストのダイジェストをコミットします。
合成HotpotQAパイプラインでは、校正された固定しきい値が45個の正直な複製のうち44個を受け入れ、105個の発散ペアのうち104個を拒絶する。
論文 参考訳(メタデータ) (2026-09-07T22:10:54Z) - No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus [0.0]
大規模なマルチモーダルモデルに推論時にコンテキストを供給することは、音声の書き起こしをドメインに適応させるための安価なレバーである。
本研究は、そのメカニズムを、自身の生産コーパスからのサンプルに基づいて、生産された口頭歴史書写ツールの即時条件付け層で検証した。
論文 参考訳(メタデータ) (2026-08-28T21:26:35Z) - MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - Metis: Typed Runtime Mediation for Tool-Using Software Agents [13.543030296451661]
コールが外部効果に達する前に、プロバイダストリームを型付きイベントに変換するマルチプロジェクタランタイムであるMetisを提示する。
我々はこれらのメカニズムを凍結した原材料上で評価した。
論文 参考訳(メタデータ) (2026-08-26T03:10:03Z) - Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering [0.0]
公開資料のみから、AIレコードがクレームを表現できるかどうか、宣言された場所を保持できるかどうかを測定する。
188個の二重グレード細胞で、デフォルトレコードが行動システムのコンテンツアイデンティティを出力するプラットフォームは見つからなかった。
計器は、パイプラインが発行した排気のみからの保証深度を計算し、宣言された深さと比較する。
論文 参考訳(メタデータ) (2026-08-21T16:45:00Z) - Certifying Compressed Language Models: An Audit and a Statistical Toolkit [0.0]
正解率は, 正解率の約5倍であり, 正解率と正解率は同一であり, 個々の項目では相変わらず一致しない。
誰も有望な数値等価マージンを示しておらず、タスクマッチングされた各イテム出力はリリースしない。
欠落した機器: 宣言されたマージンでペア同値テストを行い、認定表に評価要求を与えます。
論文 参考訳(メタデータ) (2026-08-15T05:15:35Z) - Winning by Peeking: Unenforced Budgets and Test-Set Selection Inflate Short-Budget AutoML Comparisons [4.156551823302787]
簡単なAutoMLエンジンであるOrcetraが513のOpenMLデータセットでFLAMLとAutoGluonに勝っているというケーススタディを報告する。
両方のマージンは、結果テーブルに表示できないプロトコルの欠陥から来ています。
論文 参考訳(メタデータ) (2026-08-07T15:00:10Z) - Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop [0.0]
メカニカルオラクル下での対向試験硬化ループについて検討した。
テスタモデルはテストを書き、変異テスト名は生き残った欠陥を注入し、Cryticモデルはテストを書き、それらを正確に実行します。
私たちは、すべてのレシートと分析コードの両方のプロトコルをリリースします。
論文 参考訳(メタデータ) (2026-07-25T02:38:07Z) - The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation [0.0]
4つの条件(ペルソナなし、2人のエンジニアペルソナ、研究図書館ペルソナ)、12のコード生成タスク、2つのフロンティアモデル、5つのセル実行)をテストした。
事前登録された混合効果分析では, プロバイダが報告した出力トークンに対して, 条件・バイ・モデル相互作用が重要であった。
Claude Opusでは、最小限のエンジニアのペルソナが正確性を改善することなく可視出力を30%削減し、一方、徹底的なエンジニアのペルソナは正確性のないアウトプットを増加させた。
論文 参考訳(メタデータ) (2026-07-19T21:47:58Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Tool Calling is Linearly Readable and Steerable in Language Models [7.851713181228514]
ツール呼び出しエージェントが間違ったツールを選択すると、実行まで失敗は見えない。
Gemma 3、Qwen 3、Qwen 2.5、Llama 3.1の12の命令調整モデルを使用します。
選択したツールの同一性は、モデル内で線形で、管理可能であることが分かりました。
論文 参考訳(メタデータ) (2026-05-08T16:47:08Z) - Model Equality Testing: Which Model Is This API Serving? [59.005869726179455]
APIプロバイダは、基本モデルの定量化、透かし、微調整を行い、出力分布を変更することができる。
モデル平等テスト(Model Equality Testing)は,2サンプルテスト問題である。
単純な文字列カーネル上に構築されたテストは、歪みの範囲に対して77.4%の中央値を達成する。
論文 参考訳(メタデータ) (2024-10-26T18:34:53Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - Detecting Handwritten Mathematical Terms with Sensor Based Data [71.84852429039881]
本稿では,手書きの数学的用語を自動分類する,スタビロによるUbiComp 2021チャレンジの解を提案する。
入力データセットには異なるライターのデータが含まれており、ラベル文字列は合計15の異なる文字から構成されている。
論文 参考訳(メタデータ) (2021-09-12T19:33:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。