論文の概要: Faithful, Not Corrective: Message-Format Effects in Multi-Hop Agent Relays Are Tier-Dependent
- arxiv url: http://arxiv.org/abs/2607.09678v1
- Date: Fri, 12 Jun 2026 08:21:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.361186
- Title: Faithful, Not Corrective: Message-Format Effects in Multi-Hop Agent Relays Are Tier-Dependent
- Title(参考訳): 忠実で矯正的でない:マルチホップエージェントリレーにおけるメッセージフォーマット効果はタイア依存である
- Abstract要約: LLM文学エージェントは、情報を互いに渡します。
構造体は、エラー訂正コードではなく、忠実でエラー訂正のチャンネルを購入します。
フォーマットの選択は、各フォーマットで最も弱いリレーに従うべきです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When LLM agents hand off information to one another, does the message format matter? Two literatures disagree: format-optimization work reports that structured messages cut cost without hurting accuracy, while format-restriction work finds that imposing structure degrades generation -- and neither measures what happens when a message traverses multiple hops, where copy fidelity, not one-shot generation, dominates. We introduce a controlled relay testbed: briefs of twelve programmatically generated atomic facts are re-encoded hop-by-hop in five formats (free NL, precision-instructed NL, JSON, triples, key-value) over six hops, scored by a fixed strong grader against programmatic ground truth, across two relay-capability tiers, a cognitive-load condition, and a paired-fork error injection. We find that message-format effects are tier-dependent. (i) Under faithful-relay instructions a strong relay is nearly lossless -- the documented "telephone-game" collapse does not occur -- and adding per-hop cognitive load leaves format-level fidelity unchanged (within +/-1.8 points) while raising generation cost by 24-53%. (ii) Under a weak (1.5B) relay the across-format spread of six-hop recall grows by a factor of 8.7 (from 2.3 to 20.5 points), driven by two opposing mechanisms -- an encoding toll paid by the rigid formats and drift resistance specific to the fixed-key JSON schema -- that flip the format ranking in transit. (iii) In a paired-fork injection, an injected wrong value, once present, persists to the final hop in 83-100% of chains in every format, closely matching each format's retention of the true value, with no detectable collateral damage to neighboring facts. Structure buys a faithful, error-localizing channel -- not an error-correcting code -- and format choice should follow the weakest relay in the pipeline.
- Abstract(参考訳): LLMエージェントが情報を互いに渡すとき、メッセージフォーマットは重要か?
フォーマット最適化作業は、構造化されたメッセージが精度を損なうことなくコストを削減したと報告するのに対して、フォーマット制限作業は、命令された構造が生成を低下させることを検知する。
プログラム的に生成された12の原子事実を5つのフォーマット(フリーNL, 高精度NL, JSON, トリプル, キー値)で再符号化し, 6つのホップに対して, プログラム的基底真理に対して, 固定された強いグレーダによってスコアされ, 2つのリレー能力レベル, 認知負荷条件, ペア化されたフォークエラーインジェクションを行う。
メッセージフォーマット効果が階層依存であることに気付きました。
i) 忠実なリレー命令の下では、強いリレーはほとんど失われない -- 文書化された「電話ゲーム」の崩壊は起こらない -- そして、ホップごとの認知負荷は、フォーマットレベルの忠実度を変更せずに(+/-1.8ポイントで)、生成コストを24~53%引き上げる。
(ii)弱い(1.5B)の下では、6ホップリコールのフォーマット間の拡散が8.7倍(2.3から20.5ポイント)増加し、反対の2つのメカニズムによって駆動される。
三 注入された不正な値が各形態のチェーンの83-100%のフィニッシュホップに持続し、各形態の真価保持と密に一致し、隣り合う事実に副次的損害を生じない。
構造体は忠実でエラーローカライズされたチャネル -- エラー訂正コードではない -- を購入し、フォーマットの選択はパイプラインで最も弱いリレーに従う必要がある。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability [16.27940179594792]
AdversaBenchは、5つの構造化演算子でシードプロンプトをミュートするエンドツーエンドの赤チームパイプラインである。
本報告では, 推論, 指示追従, ツール利用の3つのカテゴリにまたがる45種の種子について実験を行った。
論文 参考訳(メタデータ) (2026-06-23T13:50:51Z) - VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct [71.22358682581215]
ビジュアルな数学的推論のための強化学習のスケーリングは、難しい質問を生成すること以上のものを必要とします。
これは2つのコンポーネントからなる反復的なフレームワークであるVeriEvolとしてインスタンス化します。
5ベンチマークのビジュアル・マス・スイートでは、10Kから250KサンプルまでのSFTデータのスケーリングが平均精度を35.42から54.73に引き上げている。
論文 参考訳(メタデータ) (2026-06-22T16:17:30Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection [8.360057179027322]
言語間の脆弱性検出において、コード表現形式がどのように偽陽性行動を形成するかは、まだ理解されていない。
学習時間と推論時間の両方で、原文と刈り取られた抽象構文木を比較し、学習強度とコード表現形式を体系的に変化させる。
言語間のFPRは、トレーニング時間と推論時間の両方の表現の合同効果を反映している。
論文 参考訳(メタデータ) (2026-04-30T11:01:03Z) - Resilient Write: A Six-Layer Durable Write Surface for LLM Coding Agents [0.0]
レジリエント・ライト(Resilient Write)は、エージェントとサーバの間に6層の耐久性のある書き込みサーフェスを介するMPPサーバである。
各レイヤは、2026年4月の実際のエージェントセッションで観測された具体的な障害モードにマップされる。
186-testスイートは各層での正当性を検証し、エージェントの自己補正率を13倍改善する。
論文 参考訳(メタデータ) (2026-04-12T22:23:55Z) - FMBench: Adaptive Large Language Model Output Formatting [49.52930069696333]
適応型マークダウン出力フォーマットのベンチマークであるFMBenchを提案する。
2つのモデルファミリーの実験は、SFTが一貫してセマンティックアライメントを改善していることを示している。
結果はまた、意味的目的と構造的目的の間に固有のトレードオフを明らかにします。
論文 参考訳(メタデータ) (2026-02-06T04:42:06Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - WR-ONE2SET: Towards Well-Calibrated Keyphrase Generation [57.11538133231843]
キーワード生成は、入力文書を要約する短いフレーズを自動的に生成することを目的としている。
最近登場したONE2SETパラダイムは、キーフレーズをセットとして生成し、競争性能を達成した。
本稿では, ONE2SET を拡張した WR-ONE2SET を提案する。
論文 参考訳(メタデータ) (2022-11-13T09:56:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。