論文の概要: Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior
- arxiv url: http://arxiv.org/abs/2606.20632v2
- Date: Wed, 24 Jun 2026 20:00:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.304103
- Title: Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior
- Title(参考訳): 学習後のレシピ, モデルファミリー以上の, マルチエージェントLLM会話動作を形作る
- Authors: Luyang Zhang, Jialu Wang, Fei Xue, Yi-Yun Chu,
- Abstract要約: 我々は,対話型マルチLLMシステムにおいて,同じファミリラベルが振舞いを予測するかどうかを検討する。
推理蒸留したLlamaチェックポイントのヘッジは、どのベースパートナーが返信するかによって18%シフトすることがわかった。
その結果,ポストトレーニングレシピをマルチLLMパネル合成のための第1級軸として同定した。
- 参考スコア(独自算出の注目度): 16.249731576262167
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-LLM systems use multiple language models to deliberate, judge each other's outputs, or coordinate as agents. Their value depends on the models producing measurably different conversational behaviors when given the same input. Prior offline studies recommend drawing one model per family for behavioral diversity, because LLMs prefer outputs from their own family when rating one another in isolation. Whether the same family label predicts behavior in interactive multi-LLM systems, the setting that real deployed systems use, has not been tested. We study this with a 940,000-chain 11-checkpoint corpus and a 1.6M-chain same-base Llama factorial. On our validated headline metric, hedging, a reasoning-distilled Llama checkpoint shifts by 18% depending on which same-base partner it replies to, more than any cross-family hedging gap in the controlled subset. Qwen, closed-API, and runtime checks suggest the pattern is not isolated, while repair and challenge analyses remain exploratory because their surface-cue detectors are weaker. Overall, the results identify post-training recipe as a first-class axis for multi-LLM panel composition and show that model family alone is an incomplete proxy for conversational diversity.
- Abstract(参考訳): マルチLLMシステムは、複数の言語モデルを使用して、意図的に、互いの出力を判断したり、エージェントとしてコーディネートする。
それらの値は、同じ入力を与えられたときに、測定可能な異なる会話行動を生み出すモデルに依存する。
以前のオフライン研究では、LCMは別々に評価する場合、家族ごとのアウトプットを好むため、行動多様性のために家族ごとに1つのモデルを描くことを推奨していた。
同じファミリーラベルがインタラクティブなマルチLLMシステムの動作を予測するかどうかは、実際のデプロイシステムが使用する設定はテストされていない。
我々はこれを940,000のチェーン11チェックポイントコーパスと1.6Mの同一塩基Llama因子を用いて研究した。
評価された基準値では, 制御されたサブセットのどの家族間ヘッジギャップよりも, 応答する同一のパートナーによって, 推理蒸留したLlamaチェックポイントが18%シフトする。
Qwen、クローズドAPI、ランタイムチェックは、このパターンが孤立していないことを示唆している。
その結果,学習後レシピをマルチLLMパネル構成のための第1級軸として同定し,モデルファミリのみが会話の多様性のための不完全なプロキシであることを示す。
関連論文リスト
- Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models [29.673427534201654]
マルチモーダルな大規模言語モデルの5面監査であるFacet-Probeを紹介する。
監査対象の18のMLLMはいずれも順序不変ではないことが分かりました。
MLLMの標準報告軸として,クロスオーダーフリップ率を提案する。
論文 参考訳(メタデータ) (2026-06-24T17:53:26Z) - Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models [0.0]
大規模言語モデル(LLM)は平均年齢のパフォーマンスは高いが、インスタンスレベルでは信頼性が低い。
本稿では,LLM出力の集合を教師付きメタラーナへの入力として扱うマルチモデル・コンセンサス・推論エンジンを提案する。
このシステムは、自然言語の応答をセマンティックな埋め込み、ペアの類似性とクラスタリング統計、語彙的および構造的手がかり、推論品質スコア、信頼度推定、モデル固有の事前情報を用いて構造化された特徴にマッピングする。
論文 参考訳(メタデータ) (2026-01-12T06:27:06Z) - When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers [11.937771430269201]
本稿では,37大言語モデル(LLM)の体系的研究について述べる。
自己検証と同一家族内および異なる家族間での検証を比較した。
検証者ゲインや偽陽性率尺度などのメトリクスをモデルサイズと後トレーニングで分析し,データセットの妥当性の違いを特徴付ける。
論文 参考訳(メタデータ) (2025-12-02T00:51:14Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Multi-LLM QA with Embodied Exploration [55.581423861790945]
未知環境における質問応答におけるマルチエンボディードLEMエクスプローラ(MELE)の利用について検討する。
複数のLSMベースのエージェントが独立して家庭用環境に関する質問を探索し、回答する。
各問合せに対して1つの最終回答を生成するために,異なるアグリゲーション手法を解析する。
論文 参考訳(メタデータ) (2024-06-16T12:46:40Z) - Do Membership Inference Attacks Work on Large Language Models? [141.2019867466968]
メンバーシップ推論攻撃(MIA)は、特定のデータポイントがターゲットモデルのトレーニングデータのメンバーであるかどうかを予測しようとする。
我々は、Pileで訓練された言語モデルに対して、MIAの大規模評価を行い、そのパラメータは160Mから12Bまでである。
様々な LLM サイズや領域にまたがるほとんどの設定において,MIA はランダムな推測よりもほとんど優れていないことがわかった。
論文 参考訳(メタデータ) (2024-02-12T17:52:05Z) - Mind the instructions: a holistic evaluation of consistency and
interactions in prompt-based learning [14.569770617709073]
本稿では,どの設計選択が課題予測の不安定性や矛盾の原因となるかを詳細に分析する。
本稿では,入力分布とラベルの相関関係が,誘導モデルにのみ小さな問題となることを示す。
統計的に分析し、どの要因が最も影響力があり、インタラクティブで、安定したかを示す。
論文 参考訳(メタデータ) (2023-10-20T13:25:24Z) - Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency [127.97467912117652]
大規模言語モデル(LLM)は、コード生成において顕著な能力を示した。
しかし、単一の試みで正しいソリューションを生成することは依然として課題である。
本稿では,MPSC(Multi-Perspective Self-Consistency)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T14:23:26Z) - Multifamily Malware Models [5.414308305392762]
我々は、トレーニングデータセットの一般性と対応する機械学習モデルの精度との関係を定量化するために、バイト$n$-gramの機能に基づいた実験を行う。
近隣のアルゴリズムは驚くほどよく一般化され、他の機械学習手法よりもはるかに優れています。
論文 参考訳(メタデータ) (2022-06-27T13:06:31Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。