論文の概要: Do LLMs Act on What They Know? From Partner Representations to Cooperative Actions
- arxiv url: http://arxiv.org/abs/2610.08129v1
- Date: Tue, 06 Oct 2026 10:44:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.942545
- Title: Do LLMs Act on What They Know? From Partner Representations to Cooperative Actions
- Title(参考訳): LLMは何を知っているか? : パートナー表現から協調行動へ
- Abstract要約: 馴染みのないパートナーとの協力は、事前に知られていないコミュニケーション慣行に適応する必要がある。
一般ルールや外部計算されたアクションレコメンデーションとして提示されるプローブ予測および地道規則を比較した。
Qwen3-8Bのケーススタディでは、一致ステートステートステートの逆転はルールステートよりもアクションレコメンデーションに対する感受性が高いことが示されている。
- 参考スコア(独自算出の注目度): 50.59575731390721
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Cooperation with unfamiliar partners requires adapting to communication conventions that are not known in advance. We study this problem in a controlled Hanabi-derived environment with scripted hint generation, LLM-controlled receiving decisions, and frozen model weights. Across eight LLMs, linear probes recover intent conventions substantially more accurately than target conventions, yet receiving choices do not consistently agree with the sender's convention. We compare probe-predicted and ground-truth conventions presented either as general rules or as externally computed action recommendations. Rule statements yield modest and model-dependent changes in cooperation, whereas action translation produces larger gains on average. In a Qwen3-8B case study, matched-state statement reversals reveal much greater sensitivity to action recommendations than to rule statements. Activation transfers from oracle-action and non-oracle hint-restatement donors improve intent accuracy on both action classes, but the tested alternatives do not reliably reproduce these benefits. Together, these results distinguish convention decodability, sensitivity to convention information, and cooperative performance, and highlight limitations in turning available partner information into receiving decisions.
- Abstract(参考訳): 馴染みのないパートナーとの協力は、事前に知られていないコミュニケーション慣行に適応する必要がある。
我々は,この問題を,スクリプト付きヒント生成,LLM制御受信決定,凍結モデル重み付き制御されたハナビ由来の環境において検討した。
8つのLSMで、線形プローブはターゲットの規約よりもかなり正確に意図の規則を復元するが、選択を受けることは送信者の規則に一貫して一致しない。
一般ルールや外部計算されたアクションレコメンデーションとして提示されるプローブ予測および地道規則を比較した。
ルールステートメントは協力の質素な変化とモデルに依存した変化をもたらすが、アクション翻訳は平均よりも大きな利益をもたらす。
Qwen3-8Bのケーススタディでは、一致ステートステートステートの逆転はルールステートよりもアクションレコメンデーションに対する感受性が高いことが示されている。
オラクル・アクションおよび非オラクル・ヒント・レステートメントドナーからの活性化伝達は、両方のアクション・クラスにおける意図の精度を向上させるが、テストされた代替手段はこれらの利点を確実に再現しない。
これらの結果は、コンベンションの可否、コンベンション情報に対する感受性、協調的なパフォーマンスを区別し、利用可能なパートナー情報を受信決定に変換する際の制限を強調している。
関連論文リスト
- Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language Navigation [53.30116823667751]
視覚言語ナビゲーションのためのテスト時適応(TTA-VLN)により、事前訓練されたポリシーは、目に見えない環境にオンラインで適応できる。
分散シフトは、局所的な行動選好を歪め、オフコース決定につながる可能性がある。
我々は,行動誘発観察遷移から署名付き参照関連決定クレジットを回収する信用誘導政策改善(CGPI)を提案する。
論文 参考訳(メタデータ) (2026-09-29T13:46:11Z) - Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models [71.46915245859357]
物体幻覚は、大きな視覚言語モデルにとって依然として大きな課題である。
本稿では,データレベルでの高密度報酬信号と,アルゴリズムレベルでの正確な信用割当を結合する微粒化アライメントフレームワークを提案する。
本手法は, 識別評価において, 顕著な性能向上を図りながら, 生成タスクにおける高情報かつ忠実な記述を生成する。
論文 参考訳(メタデータ) (2026-09-28T14:37:33Z) - Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization [13.354353071601379]
我々は、特権付き監督を成果ベースアクションクレジットに変換するTASPOを紹介する。
3つのエージェントベンチマークで、TASPOはGRPOよりも10.6%改善し、目に見えないタスクを一般化する。
論文 参考訳(メタデータ) (2026-08-31T16:51:50Z) - Relational Priors as Convergence Pressure in LLM-Based Multi-Agent Systems [13.096154493399764]
本研究では,大規模言語モデルに基づくマルチエージェントシステムにおいて,エージェント間関係のセマンティクスを明示する効果について検討する。
リレーショナル・ポジティビティの増大はエージェントのコーディネートや合意をより容易にする傾向にある。
LLM-MASのデフォルトアドオンとしてリレーショナルプリミティブを使用すべきではない、と我々は主張する。
論文 参考訳(メタデータ) (2026-08-04T07:11:28Z) - Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning [72.49938949082117]
MAR(Multi-agent reasoning)は、反復的な解交換と改良を通じて推論の信頼性を向上させる。
既存の適応MARメソッドは通常、クエリレベルのラベルやトラジェクトリレベルのリターンからルーティング決定を学習する。
効率的な適応MARのための共有操作型クレジット割り当てフレームワークであるTreeCreditを提案する。
論文 参考訳(メタデータ) (2026-08-03T14:22:23Z) - From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation [26.46543637149513]
大言語モデル(LLM)は、異種相互作用履歴を推論することで、生成的推奨者を補完することができる。
LLMは、レコメンデーション固有の結果フィードバックで本質的に訓練されていない。
本稿では、まずタスク指向の意図を誘導し、次にレコメンデーションポリシーを発見するフィードバック駆動型エージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-30T07:23:07Z) - Learning from Acceptance: Cumulative Regret in the Game of Coding [15.178727194172161]
我々は,データコレクタが相手のユーティリティトレードオフを知らないコーディングゲームにおいて,不完全情報バージョンについて検討する。
提案アルゴリズムは,有望な受理規則に関する探索を洗練し,サブ線形累積後悔を達成できることを証明し,その性能を評価する。
論文 参考訳(メタデータ) (2026-05-10T21:04:43Z) - Can AI Agents Agree? [32.75269650141292]
大規模言語モデルは、協調エージェントとしてますます展開されているが、敵のコンセンサス設定におけるそれらの振る舞いは研究されていない。
シンクロ・オール・ツー・オール・シミュレーションを用いて,ビザンチンのコンセンサスゲーム上でのLSMに基づくエージェントをスカラー値で評価する。
グループのサイズが大きくなるにつれて、良質な設定や劣化があっても、有効な合意が信頼できないことが分かりました。
論文 参考訳(メタデータ) (2026-03-01T18:18:59Z) - Information Bargaining: Bilateral Commitment in Bayesian Persuasion [60.3761154043329]
長期的説得のための統一的なフレームワークとよく構造化されたソリューションの概念を導入する。
この視点はゲーム構造の共通知識を明確にし、レシーバに匹敵するコミットメント能力を与える。
このフレームワークは、2段階の検証と推論のパラダイムによって検証される。
論文 参考訳(メタデータ) (2025-06-06T08:42:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。