論文の概要: Agreement in Representation Space for Open-Ended Self-Consistency
- arxiv url: http://arxiv.org/abs/2606.12003v1
- Date: Wed, 10 Jun 2026 12:26:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-11 16:42:38.447177
- Title: Agreement in Representation Space for Open-Ended Self-Consistency
- Title(参考訳): オープンエンディング型自己整合性のための表現空間の合意
- Authors: Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal,
- Abstract要約: コード合成やテキスト要約などのオープンな生成タスクにおける自己整合性について検討する。
EBA(Embedding-Based Agreement)は,組込み空間におけるサンプル世代をクラスタリングすることによって合意を推定する,トレーニング不要な運用方式である。
EBAはランダム選択を一貫して上回り、最近の選択アプローチよりも安定したスケーリング挙動を示す。
- 参考スコア(独自算出の注目度): 7.4508858982186
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-consistency improves LLM reasoning by sampling multiple outputs and selecting the most consistent answer, but existing formulations largely rely on exact matching and therefore remain limited to tasks with categorical outputs. In this work, we study self-consistency in open-ended generation tasks such as code synthesis and text summarization. We hypothesize that consistency can be understood as a geometric property of the generation space, where semantically compatible generations concentrate in similar regions of representation space. To study this hypothesis, we introduce Embedding-Based Agreement (EBA), a simple training-free operationalization that estimates agreement by clustering sampled generations in embedding space. Through experiments on mathematical reasoning, code generation, and summarization, we show that agreement in representation space provides a robust and scalable signal of self-consistency for open-ended tasks. In particular, EBA consistently outperforms random selection and exhibits more stable scaling behavior than recent selection approaches based on LLM evaluation or uncertainty estimation. We further show that these agreement signals remain stable across model families and embedding spaces, even with native hidden representations. Finally, our analysis shows that the geometric location occupied by sampled generations is strongly correlated with generation quality: generations concentrated near central regions of representation space tend to correspond to more reliable outputs, whereas peripheral generations are substantially less accurate. Overall, our findings support viewing self-consistency as a property of the geometric organization of sampled generations rather than exact symbolic overlap.
- Abstract(参考訳): 自己整合性は複数の出力をサンプリングし、最も一貫した答えを選択することでLCM推論を改善するが、既存の定式化は主に正確なマッチングに依存しているため、分類的な出力を持つタスクに限られる。
本研究では,コード合成やテキスト要約などのオープンな生成タスクにおける自己整合性について検討する。
一貫性は生成空間の幾何学的性質として理解でき、意味論的に互換性のある世代は表現空間の同様の領域に集中する。
この仮説を考察するために、埋め込み空間におけるサンプル世代をクラスタリングすることによって合意を推定する単純なトレーニング不要な運用法であるEmbedding-Based Agreement (EBA)を導入する。
数学的推論、コード生成、要約の実験を通じて、表現空間における合意は、オープンエンドタスクに対して堅牢でスケーラブルな自己整合性信号を提供することを示した。
特に、EBAはランダム選択を一貫して上回り、LSM評価や不確実性推定に基づく最近の選択手法よりも安定したスケーリング挙動を示す。
さらに、これらの合意信号は、ネイティブな隠蔽表現であっても、モデルファミリや埋め込み空間間で安定であることを示す。
最後に, 標本化世代が占める幾何学的位置は, 生成品質と強く相関していることを示す。表現空間の中心領域付近に集中する世代は, より信頼性の高い出力に対応する傾向にあるが, 周辺世代は実質的に精度が低い。
本研究は, 自己整合性を, 正確な記号的重なりではなく, 標本の幾何学的構成の特質として捉えることを支援する。
関連論文リスト
- Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency [53.28076739140119]
本稿では,視覚・言語モデル(VLM)における論理的一貫性を幾何学的・言語的双対性演算によって実現する枠組みを提案する。
SAGEは、従来のGRPO法に比べてモデルに依存しず、データ効率が良く、既存のVLMに軽量な後学習段階として適用することができる。
ビデオおよび空間推論ベンチマークの実験では、強いベースラインよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-18T10:05:21Z) - Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty [70.43119366710778]
本稿では,Agens-BRACE: Agent Belief state Representation by Abstraction and Confidence Estimationを紹介する。
LLMエージェントを信頼状態モデルと政策モデルに分離し、強化学習を通じて協調的に最適化する手法である。
長期にわたる部分的に観察可能な言語環境において、平均して+14.5%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2026-05-12T02:37:04Z) - Beyond Activation Alignment: The Geometry of Neural Sensitivity [0.0]
そこで我々は,小摂動を識別する表現能力に着目した,局所的測位可能な情報に基づくフレームワークを提案する。
対称正定値行列の多様体上の対数スペクトル距離を用いてこれらの正規化シグネチャを比較する。
経験的に、このフレームワークは、独立に訓練された人工ニューラルネットワークで対応するレイヤのリカバリを可能にする。
論文 参考訳(メタデータ) (2026-05-04T23:21:24Z) - Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - Restoring Heterogeneity in LLM-based Social Simulation: An Audience Segmentation Approach [1.8505047763172107]
大規模言語モデル(LLM)は、社会的態度や行動のシミュレートにますます利用されている。
現在のシミュレーションの実践は、しばしば多様性を「平均的なペルソナ」に分解し、社会現実の中心となるサブグループの変動をマスキングする。
本研究では,LLMに基づく社会シミュレーションにおける不均一性回復のための体系的アプローチとして,オーディエンスセグメンテーションを導入する。
論文 参考訳(メタデータ) (2026-04-08T04:29:08Z) - Weight-Informed Self-Explaining Clustering for Mixed-Type Tabular Data [63.62853416081748]
WISEは表現、特徴重み付け、クラスタリング、解釈を統一するフレームワークである。
クラスタリングを駆動する同じプリミティブに根ざした、忠実で人間解釈可能な説明を生成する。
論文 参考訳(メタデータ) (2026-04-07T13:18:31Z) - Calibrating Biased Distribution in VFM-derived Latent Space via Cross-Domain Geometric Consistency [52.52950138164424]
特徴抽出にオフザシェルフ(ビジョン)基礎モデルを利用する場合、特徴分布の幾何学的形状はドメインやデータセット間で顕著な伝達性を示す。
我々は,我々の幾何学的知識誘導分布キャリブレーションフレームワークを,フェデレーション学習とロングテール認識の2つの人気かつ挑戦的な設定で具体化する。
長期学習において、サンプル豊富なカテゴリから移動された幾何学的知識を利用して、サンプル・スカース・テールクラスの真の分布を復元する。
論文 参考訳(メタデータ) (2025-08-19T05:22:59Z) - A Unified Contrastive-Generative Framework for Time Series Classification [7.712601563682029]
コントラスト生成時系列フレームワーク(CoGenT)を提案する。
これは、時間的データにおける高いクラス内類似性に対する対照的な学習の感度を克服し、生成的手法の大規模なデータセットへの依存を減らす。
その結果、59.2%と14.27%のF1がスタンドアローンのSimCLRとMAEをそれぞれ上回り、一貫した改善が見られた。
論文 参考訳(メタデータ) (2025-08-13T03:09:14Z) - GCC: Generative Calibration Clustering [55.44944397168619]
本稿では,特徴学習と拡張をクラスタリングに組み込む新しいGCC法を提案する。
まず,実検体と実検体間の固有関係を識別する識別的特徴アライメント機構を開発する。
第二に、より信頼性の高いクラスタ割り当てを生成するための自己教師付きメトリック学習を設計する。
論文 参考訳(メタデータ) (2024-04-14T01:51:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。