論文の概要: Creativity, honesty and designed forgetting emerge in small hyperbolic language models
- arxiv url: http://arxiv.org/abs/2607.09306v1
- Date: Fri, 10 Jul 2026 11:39:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.834746
- Title: Creativity, honesty and designed forgetting emerge in small hyperbolic language models
- Title(参考訳): 小さな双曲型言語モデルにおける創造性、誠実さ、設計上の忘れの出現
- Authors: Kwan Soo Shin, In Seok Kang, Yunkyung Min,
- Abstract要約: 言語モデルはスケールに最適化されているが、相補的ではなく機能的である。
アシスタントが仲間にパーソナライズされると、それは静かに誰かになり、そのユーザーを傷つける特性を静かに取得できる。
仲間が何になり、何になる価値があるのかは、信頼できる手段を持っていません。
ここでは、3つの小さな言語モデルが双曲的基質を共有していることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are optimised for scale, yet remain functional rather than companionable, and as an assistant personalises into a companion, accumulating memory of one user, it quietly becomes someone, and can silently acquire traits that harm that user. What a companion is becoming, and what would make it worth becoming, has no reliable instrument: trained human raters cannot agree on the answer (Fleiss kappa = 0.074). Here we show that three small language models (146 M to 3 B parameters) sharing a hyperbolic substrate answer both halves of that question. A 146 M behavioural auditor, trained from scratch, detects the compliance gap that those raters cannot (90.7% binary-compliance accuracy); a linear read-out of its frozen representation further detects companion-induced sycophancy, dependence-fostering and confabulated memories on generator families unseen in training (AUROC 0.804 under style-controlled, leave-one-generator-out evaluation, versus 0.721 for a frontier zero-shot judge on the same items). A creative frame-seeder is preferred in 100% of 311 decided pairwise comparisons over four prompting baselines. A memory operating system implements designed forgetting, M(t) = S*exp(-lambda*t), whose predicted skeleton-wallpaper partition emerges only under selective retrieval gating in a four-condition pilot. Creativity, honesty and designed forgetting constitute a small-model route to trustworthy companion AI.
- Abstract(参考訳): 言語モデルは、スケールのために最適化されるが、相補的ではなく機能的であり、アシスタントは、あるユーザのメモリを蓄積する仲間にパーソナライズするので、静かに誰かになり、そのユーザを傷つける特性を静かに取得することができる。
訓練された人間のラテンダーは、答えに同意できません(Fleiss kappa = 0.074)。
ここでは、3つの小言語モデル(146M〜3Bパラメータ)が双曲的基質を共有していることを示す。
スクラッチからトレーニングされた146Mの行動監査機は、それらのラッカーができないコンプライアンスギャップ(90.7%のバイナリコンプライアンス精度)を検出し、凍結された表現の線形読み出しは、訓練中に見えないジェネレータファミリーの共起性、依存フォスター、共有メモリをさらに検出する(AUROC 0.804は、スタイル制御された1世代アウトの評価で、同じアイテム上のフロンティアゼロショットの裁判官は0.721である)。
創造的なフレームシーダは、4つのプロンプトベースラインよりも311の判定されたペアワイズ比較の100%で好まれる。
M(t) = S*exp(-lambda*t) と予測される骨格壁のパーティションは、4条件のパイロットで選択的な検索ゲーティングの下でのみ現れる。
創造性、誠実さ、そしてデザインされた忘れ物は、信頼できるAIへの小さなモデルルートを構成する。
関連論文リスト
- Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - SocialMemBench: Are AI Memory Systems Ready for Social Group Settings? [0.0]
AIアシスタントのメモリシステムは、シングルユーザー対話用に構築され、マルチパーティのソーシャルグループ設定に適用した場合、特徴的にフェールする。
既存のメモリベンチマークでは、ダイアディックや職場での対話が評価されている。
人工ソーシャルグループネットワークのベンチマークであるSocialMemBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-18T03:11:48Z) - SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation [46.48800527703154]
SpeechParaling-Benchは、パラ言語対応音声生成のための総合的なベンチマークである。
既存のカバレッジを50未満から100以上のきめ細かい機能に拡張する。
微粒化制御、発声内変動、文脈認識適応の3つの課題に分けられる。
論文 参考訳(メタデータ) (2026-04-22T17:59:58Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection [0.0]
本稿では,決定論的シミュレーションエンジンが基底真理を維持し,言語モデルが表面の散文のみを生成する検証可能な合成ベンチマークを提案する。
コーパスは51日の模擬日、2,904回のテレメトリ記録を96.4%のノイズレートで記録し、単面と単日のトリアージ戦略を破るために設計された4つの検出シナリオをカバーしている。
論文 参考訳(メタデータ) (2026-03-23T19:03:53Z) - PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory [56.81126490418336]
パーソナライゼーションは、AI能力とアライメントの進歩における次のマイルストーンの1つだ。
PersonaMem-v2は300以上のシナリオ、20,000以上のユーザの好み、128kのコンテキストウィンドウで、1,000の現実的なユーザ-チャットボットインタラクションをシミュレートする。
我々はQwen3-4BをトレーニングしてGPT-5を上回り、暗黙のパーソナライゼーションにおいて53%の精度を達成した。
論文 参考訳(メタデータ) (2025-12-07T06:48:23Z) - Navigating the Synchrony-Stability Frontier in Adaptive Chatbots [0.0]
コア設計の緊張を明示する計算評価フレームワークを提案する。
人間のログデータセットに対する明示的な適応ポリシーをシミュレートし比較する。
限定されたポリシーは、同期に控えめなコストで、安定性の大幅な向上を実現している。
我々は、フロンティアポリシーが命令のチャーンを減らし、ジャリングレジスタのフリップを減らしたことを示す「素早い正当性」を定量化する。
論文 参考訳(メタデータ) (2025-09-30T22:50:30Z) - The Adaptation Paradox: Agency vs. Mimicry in Companion Chatbots [0.0]
視覚的ユーザオーサシップと包括的言語スタイルの模倣の2つの経路をテストする。
ユーザ主導のパーソナライゼーションとスタイリスティックなシフトの制限を優先すべきである。
論文 参考訳(メタデータ) (2025-09-16T00:02:27Z) - Less Likely Brainstorming: Using Language Models to Generate Alternative
Hypotheses [45.720065723998225]
我々は、人間が関連性があると思われるが、起こりそうにないアウトプットを生成するためにモデルに要求する新しいタスク「非インブレインストーミング」を導入する。
目標として仮説の可能性が低いトレーニングのベースラインアプローチは、人間がほぼ半分の確率または無関係であると評価するアウトプットを生成する。
そこで本研究では,新たなコントラスト学習手法を用いたテキスト生成手法を提案する。
論文 参考訳(メタデータ) (2023-05-30T18:05:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。