論文の概要: TWIST: A Proposed Benchmark for Intervention Quality in Conversational Memory, with a Human-Validated Draft-Alignment
- arxiv url: http://arxiv.org/abs/2609.28575v1
- Date: Wed, 23 Sep 2026 12:25:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.414635
- Title: TWIST: A Proposed Benchmark for Intervention Quality in Conversational Memory, with a Human-Validated Draft-Alignment
- Title(参考訳): TWIST : 対話記憶における干渉品質のベンチマーク
- Abstract要約: TWISTは、補完的かつ未測定なプロパティ、介入品質のためのベンチマークスイートである。
4つのトラックは、未解決の緊張検知をカバーし、現在の信念に応えて、記録に反するドラフトを検証している。
システムTWISTプロファイルはリコールスコアの他に、メモリがいつ介入すべきかを計測する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-conversation memory benchmarks increasingly test recall and prompted knowledge updates, and recent work studies evolving user beliefs and memory state. TWIST is a proposed benchmark suite for a complementary, unmeasured property: intervention quality -- whether a deployed memory system, exercised through its own ingest/recall/vet surface, acts correctly at belief change points. Four tracks cover unprompted tension detection, vetting outgoing drafts against the record, answering with current beliefs while preserving supersession history, and governing sensitive recall. The suite extends LoCoMo's corpora and harness, pairing every detect/block metric with a matched do-not-over-detect control: surface-matched hard negatives price false intervention, so no track can be gamed by flagging everything. The benchmark itself is validated first: independent, gold-blind double annotation with adjudication, judge decoy calibration, and a separability audit. On the human-validated Track B v1.0 key (161 items, post-adjudication kappa = 0.85), no tested configuration simultaneously achieves high contradiction recall, high hard-negative specificity, and high attribution: flat-RAG baselines detect 0.76-0.97 of true contradictions but falsely flag 16-43% of surface-matched safe drafts depending on backend, while a deployed coherence-oriented system almost never over-flags (0.98-1.00 specificity) yet catches 42% of true contradictions -- a trade-off no recall-only score can see. A 13-configuration baseline ladder localizes causes: every gold contradiction is detectable from its evidence alone (recall 1.000), calibrated models nearly solve the track given the full transcript -- consistent with substantial retrieval-coverage gaps -- and draft-only floors reveal model-dependent style priors. A system's TWIST profile, beside its recall score, measures whether memory knows when to intervene and when not to.
- Abstract(参考訳): 長期会話メモリベンチマークは、リコールテストと知識更新の促進、および最近の研究は、ユーザの信念と記憶状態の進化について研究している。
TWISTは、補完的で未測定なプロパティのためのベンチマークスイートである。 介入品質 -- デプロイされたメモリシステムが独自のインジェクション/リコール/ベットサーフェスを通じて実行されたとしても、信念の変更点において正しく動作する。
4つのトラックは、予期せぬ緊張の検出、記録に反するドラフトの検証、現在の信念への回答、スーパーセッション履歴の保存、微妙なリコールの管理をカバーしている。
このスイートはLoCoMoのコーパスとハーネスを拡張し、すべての検出/ブロックメトリックと一致しない検出制御をペアリングする。
ベンチマーク自体が最初に検証されるのは、独立して金色の二重アノテーション、デコイ校正の判断、分離性監査である。
フラットRAGベースラインは、真の矛盾の0.76-0.97を検知するが、偽のフラグは16-43%であり、デプロイされたコヒーレンス指向のシステムは、ほとんどオーバーフラグ(0.98-1.00の特異性)をほとんど達成しないが、真の矛盾の42%をキャッチする。
13-configurationのベースラインのはしごは原因をローカライズする: 全ての金の矛盾は証拠だけで検出できる(リコール1万)。
システムのTWISTプロファイルは、リコールスコアの横に、メモリがいつ介入すべきか、いつ介入すべきでないかを計測する。
関連論文リスト
- Correct Now, Insufficient Later: Auditing Update Sufficiency in Context Compression [0.0]
メモリは、後の更新で要求される区別を捨てながら、現在のクエリに正しく答えることができる。
我々はこの失敗を2つの歴史監査で調査する。
パイロットは6つの合成機構の24の履歴ペアを評価する。
論文 参考訳(メタデータ) (2026-09-17T10:51:37Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions [34.277389276831435]
本研究では,2つの長期的障害について検討する。「人的崩壊」,展開された役割の喪失,境界,値,スタイル,および「行動漂流」である。
本稿では,人的行為とトラジェクティブリコールを別々に計測する制御型総合監査システムANCHORを紹介する。
この研究には、27人のペルソナにまたがる2,008の会話、9つのインタラクションスケジュール、3つの生成されたメモリ設定、そして4つの評価モデルが含まれている。
論文 参考訳(メタデータ) (2026-07-30T20:18:39Z) - Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong [1.2744523252873352]
ブラックボックス(行動)によるFaithCoT-Benchの人間のアノテーションに対する不誠実なCoTの検出。
答えの正しさはあらゆるレベルで問題を構成する。
論文 参考訳(メタデータ) (2026-07-26T04:43:53Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know" [47.930782177987446]
大規模言語モデルは、クローズドブックの質問応答において知識限界を認識するのに苦労することが多く、自信ある幻覚へと繋がる。
我々は、モデルスケールの異なるDirect、Assistive、Incrementalの3つのタスク等価プロンプトとマルチホップQAベンチマークを評価した。
幻覚が一致している間に事実知識が安定しているため、クロスレジームは内部の不確実性の正確なシグナルを与える。
論文 参考訳(メタデータ) (2026-02-04T18:39:58Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Uncertainty-aware Unsupervised Multi-Object Tracking [33.53331700312752]
教師なしマルチオブジェクトトラッカーは、信頼できる機能埋め込みの学習に劣る。
最近の自己監督技術は採用されているが、時間的関係を捉えられなかった。
本稿では、不確実性問題は避けられないが、不確実性自体を活用して学習された一貫性を向上させることができると論じる。
論文 参考訳(メタデータ) (2023-07-28T09:03:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。