論文の概要: TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments
- arxiv url: http://arxiv.org/abs/2607.12480v1
- Date: Tue, 14 Jul 2026 08:08:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.083922
- Title: TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments
- Title(参考訳): TRACE: Auditable Agentic Commitments の操作推論方式
- Abstract要約: TRACE (Typed Reasoning And Commitment Evidence) は、推論トレースを記録するためのタイプ付きバージョン付きスキーマである。
論文は3つのレイヤで、推論は言語モデルにはない、と論じている。
レコード消費者契約は、レコードが保証するものと、その見返りに消費者が尊重すべきものを記述する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper defines TRACE (Typed Reasoning And Commitment Evidence): a typed, versioned schema for recording reasoning traces, a reference procedure for writing records against it, and one operating discipline, no durable state change without a record. The paper argues in three layers that reasoning is not in the language model: the autoregressive mechanism natively computes association; chain-of-thought and reinforcement learning inherit its limits; and the formal constructs of reasoning theory, from Socratic procedure to Pearl's ladder, are absent as machinery. The schema answers the absence with fields and tests: the TraceRecord and its causal specialization, an eight-stage reference writer, a gate-first measurement regime, the TRACE-Bench protocol, and the consumers, memory admission, plan gating, temporal regret, and verdict reuse, whose more auditable decisions are the measure of the record. A record-consumer contract states what a record guarantees and what a consumer must honor in return, making the schema an operational interface rather than a passive document. Two worked examples run in the main text: a music-lessons argument traced from sentence to typed verdict, separating association, intervention, and prescription; and a flood search-and-rescue vignette in which a predictive world model reports confident plan success that its own support and out-of-distribution scores contradict, so the record defers the commitment, requests a bounded observation, revises append-only, and clears a different branch. The vignette is illustrative, not empirical; closed-loop evaluation is left to future work, so the contribution is the schema and its contract, not a performance claim. Appendices carry the full schema, writer algorithms and cost model, clinical and policy illustrations, the benchmark protocol, convergence metrics, and usage scenarios.
- Abstract(参考訳): 本稿では, TRACE (Typed Reasoning And Commitment Evidence: Typed Reasoning And Commitment Evidence): 推論トレースを記録するための型付きバージョンスキーマ, レコードに対して記録を書くための参照手順, および1つの操作規律を定義する。
自己回帰的なメカニズムは関連性をネイティブに計算し、チェーン・オブ・シンキングと強化学習はその限界を継承し、ソクラテスの手続きからパールのはしごまで、推論理論の形式的な構成は機械として欠落している。
TraceRecordとその因果関係の特殊化、8段階のリファレンスライター、ゲートファースト測定システム、TRACE-Benchプロトコル、そしてコンシューマ、メモリインプット、プランゲーティング、時間的後悔、そして検証再利用といった、より監査可能な決定がレコードの測定である。
レコード消費者契約は、レコードが保証するものと、その見返りとしてコンシューマが何を尊重するかを記述し、スキーマを受動的文書ではなく運用インターフェースにする。
文から入力された評決まで追跡された音楽のない議論、関連性、介入、処方の分離、そして、予測の世界モデルが自信を持って計画の成功を報告し、自身のサポートと分配のスコアが矛盾していると報告する洪水探索と救助のヴィグネット、そしてレコードはコミットメントを否定し、限定された観察を要求し、追加のみを修正し、別のブランチをクリアする。
ウィグネットは実証的なものではなく、実証的なものであり、クローズドループの評価は将来の作業に委ねられている。
Appendiceには、完全なスキーマ、ライターアルゴリズム、コストモデル、臨床およびポリシー図、ベンチマークプロトコル、収束メトリクス、利用シナリオが含まれている。
関連論文リスト
- From Experiments to Decisions: Reusing Evidence in Autonomous Coding Research [0.0]
我々は400タスクのNeuroGolfキャンペーンでエビデンスをどのように再利用するかを再構築する。
数値的な反例は、オーバーブロード排除を公開する。
他のエピソードでは、失敗、不完全、そして修正されたプログラムが次に行うことを正当化する。
論文 参考訳(メタデータ) (2026-09-10T03:48:31Z) - Noēsis: Deterministic-First Retrieval with Two-Tier Context Hydration for Factuality-Critical Queries on Small Local Models [0.0]
我々は、Noesisアーキテクチャの決定論的第一のクエリプレーンであるNoesisを提示する。
ノイズは生成前にすべての決定論的判断を下す。
報告されたすべての値は、その正確なソースと構築による位置にトレース可能である。
論文 参考訳(メタデータ) (2026-09-07T15:49:16Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Separating Disclosure from Authorization: Field-Tier Minimization for Agent Action Mediation [0.0]
動作を認可するシステムは、その決定を十分に確認し、その決定を証明したシステムは監査に十分な記録をしなければならないことを示す。
各アクションクラスではなく、各パラメータフィールドを3つの層に分類する。
台帳のコミットメントは、完全な、最小化されていないパラメータの標準ダイジェストである、という中心的な性質がある。
論文 参考訳(メタデータ) (2026-08-26T07:45:05Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review [2.531440973296736]
このビジョンとプロトコルペーパーは、コードファーストピアレビューを提案する。
著者は、実行可能な研究成果物と最小限のクレームマニフェストを提出する。
会場に制御されたAIシステムは環境を構築し、実験を実行し、コードパスを監査し、証拠のクレームをマップし、人間レビュアーのための標準化されたレビューパッケージを生成する。
論文 参考訳(メタデータ) (2026-06-05T01:26:07Z) - TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory [22.85129722207174]
矛盾の解決は書き込み時の制御であり、欠落した契約を明確にすることを示しています。
TOKIは、二重行スキーマ上での2時間演算子の1つのファミリとして、四重項をタイプする。
8つのシステムにまたがる判定行列はギャップをローカライズする: 書き込みパス上の言語モデル判断を保持するすべてのベースラインは、3つの書き込み時異常のうちの少なくとも1つを許容する。
論文 参考訳(メタデータ) (2026-06-04T14:46:52Z) - CellScientist: Dual-Space Hierarchical Orchestration for Closed-Loop Refinement of Virtual Cell Models [62.281480231694]
VCM(Virtual Cell Modeling)は、摂動応答を予測できるだけでなく、予測が失敗した場合にターゲットリビジョンをサポートするモデルを必要とする。
現在のLCM支援モデリングでは、予測誤差が実行可能実装を通して観測されるという改善ルーティング問題に直面している。
提案するCellScientistは,高レベル仮説空間と低レベル実行可能実装空間を結合した,二重空間階層型フレームワークである。
論文 参考訳(メタデータ) (2026-05-08T06:40:24Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - Memory in Large Language Models: Mechanisms, Evaluation and Evolution [8.158439933515131]
我々は,4つの分類法(パラメトリック,文脈,外部,手続き/エピソード)とメモリ四倍法(ロケーション,永続性,書き込み/アクセスパス,制御性)を提案する。
DMM Gov: DAPT/TAPT, PEFT, モデル編集(ROME, MEND, MEMIT, SERAC)、RAGをコーディネートして監査可能なループを形成する。
これにより、再現可能で、同等で、統制可能な、研究と展開のための座標系が得られる。
論文 参考訳(メタデータ) (2025-09-23T10:06:58Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z) - SNaC: Coherence Error Detection for Narrative Summarization [73.48220043216087]
SNaCは長文の微粒化アノテーションに根ざした物語コヒーレンス評価フレームワークである。
本稿では,生成した物語要約におけるコヒーレンスエラーの分類法を開発し,150冊の本や映画の脚本要約にまたがる6.6k文のスパンレベルアノテーションを収集する。
我々の研究は、最先端の要約モデルによって生成されるコヒーレンスエラーの最初の特徴と、群衆アノテータからコヒーレンス判断を引き出すためのプロトコルを提供する。
論文 参考訳(メタデータ) (2022-05-19T16:01:47Z) - Does Recommend-Revise Produce Reliable Annotations? An Analysis on
Missing Instances in DocRED [60.39125850987604]
テキスト修正方式は, 偽陰性サンプルと, 人気エンティティや関係性に対する明らかな偏見をもたらすことを示す。
より信頼性の高いドキュメントREモデルのテストセットとして機能するように、relabeledデータセットがリリースされている。
論文 参考訳(メタデータ) (2022-04-17T11:29:01Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。