論文の概要: When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents
- arxiv url: http://arxiv.org/abs/2607.18261v1
- Date: Sat, 16 May 2026 11:13:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.09462
- Title: When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents
- Title(参考訳): JSONが不十分な場合:スキーマ制約 LLM 順序付けエージェントのセマンティック信頼性
- Authors: Yin Li,
- Abstract要約: OrderBenchは、レストランの注文エージェントに関する決定論的ベンチマークである。
スキーマ値の出力は、いまだに大きなセマンティックエラー率を持つことができる。
最強のモデルでは、どちらのモードも100%の妥当性を達成するが、セマンティックな成功は80%近くである。
- 参考スコア(独自算出の注目度): 6.901585308625979
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents are increasingly used as transaction compilers: a user states an intent in natural language, and the model emits a structured object that an API can execute. JSON Schema and provider-level structured-output modes are useful because they remove a large class of parse failures, but they do not by themselves decide whether the object is a safe, faithful transaction. We introduce OrderBench, a deterministic benchmark for restaurant ordering agents that separates syntactic validity, schema validity, status decisions, exact item semantics, constraint preservation, and unsafe acceptances. Across 2,400 Nebius Token Factory calls to four open models in prompt-only and JSON-schema modes, we find that schema-valid output can still have large semantic error rates. In the strongest model, both modes achieve 100% schema validity, yet semantic success remains near 80%; in weaker models, schema-valid unsafe acceptances occur in double digits. The result is a concrete engineering warning: structured output is a necessary interface layer, not a substitute for domain verification and fail-closed execution.
- Abstract(参考訳): LLMエージェントは、自然言語でインテントを記述し、モデルはAPIが実行できる構造化オブジェクトを出力する。
JSONスキーマとプロバイダレベルの構造化アウトプットモードは、大規模なパース障害を取り除くため有用だが、オブジェクトが安全で忠実なトランザクションであるかどうかをそれ自体が決定するわけではない。
OrderBenchは、レストラン注文エージェントのための決定論的ベンチマークで、構文的妥当性、スキーマの妥当性、状態決定、正確なアイテムセマンティクス、制約保存、安全でない受け入れを分離する。
2400人以上のNebius Token FactoryがプロンプトオンリーとJSON-スキーマモードで4つのオープンモデルを呼び出すと、スキーマ値の出力は大きなセマンティックエラー率を持つ可能性があることが分かりました。
最強のモデルでは、どちらのモードも100%スキーマの妥当性を達成するが、セマンティックな成功は80%近くであり、弱いモデルでは、スキーマの無効な受け入れは2桁で発生する。
構造化された出力は必要なインターフェース層であり、ドメイン検証やフェールクロースの実行に代わるものではない。
関連論文リスト
- On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models [0.0]
我々は、制御権威行動を伴うプロンプトアクションモデルとして、誘導されたシステムを定式化する。
共有パイプライン内では,SFC(Semantic-Faithful Control)が実現不可能であることを示す。
根本原因とそれが要求するソリューションのクラスを特定します。
論文 参考訳(メタデータ) (2026-06-25T21:52:29Z) - Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models [0.0]
解析データベースの自然言語クエリ用にデプロイされたLLMは、2つの障害に悩まされる。
ClickHouseのCleaned Contoso Retailデータセットに対して,100の自然言語質問に対して,3つのフロンティアLSMをベンチマークした。
論文 参考訳(メタデータ) (2026-04-28T02:53:23Z) - Schema First Tool APIs for LLM Agents: A Controlled Study of Tool Misuse, Recovery, and Budgeted Performance [0.0]
厳密な相互作用予算の下で、スキーマベースのツール契約と構造化診断によって信頼性が向上するかどうかを検討する。
ログ、メトリクス、設定、バリデーションタスクを備えた決定論的ソフトウェアエンジニアリングサンドボックスを実装します。
エンドタスクの成功、誤用、実行失敗、セマンティック誤用、リカバリ動作、タイムアウトを報告します。
論文 参考訳(メタデータ) (2026-03-12T07:11:16Z) - ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement [57.98138819417949]
テキスト・ツー・クエリを明示的にモデル化するフレームワークであるErrorLLMを提案する。
ErrorLLMは、バックボーンの初期生成よりも大幅に改善されていることを示す。
ErrorLLMは、精錬効率を維持しつつ、高い検出F1スコアで両面に対処する。
論文 参考訳(メタデータ) (2026-03-04T05:27:20Z) - PromptPort: A Reliability Layer for Cross-Model Structured Extraction [0.11280931253550518]
LLMによる構造化抽出は、モデルが理解できないためではなく、出力フォーマットがモデルやプロンプト間で信頼できないため、本番環境では失敗する。
本稿では,決定論的正準化と軽量検証器(DistilBERT)と安全オーバライドポリシを組み合わせた信頼性層であるPromptPortを提案する。
この方法は、保留モデルファミリに一般化し、不確実な場合には明示的な棄権を与え、プロダクションデプロイメントにおける信頼性の高い構造化抽出を可能にする。
論文 参考訳(メタデータ) (2026-01-06T03:54:27Z) - Text2Mem: A Unified Memory Operation Language for Memory Operating System [59.082901444153684]
モデルエージェントのための統一メモリ操作言語であるText2Memを紹介する。
Text2Memは、自然な正確性を保証するための標準化されたパスを提供する。
論文 参考訳(メタデータ) (2025-09-14T07:30:09Z) - AI-assisted JSON Schema Creation and Mapping [0.0]
本稿では,大規模言語モデル(LLM)と決定論的手法を組み合わせて,ユーザによる自然言語入力に基づく生成,修正,スキーママッピングを実現するハイブリッドアプローチを提案する。
この作業は、非専門家のための構造化データモデリングとデータ統合に対する障壁を著しく減らします。
論文 参考訳(メタデータ) (2025-08-07T09:27:10Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Learning to Generate Structured Output with Schema Reinforcement Learning [83.09230124049667]
本研究では,大規模言語モデル(LLM)の構造的生成能力について検討する。
最新のLLMはまだ有効な文字列を生成するのに苦労している。
我々のモデルでは、出力と下流の両方のタスクが大幅に改善されている。
論文 参考訳(メタデータ) (2025-02-26T06:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。