論文の概要: Generating a Consistent Enterprise: Synthesis and Reference-Free Evaluation of Multi-System Business Data
- arxiv url: http://arxiv.org/abs/2609.11286v1
- Date: Thu, 10 Sep 2026 09:17:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.280786
- Title: Generating a Consistent Enterprise: Synthesis and Reference-Free Evaluation of Multi-System Business Data
- Title(参考訳): 一貫性のある企業を創出する:マルチシステムビジネスデータの合成と参照フリー評価
- Abstract要約: 本稿では,両端に実際のデータセットを持たないジェネレータについて述べる。
従業員、顧客ベース、販売契約、チケットのサポート、通話記録、チャットメッセージ、ドキュメントなど、完全なフィクション企業を生み出している。
第2のジェネレータは、ビジネス質問のリストからリレーショナルデータベースを構築する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthetic relational data is normally produced by a model trained on a real dataset, and its quality is measured as the distance to that dataset. This paper describes a generator that has no real dataset at either end. Given an industry, a company size, a business model, a set of business applications, and a random seed, it produces a complete fictional enterprise: a workforce, a customer base, sales deals, support tickets, recorded calls, chat messages, and documents, all consistent with one another. One entity graph is projected into the native formats of 66 business products, so the same customer appears in the CRM, the support desk, and the call system under one identity. Because no real counterpart exists, realism is built in from cited reference statistics and verified by reference-free measurement: a five-axis scorecard of 28 statistical checks, an adversarial detector that hunts for the marks of synthetic generation, and a set of soundness checks that include a classifier test against an independently shuffled copy of the data. Because these instruments existed before the generator was tuned, progress is measured under a fixed yardstick: over 23 generated companies, mean realism climbed from 60.3 to 99.1, the weakest company from 41.1 to 94.9, and the detector, which initially flagged 55.2% of all records, now flags none. The scores hold on a seed never used during development. A second generator builds relational databases from a list of business questions. It forces qualifying rows for each answerable question, adds controlled near misses, and computes exact labels from the finished tables. The generator runs as a hosted service at https://console.era.eon.io. A company built there to a specification is served through its simulators over MCP and REST, and the simulators are also published as container images for offline use
- Abstract(参考訳): 合成関係データは、通常、実際のデータセットでトレーニングされたモデルによって生成され、その品質はそのデータセットまでの距離として測定される。
本稿では,両端に実際のデータセットを持たないジェネレータについて述べる。
業界規模、企業規模、ビジネスモデル、一連のビジネスアプリケーション、ランダムなシードによって、労働力、顧客ベース、販売契約、チケットのサポート、通話記録、チャットメッセージ、ドキュメントなど、完全に架空の企業を生み出します。
1つのエンティティグラフは66のビジネス製品のネイティブフォーマットに投影されます。
5軸のスコアカード(28の統計検査)、合成生成の痕跡を探索する敵検出器(英語版)、データの独立にシャッフルされたコピーに対する分類器テストを含む音質チェック(英語版)である。
発電機がチューニングされる前にこれらの機器が存在したため、23以上の発生した企業、平均的リアリズムは60.3から99.1に上昇し、最も弱い会社は41.1から94.9に上昇した。
スコアは、開発中に使用されていないシードに保持されます。
第2のジェネレータは、ビジネス質問のリストからリレーショナルデータベースを構築する。
解答可能な質問ごとに行の資格を強制し、制御された近距離ミスを追加し、完了したテーブルから正確なラベルを計算します。
ジェネレータはhttps://console.era.eon.io.comでホストサービスとして動作する。
そこで構築された会社は、MPPとREST上のシミュレータを通じて提供され、シミュレータも、オフラインで使用するためのコンテナイメージとして発行される。
関連論文リスト
- The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents [0.0]
Era by Eon Benchmarkは、完全なフィクション会社を中心に作られている。
製品シミュレータ、企業固有の内部データベース、ベンチマーク質問、計算された回答キーが含まれている。
23社中の平均リアリズムスコアは61.8から97.0に上昇し、ゼロレコードは合成された。
論文 参考訳(メタデータ) (2026-09-09T08:06:46Z) - Evaluating Generative Time-Series Models on Data with Point Masses [2.5536942228520814]
このようなデータを慎重に評価するとどうなるか報告する。
標準的なローリングオリジンプロトコルは、データセットに似ていない原子構造を持つウィンドウ上でモデルをスコアすることができる。
自己回帰的ハードルは、6つのデータセットのうち5つの条件付きフローを最大133ドルまで上回る。
論文 参考訳(メタデータ) (2026-08-10T14:57:36Z) - EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge [1.0906142150583376]
約50,000のドキュメントを9つのエンタープライズソースタイプに分散したデータセットであるEnterpriseRAG-Benchを提示する。
コーパスは、クロスドキュメントコヒーレンス(共有プロジェクト、人々、イニシアチブで構築されている)で生成され、現実的なノイズで拡張されます。
生成フレームワークにより、チームは、自身の業界、スケール、ソースミックスに合わせて、変種を生成することができる。
論文 参考訳(メタデータ) (2026-05-05T20:23:38Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - Synthetic Tabular Generators Fail to Preserve Behavioral Fraud Patterns: A Benchmark on Temporal, Velocity, and Multi-Account Signals [0.0]
本研究では,4つの行動不正パターン(P1-P4)の分類法を定式化し,事象間タイミング,バースト構造,マルチアカウントグラフモチーフ,速度ルールトリガ率について検討した。
我々は、IEEE-CIS Fraud DetectionとAmazon FraudデータセットでCTGAN、TVAE、GaussianCopula、TabularARGNをベンチマークした。
P1-P4フレームワークは、医療やネットワークセキュリティを含む、エンティティレベルのシーケンシャルデータを持つ任意のドメインに拡張する。
論文 参考訳(メタデータ) (2026-04-13T19:36:00Z) - OrgForge: A Multi-Agent Simulation Framework for Verifiable Synthetic Corporate Corpora [0.0]
本稿では,厳密な物理認識境界を強制するオープンソースのマルチエージェントシミュレーションフレームワークOrgForgeを紹介する。
アクターローカルクロックは、すべてのアーティファクトタイプにわたって因果タイムスタンプの正しさを強制する。
N日間のシミュレーションを実行すると、OrgForgeはインターリーブされたSlackスレッド、チケット、Confluenceページ、Gitのプルリクエスト、Eメールを生成する。
論文 参考訳(メタデータ) (2026-03-16T09:02:24Z) - SynDelay: A Synthetic Dataset for Delivery Delay Prediction [50.56729406793283]
配送遅延予測のための合成データセットであるSynDelayを提案する。
これはサプライチェーンAIにおけるデータセットの共有とベンチマークを促進するオープンイニシアチブである。
論文 参考訳(メタデータ) (2025-08-30T21:54:37Z) - Towards Realistic Evaluation of Commit Message Generation by Matching Online and Offline Settings [77.20838441870151]
オンラインメトリック - VCSに生成されたメッセージをコミットする前にユーザが導入する編集回数 - を使用して、オフライン実験用のメトリクスを選択します。
我々は,GPT-4が生成したコミットメッセージと,人間の専門家が編集したコミットメッセージからなる57対のデータセットを収集した。
以上の結果から,編集距離が最も高い相関性を示すのに対し,BLEUやMETEORなどの類似度は低い相関性を示すことがわかった。
論文 参考訳(メタデータ) (2024-10-15T20:32:07Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - Auditing and Generating Synthetic Data with Controllable Trust Trade-offs [54.262044436203965]
合成データセットとAIモデルを包括的に評価する総合監査フレームワークを導入する。
バイアスや差別の防止、ソースデータへの忠実性の確保、実用性、堅牢性、プライバシ保護などに焦点を当てている。
多様なユースケースにまたがる様々な生成モデルを監査することにより,フレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-21T09:03:18Z) - S3M: Siamese Stack (Trace) Similarity Measure [55.58269472099399]
本稿では、深層学習に基づくスタックトレースの類似性を計算する最初のアプローチであるS3Mを紹介します。
BiLSTMエンコーダと、類似性を計算するための完全接続型分類器をベースとしている。
私たちの実験は、オープンソースデータとプライベートなJetBrainsデータセットの両方において、最先端のアプローチの優位性を示しています。
論文 参考訳(メタデータ) (2021-03-18T21:10:41Z) - A ground-truth dataset and classification model for detecting bots in
GitHub issue and PR comments [70.1864008701113]
ボットはGithubリポジトリで、分散ソフトウェア開発プロセスの一部である反復的なアクティビティを自動化するために使用されている。
本稿では,5000のGithubアカウントのプルリクエストとコメント発行に関する,高い相互契約を伴う手動分析に基づいて,基幹トラスデータセットを提案する。
ボットを検出する自動分類モデルを提案し,各アカウントの空のコメント数と空でないコメント数,コメントパターンの数,コメントパターン内のコメント間の不平等を主特徴とする。
論文 参考訳(メタデータ) (2020-10-07T09:30:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。