論文の概要: TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation
- arxiv url: http://arxiv.org/abs/2606.15074v1
- Date: Sat, 13 Jun 2026 03:03:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.76622
- Title: TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation
- Title(参考訳): TriAdReview: マルチモデル技術ドキュメント生成のための三角形逆レビューアーキテクチャ
- Authors: Zhiqiang Zhou, Junliang Dai, Xu Ling,
- Abstract要約: TriAdReviewは2つの独立したレビュアーモデルを採用している三角形の逆レビューアーキテクチャである。
3つの構成を用いて5つのベンチマークタスクのTriAdReviewを評価する。
- 参考スコア(独自算出の注目度): 4.131782714245991
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used for technical document generation, yet single-model outputs often suffer from over-engineering, security blind spots, and incomplete coverage. We propose TriAdReview, a triangular adversarial review architecture that employs two independent reviewer models (engineering and boundary perspectives) and a triangular judging mechanism to iteratively improve a generator model's output. We evaluate TriAdReview across five benchmark tasks - architecture design, code generation, proposal review, security audit, and requirements analysis - using three configurations: single model (baseline), dual model (single review), and triple model (full system). Results across 75 experiments (n=5 per cell) show that the triple model configuration achieves a 10.1% overall improvement over the single model baseline (26.2 vs. 23.8 out of 50; p<0.05, paired t-test), with particularly strong gains on security audit (+27.6%), code generation (+20.8%), and architecture design (+15.6%). A second scorer (mimo-v2.5-pro) confirms the direction with a smaller effect (+2.7%), suggesting moderate inter-rater agreement. However, the system shows a -7.5% degradation on requirements analysis, revealing that adversarial review architectures have a structural bias toward simplification that is counterproductive for completeness-oriented tasks. We analyze this boundary condition through a task-type framework and demonstrate that reviewer prompt adaptation partially mitigates the issue. Our findings provide the first empirical characterization of when multi-model adversarial review helps versus harms, with implications for the design of collaborative AI systems.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ますます技術ドキュメント生成に使われているが、シングルモデル出力はオーバーエンジニアリング、セキュリティの盲点、不完全なカバレッジに悩まされることが多い。
本稿では,2つの独立したレビュアモデル(エンジニアリングとバウンダリの視点)と,ジェネレータモデルの出力を反復的に改善するための三角判定機構を用いた三角形逆レビューアーキテクチャであるTriAdReviewを提案する。
アーキテクチャ設計、コード生成、提案レビュー、セキュリティ監査、要求分析の5つのベンチマークタスクに対して、単一モデル(ベースライン)、二重モデル(シングルレビュー)、三重モデル(フルシステム)の3つの設定を使用して、TriAdReviewを評価する。
75実験(n=5セル)の結果、シングルモデルベースライン(50点中26.2対23.8点、p<0.05対t-test)よりも10.1%向上し、特にセキュリティ監査(+27.6%)、コード生成(+20.8%)、アーキテクチャ設計(+15.6%)が大幅に向上した。
第2スコア(mimo-v2.5-pro)は、より小さな効果(+2.7%)で方向を確認する。
しかし、このシステムは要求分析の7.5%の劣化を示し、敵のレビューアーキテクチャは、完全性指向のタスクでは非生産的な単純化に対する構造的バイアスを持つことを示した。
本稿では,この境界条件をタスク型フレームワークを用いて解析し,レビュアーの適応が部分的に軽減されることを実証する。
我々の研究は、マルチモデル逆境レビューが害にどう役立つか、そして協調型AIシステムの設計にどう影響するか、という経験的特徴を初めて与えている。
関連論文リスト
- Philosophical Dispositions as Behavioral Constraints for AI-Assisted Code Review: An Empirical Study [0.0]
哲学的な配置を通してAIレビュアーの行動を制限するシステムを提案する。
それぞれの分布は(それがすることを拒否して)好意的に定義される
5つのプログラミング言語にまたがる7つのレポジトリ間で50のプルリクエストをマージしたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T23:57:25Z) - Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation [65.7390808636333]
マルチラウンド・リフレクティブ・ビジュアル・ジェネレーション(RVG)を実現するためのコア・フレームワークとしてReason-Reflect-Rectify(R3)ループを形式化する。
R3-Benchは600以上のエキスパートアノテーション付きインスタンスのベンチマークで、反復的推論と修正機能を定量化します。
実験の結果、R3-RefinerはR3-Benchを大幅に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:24:31Z) - RefEvo: Agentic Design with Co-Evolutionary Verification for Agile Reference Model Generation [17.822629270807283]
RefEvoはアジャイルで信頼性の高い参照モデリング用に設計された動的マルチエージェントフレームワークである。
RefEvoが95%のパスレートを達成し、静的なベースラインを大きなマージンで上回ることを示す。
論文 参考訳(メタデータ) (2026-04-27T09:22:02Z) - Durable Evaluation Framework: Adversarial Arbitration for Sycophancy Reduction in Large Language Models [0.0]
本稿では、Durable Evaluation Framework Arbitrationの迅速なインスタンス化について評価する。
DEF Arbitrationは、反対のDEFに調整された2つのモデル間の調停によって、IDフレームのシコファンシーを緩和する。
論文 参考訳(メタデータ) (2026-04-21T10:30:25Z) - MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - Structured Intent as a Protocol-Like Communication Layer: Cross-Model Robustness, Framework Comparison, and the Weak-Model Compensation Effect [0.0]
本稿では、AIモデル、言語、プロンプトフレームワーク間で、確実に構造化された意図表現がいかにユーザ目標を保っているかを検討する。
構造的プロンプトは、非構造的ベースラインに対する言語間スコアのばらつきを著しく低減する。
ユーザ調査では、AIが拡張した5W3Hは、インタラクションラウンドを60%削減し、ユーザの満足度を3.16から4.04に向上させる。
論文 参考訳(メタデータ) (2026-03-31T16:20:28Z) - Brevity Constraints Reverse Performance Hierarchies in Language Models [0.0]
ベンチマーク問題の7.7%では、より大きな言語モデルは10-100倍のパラメータにもかかわらず、より小さな言語モデルよりも28.4ポイント低い。
我々は,このメカニズムを,過度な作業を通じてエラーを発生させる自発的なスケール依存的冗長性として認識する。
この結果から,大規模モデルの性能を最大化するには,スケールアウェア・プロンプト・エンジニアリングが必要であることが判明した。
論文 参考訳(メタデータ) (2026-03-11T06:47:41Z) - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [71.3555284685426]
本稿では,双方向機能相乗効果を評価するためのベンチマークであるRealUnifyを紹介する。
RealUnifyは、10のカテゴリと32のサブタスクにまたがる、細心の注意を払ってアノテートされた1000のインスタンスで構成されている。
現在の統一モデルは、効果的な相乗効果を達成するのに依然として苦労しており、アーキテクチャの統一だけでは不十分であることを示している。
論文 参考訳(メタデータ) (2025-09-29T15:07:28Z) - SpecEval: Evaluating Model Adherence to Behavior Specifications [63.13000010340958]
提供者仕様に対してモデルを監査する自動化フレームワークを導入します。
私たちの中心となる焦点は、プロバイダ仕様とモデルアウトプット、および審査員としての自身のモデルの間の3つの方法の整合性にあります。
当社のフレームワークは、100以上の行動ステートメントにわたる6人の開発者から16のモデルに適用し、プロバイダ間で最大20%のコンプライアンスギャップを含む、体系的な不整合を見つけました。
論文 参考訳(メタデータ) (2025-09-02T16:18:40Z) - Hybrid-Segmentor: A Hybrid Approach to Automated Fine-Grained Crack Segmentation in Civil Infrastructure [52.2025114590481]
エンコーダ・デコーダをベースとした手法であるHybrid-Segmentorを導入する。
これにより、モデルは、様々な種類の形状、表面、き裂の大きさを区別する一般化能力を向上させることができる。
提案モデルは,5つの測定基準(精度0.971,精度0.804,リコール0.744,F1スコア0.770,IoUスコア0.630)で既存ベンチマークモデルより優れ,最先端の状態を達成している。
論文 参考訳(メタデータ) (2024-09-04T16:47:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。