論文の概要: Repository-Aware Metamorphic Relation Generation for Augmented Reality Applications using Large Language Models
- arxiv url: http://arxiv.org/abs/2607.28775v1
- Date: Thu, 30 Jul 2026 18:54:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.452894
- Title: Repository-Aware Metamorphic Relation Generation for Augmented Reality Applications using Large Language Models
- Title(参考訳): 大規模言語モデルを用いた拡張現実アプリケーションのためのリポジトリ・アウェアなメタモルフィック関係生成
- Abstract要約: メタモルフィックテスティング(MT)は、テストオラクルを定義することなく、ソフトウェアをテストするための有望なアプローチを提供する。
我々は、リポジトリレベルのコンテキストと推論オーケストレーションを使用してMRを生成し、洗練するコンテキスト対応パイプラインを導入する。
この結果から,レポジトリを意識したMR生成と推論に基づくリファインメントを組み合わせることで,信頼性の高いドメイン関連テストオーラクルをスケーラブルに構築できることが示唆された。
- 参考スコア(独自算出の注目度): 1.5369895042965263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Metamorphic Testing (MT) provides a promising approach for testing software without defined test oracles by specifying expected relations between inputs and outputs, instead of relying on exact outputs. For example, testing Augmented Reality (AR) applications is challenging due to dynamic interactions between virtual content, physical environments, and code, which make traditional test oracles difficult to define. However, formulating metamorphic relations (MRs) is time-consuming and burdensome. We introduce a context-aware pipeline that generates and refines MRs using repository-level context and reasoning orchestration, evaluated on a dataset of 142 mobile AR system repositories. Across three context configurations generating 14,916 candidate MRs, hierarchical context yielded the broadest coverage (7,004 MRs across 142 repositories and 5,167 class--method pairs) and lower redundancy. An agentic deliberation process then reconciled conflicting candidates---observed in 79.0% of cases---reducing duplication and selecting context-aware relations in 88.2% of outcomes. A manual oracle study shows refined relations (n = 141) are both logically valid and sufficiently concrete to be directly translated into test assertions, and a preliminary case study reveals converting generated MRs (n = 5) into executable tests can detect non-equivalent mutations in real-world code. Overall, our results show that combining repository-aware MR generation with reasoning-based refinement enables scalable construction of reliable, domain-relevant test oracles.
- Abstract(参考訳): メタモルフィックテスト(MT)は、正確なアウトプットに頼るのではなく、入力とアウトプットの間に期待される関係を規定することによって、テストのオーラクルを定義せずにソフトウェアをテストするための有望なアプローチを提供する。
例えば、拡張現実(AR)アプリケーションのテストは、仮想コンテンツ、物理環境、コード間の動的相互作用のために難しいため、従来のテストオーラクルの定義が難しい。
しかし、メタモルフィック関係(MR)の定式化は時間がかかり、負担がかかる。
我々は、リポジトリレベルのコンテキストと推論オーケストレーションを使用してMRを生成し、改善するコンテキスト認識パイプラインを導入し、142のモバイルARシステムリポジトリのデータセットで評価した。
14,916の候補MRを生成する3つのコンテキスト構成の中で、階層的コンテキストは142のリポジトリで7,004のMRと5,167のクラス-メソッド対)と低い冗長性を実現した。エージェント的検討プロセスでは、競合する候補を79.0%のケースで調整し、重複を低減し、結果の88.2%でコンテキスト-認識関係を選択する。
手動のオラクルによる研究では、洗練された関係(n = 141)は論理的に有効であり、テストアサーションに直接変換するのに十分な具体的なものであることを示し、予備的なケーススタディでは、生成されたMR(n = 5)を実世界のコードで等価でない突然変異を検出できることを示す。
以上の結果から,レポジトリを意識したMR生成と推論に基づく改良を組み合わせることで,信頼性の高いドメイン関連テストオラクルをスケーラブルに構築できることが示唆された。
関連論文リスト
- RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - RESTOR: Automated Test Oracle Generation for RESTful APIs via Reinforcement Learning [21.927343858709122]
Restorは、ブラックボックスの設定で単一のリクエスト-レスポンスペアから実行可能なテストアサーションを生成するフレームワークである。
実世界の246のサービスにまたがる2,300以上のAPIトレースからなる産業データセット上でRestorを評価する。
論文 参考訳(メタデータ) (2026-07-27T03:20:28Z) - Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval [0.0]
Retrieval-Augmented Generation (RAG) は、言語モデル(LLM)を拡張し、その応答を外部知識に基盤付ける。
本稿では,動的クエリ分解,反復検索,および有界自己回帰評価ループを導入したエージェントオーケストレーション適応型RAGフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-04T03:38:46Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage [89.58253972744531]
Retrieval-augmented Generation (RAG) システムは、文書検索と生成モデルを組み合わせて、レポート生成のような複雑な情報を求める課題に対処する。
我々は,上流の検索指標が,最終生成応答の情報カバレッジの信頼性の高い早期指標として機能するかどうかを検討する。
本研究は,トピックとシステムレベルの両方で生成した応答におけるカバレッジベース検索指標とナゲットカバレッジとの間に強い相関関係を示した。
論文 参考訳(メタデータ) (2026-03-09T18:20:20Z) - Bias Testing and Mitigation in Black Box LLMs using Metamorphic Relations [12.095552079739933]
本稿では,系統的バイアス評価と目標緩和のための統一的な枠組みを提案する。
われわれは6つの新しいメタモルフィック関係(MR)を導入する。
MRは直接バイアス誘発入力を意味論的に等価だが逆向きに挑戦する変種に変換する。
論文 参考訳(メタデータ) (2025-11-29T16:56:38Z) - RAISE: Reasoning Agent for Interactive SQL Exploration [47.77323087050061]
本稿では,スキーマリンク,クエリ生成,反復的改善を1つのエンドツーエンドコンポーネントに統一する新しいフレームワークを提案する。
本手法は、不慣れなデータベースを扱う際に、人間がどう答えるかをエミュレートする。
論文 参考訳(メタデータ) (2025-06-02T03:07:08Z) - RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems [33.389969814185214]
Retrieval-Augmented Generation (RAG)は、回答の正確性と事実性を高める。
既存の評価では、RAGシステムが現実世界のノイズ、内部と外部の取得したコンテキストの衝突、あるいは急速に変化する事実にどれくらいうまく対処しているかを検査することはめったにない。
本稿では,動的で時間に敏感なコーパス上でのストレステストクエリと文書摂動を共同で行う,統一されたフレームワークと大規模ベンチマークであるRetrieval-Aware Robustness Evaluation (RARE)を紹介する。
論文 参考訳(メタデータ) (2025-06-01T02:42:36Z) - Towards a Complete Metamorphic Testing Pipeline [56.75969180129005]
システムアンダーテスト(SUT)の連続実行における入出力ペア間の関係を調べてテストオラクル問題に対処するメタモルフィックテスト(MT)
これらの関係は、メタモルフィック関係 (MRs) と呼ばれ、特定の入力変化に起因する期待される出力変化を規定する。
本研究の目的は,MR の生成,制約の定義,MR 結果の説明可能性の提供を支援する手法とツールの開発である。
論文 参考訳(メタデータ) (2023-09-30T10:49:22Z) - Generation-Augmented Retrieval for Open-domain Question Answering [134.27768711201202]
GAR(Generation-Augmented Retrieval)は、オープンドメインの質問に答える機能である。
クエリーに対して多様なコンテキストを生成することは、結果の融合が常により良い検索精度をもたらすので有益であることを示す。
GARは、抽出読取装置を備えた場合、抽出QA設定の下で、自然質問およびトリビアQAデータセットの最先端性能を達成する。
論文 参考訳(メタデータ) (2020-09-17T23:08:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。