論文の概要: OASIS: A Rubric-Based Multimodal Assessment Platform Using Large Language Models
- arxiv url: http://arxiv.org/abs/2609.09180v1
- Date: Wed, 26 Aug 2026 21:40:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-13 18:05:10.744527
- Title: OASIS: A Rubric-Based Multimodal Assessment Platform Using Large Language Models
- Title(参考訳): OASIS: 大規模言語モデルを用いたルーブリックベースのマルチモーダルアセスメントプラットフォーム
- Abstract要約: 独特な機能としては、luric-as- programコンパイル、プログレッシブな実行計画、content-addressable grading Identity、transcript-augmented multimodal grading、明示的なレビューステート、人間と自律エージェントのための共有コマンドサーフェスなどがある。
2023年秋からUTサウスウェスタン医療センターで生産されているこのプラットフォームは、7000回以上の遭遇を処理している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: OASIS (Open Assessment and Scoring Infrastructure Stack) is a systems platform for rubric-based grading of video, audio, and text with large language models. Scoring one artifact with an LLM is straightforward; deploying assessment at scale requires encounter management, rubric versioning, modality-aware execution, provenance capture, and human review. OASIS pairs a standalone command-line interface with a canonical integrated Elephant + MAPLES stack for encounter management and multimodal grading orchestration. Both paths can target hosted APIs or self-hosted open-weight models through Ollama and OpenAI-compatible endpoints such as vLLM. SimRubrics rubric authoring and the Wayfinder conversational agent gateway are optional extensions that use the same authenticated interfaces as human operators. Given a rubric and recorded encounters, OASIS produces per-criterion scores, evidence, and rationales, preserving execution artifacts for audit. Distinctive features include rubric-as-program compilation, progressive execution plans, content-addressable grading identity, transcript-augmented multimodal grading, explicit review state, and a shared command surface for humans and autonomous agents. Though developed in medical education, the architecture is domain-agnostic, applying wherever structured performance can be evaluated from recorded or written artifacts. In production at UT Southwestern Medical Center since Fall 2023, the platform has processed more than 7,000 encounters. This publication includes the report and project information, not application source, binaries, installation materials, sample data, or a tagged software release.
- Abstract(参考訳): OASIS(Open Assessment and Scoring Infrastructure Stack)は、ビデオ、オーディオ、テキストを大規模な言語モデルで分類するシステムプラットフォームである。
大規模にアセスメントをデプロイするには、遭遇管理、ルーブリックバージョニング、モダリティ対応の実行、プロファイランスキャプチャ、ヒューマンレビューが必要である。
OASISはスタンドアロンのコマンドラインインターフェースと標準統合されたElephant + MAPLESスタックを組み合わせて、遭遇管理とマルチモーダルグレーディングオーケストレーションを実現している。
どちらのパスも、ホストAPIや、OllamaやvLLMなどのOpenAI互換エンドポイントを通じて、セルフホストのオープンウェイトモデルをターゲットにすることができる。
SimRubrics rubric AuthoringとWayfinderの会話エージェントゲートウェイは、人間のオペレータと同じ認証インターフェイスを使用するオプション拡張である。
ルーリックで記録された出会いを与えられたOASISは、監査のための実行アーティファクトを保存するために、基準ごとのスコア、エビデンス、合理性を生成する。
独特な機能としては、luric-as- programコンパイル、プログレッシブな実行計画、content-addressable grading Identity、transcript-augmented multimodal grading、明示的なレビューステート、人間と自律エージェントのための共有コマンドサーフェスなどがある。
医学教育において開発されたが、このアーキテクチャはドメインに依存しないものであり、構造化されたパフォーマンスを記録や記述されたアーティファクトから評価することができる。
2023年秋からUTサウスウェスタン医療センターで生産されているこのプラットフォームは、7000回以上の遭遇を処理している。
この出版物には、レポートとプロジェクト情報が含まれており、アプリケーションソース、バイナリ、インストール資料、サンプルデータ、タグ付けされたソフトウェアリリースが含まれている。
関連論文リスト
- Automating the Design of Embodied Agent Architectures [17.294577626616917]
エージェントは一般的に、知覚、記憶、計画、行動モジュールのハンドデザインされた構成として構築される。
本研究では,エミュレータを編集可能なノード・アンド・ワイヤプログラムとしてホストし,シミュレータを意識した実行とエピソードレベルのログを生成する型グラフランタイムを提案する。
視覚言語ナビゲーション,具体的質問応答,言語条件の操作にまたがる4つの実施者を対象に,AASの3つの変種を評価した。
論文 参考訳(メタデータ) (2026-06-29T10:45:37Z) - AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs [55.8213573429699]
AISE-Benchは、学術知識グラフに基づく情報検索のための実世界のフルサイクルアノテートベンチマークである。
AISE-Benchリリースには1,133のQAペアが含まれている。クエリ、完全なAPI実行、検証されたパラメータ、リファレンスリンクによるソースグラウンドの回答などだ。
我々は,回答の品質,参照基盤,API計画の正確性,実行成功を総合的に評価するプロトコルを開発した。
論文 参考訳(メタデータ) (2026-06-16T07:59:46Z) - The Model Is Not the Product: A Dual-Pillar Architecture for Local-First Psychological Coaching [51.56484100374058]
本報告では,iOS アプリケーションである Psych LM について紹介する。
Psych LMは、動作およびライフコーチングアプリケーション用に設計された、目的に構築された、ローカルファーストのランタイム内で、ローカル、オンデバイス言語モデルを実行する。
論文 参考訳(メタデータ) (2026-05-23T05:49:11Z) - LLM-Rosetta: A Hub-and-Spoke Intermediate Representation for Cross-Provider LLM API Translation [1.812335324603146]
LLM-Rosettaは、ハブ・アンド・スポーク中間表現(IR)上に構築されたオープンソースの翻訳フレームワークである。
モジュール型のOpsコンポジションコンバータアーキテクチャにより、各API標準を独立して追加することができる。
4つのAPI標準(OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Google GenAI)のコンバータを実装しています。
論文 参考訳(メタデータ) (2026-04-10T14:31:32Z) - The Agentic Automation Canvas: a structured framework for agentic AI project design [0.0]
本稿ではエージェントシステム設計のための構造化フレームワークであるエージェント自動化Canvas(AAC)について述べる。
AACは自動化プロジェクトの6つの側面を捉えている。定義とスコープ、定量化された利益指標によるユーザ期待、開発者の実現可能性評価、ガバナンスのステージングである。
リアルタイムのバリデーションを備えたクライアントサイドのWebアプリケーションを通じてアクセスすることができる。
論文 参考訳(メタデータ) (2026-02-16T16:46:04Z) - Context-Aware Visual Prompting: Automating Geospatial Web Dashboards with Large Language Models and Agent Self-Validation for Decision Support [1.506501956463029]
リスク分析と意思決定のためのWebベースのダッシュボードの開発は、大きな多次元データの難しさに悩まされることが多い。
ユーザ定義入力からインタラクティブな地理空間ダッシュボードの作成を自動化する生成AIフレームワークを導入する。
論文 参考訳(メタデータ) (2025-10-10T10:58:15Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - eSapiens: A Real-World NLP Framework for Multimodal Document Understanding and Enterprise Knowledge Processing [6.450269621190948]
企業環境での質問応答システムeSapiensを紹介する。
eSapiensは、二重モジュールアーキテクチャを介して構造化データベースと非構造化コーパスをブリッジする。
我々は、RAGTruthベンチマークでeSapiensを評価し、完全性、幻覚、文脈利用といった重要な側面における性能を分析した。
論文 参考訳(メタデータ) (2025-06-20T06:07:20Z) - What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities [56.646832992178105]
我々は、制御可能な複雑性のタスクを合成するための自動パイプラインを備えたクロスプラットフォームグラフベースのベンチマークであるOmniBenchを紹介した。
OmniEvalは、サブタスクレベルの評価、グラフベースのメトリクス、および10機能にわたる包括的なテストを含む多次元評価フレームワークである。
我々のデータセットには、20のシナリオにわたる36万のグラフ構造化タスクが含まれており、人間の受け入れ率は91%に達する。
論文 参考訳(メタデータ) (2025-06-10T15:59:38Z) - OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models [58.45517851437422]
VsTP(Visually-situated text parsing)は、自動化された文書理解の需要が高まり、最近顕著な進歩を遂げている。
既存のソリューションは、タスク固有のアーキテクチャと個々のタスクの目的に依存していることが多い。
本稿では,テキストスポッティング,キー情報抽出,テーブル認識,レイアウト解析など,VsTPの典型的なタスクを統一する汎用モデルであるOmni V2を紹介する。
論文 参考訳(メタデータ) (2025-02-22T09:32:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。