論文の概要: Transect: Retaining Observability for Long-Horizon LLM Agent Evaluations
- arxiv url: http://arxiv.org/abs/2610.08364v1
- Date: Tue, 06 Oct 2026 13:52:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.017285
- Title: Transect: Retaining Observability for Long-Horizon LLM Agent Evaluations
- Title(参考訳): Transect: 長期LDMエージェント評価のための可観測性維持
- Abstract要約: TransectはInspect Scout上に構築されたオープンソースパッケージで、長いエージェントがどのように展開されるのかを評価担当者が理解できるようにする。
ユーザーは再利用可能な評価カテゴリ設定でタスクコンテキストと振る舞いの語彙を指定する。
Transectのカスタマイズ可能なトランスクリプト分析パイプラインにより、評価者はより長く複雑なAI評価でペースを維持することができる。
- 参考スコア(独自算出の注目度): 41.078228804410436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier AI evaluations increasingly use open-ended, agentic, long-horizon tasks whose transcripts can span hundreds of pages of outputs and actions from complex multi-agent networks. The observability envelop-the range of what evaluators can reliably infer about an agent's behaviours-is therefore narrowing. Language model assistants can help classify and interpret agent behaviour but also afford human evaluators significant analytical degrees of freedom, threatening the reproducibility and auditability of language-model-based transcript analysis. Transect is an open source package built on Inspect Scout to help evaluators understand how a long agent run unfolded, identify behaviour worth investigating, and check interpretations against the transcript. Users specify task context and behavioural vocabulary in a reusable evaluation-family configuration, with judge models and analysis settings supplied separately. Transect's navigable reports align recorded events, token use, sub-agent activity, and model-generated behavioural labels on a common turn-based timeline. Reviewers can quickly grasp a run's narrative, trace any label or event to its source turns, and export the underlying data tables for cross-run analysis. We demonstrate the workflow on an AI R&D evaluation that generated almost 13 million tokens, dividing the agents' work into behavioural phases aligned with research-skill classifications, sub-agent delegations and interactions, and token use. The combined view shows a focus on operational work and manuscript production, with little evidence of a sustained hypothesis generation stage-arguably a necessary component for high-quality scientific outputs. Transect's flexible, customisable transcript-analysis pipeline will enable evaluators to keep pace with longer, more complex, more frequent AI evaluations while supporting scientific rigour, transparency, and reproducibility.
- Abstract(参考訳): Frontier AI評価では、複雑なマルチエージェントネットワークから数百ページのアウトプットとアクションにまたがる、オープンでエージェント的なロングホライゾンタスクの利用が増えている。
観察可能性 - 評価者がエージェントの振る舞いを確実に推測できる範囲が狭まる。
言語モデルアシスタントは、エージェントの振る舞いを分類し、解釈するのに役立つが、人間の評価者は、言語モデルに基づく転写解析の再現性と監査性を脅かす。
TransectはInspect Scout上に構築されたオープンソースパッケージで、長いエージェントがどのように展開されているかを理解し、調査する価値のある振る舞いを特定し、書き起こしに対する解釈をチェックするのに役立つ。
ユーザーは再利用可能な評価カテゴリ設定でタスクコンテキストと振る舞いの語彙を指定し、判断モデルと分析設定を別々に供給する。
Transectのナビゲート可能なレポートは、記録されたイベント、トークンの使用、サブエージェントアクティビティ、モデル生成の振る舞いラベルを共通のターンベースのタイムラインに並べる。
レビュアーは、ランのナラティブを素早く把握し、ラベルやイベントをソースターンにトレースし、基盤となるデータテーブルをクロスラン分析にエクスポートすることができる。
約1300万のトークンを生成し、エージェントの作業を研究スキルの分類、サブエージェントのデリゲートとインタラクション、トークンの使用と整合した行動フェーズに分割する。
統合された見解は、運用作業と原稿生産に焦点が当てられ、持続的な仮説生成の段階的な証拠はほとんどなく、おそらく高品質な科学出力に必要な要素である。
Transectのフレキシブルでカスタマイズ可能なトランスクリプト分析パイプラインは、科学的厳密さ、透明性、再現性をサポートしながら、評価者がより長く、より複雑な、より頻繁なAI評価でペースを維持することを可能にする。
関連論文リスト
- Computational Measurement of Team-Process Phase Dynamics in Collaborative Virtual Reality [9.928781897312971]
本稿では,協調VRゲームにおけるタイムスタンプ対話から動的チームプロセスフェーズを検出し,解釈するためのフレームワークを提案する。
ローカルにデプロイされた大規模言語モデル(LLM)は、コンテキスト内学習を使用して初期解釈を生成し、その後人間によってレビューされる。
論文 参考訳(メタデータ) (2026-08-19T08:05:13Z) - Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation [74.0621258662676]
レポート生成のためのマルチエージェントハーネスであるPtahを提案する。
Ptahは計画、研究、執筆段階を通じて、ユーザクエリからレンダリングされたWebレポートまでのライフサイクルを編成する。
検証エージェントがハーネスの受け入れ機能として機能し、ワークフロー全体を通して事実的接地、引用の忠実性、相互の整合性を強制する。
論文 参考訳(メタデータ) (2026-05-28T12:40:34Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation [71.49152943451328]
我々は,AJ-Benchベンチマークを導入し,ドメイン検索,データシステム,グラフィカルユーザインタフェースの3つの領域にまたがるエージェント・アズ・ア・Judgeを評価する。
実験ではLLM-as-a-Judgeベースラインよりも一貫したパフォーマンス向上を示し、エージェントベースの検証においてかなりオープンな課題を明らかにした。
論文 参考訳(メタデータ) (2026-04-20T13:23:38Z) - When Only the Final Text Survives: Implicit Execution Tracing for Multi-Agent Attribution [10.973058523304042]
IET(Implicit Execution Tracing)は、メタデータに依存しないフレームワークで、生成したテキストから直接トークンレベルの属性を作成できる。
生成中、エージェント固有のキー付き信号がトークン分布に埋め込まれ、秘密鍵でのみ検出可能な自己記述実行トレースに変換される。
検出時にエージェントハンドオーバポイントを特定し、インタラクショングラフを再構築する。
論文 参考訳(メタデータ) (2026-03-18T07:34:51Z) - From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants [0.0]
顧客向け産業向けの信頼できる会話AIアシスタントの構築は、ノイズの多い会話データ、断片化された知識、正確なヒューマンハンドオフの必要性により、依然として困難である。
本稿では,履歴書から直接対話型AIアシスタントを構築し,評価するためのエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-26T07:44:47Z) - Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization [86.98098988779809]
SummQは長期文書要約のための新しい逆多重エージェントフレームワークである。
提案手法では,包括的な要約を作成し,評価するために協調作業を行う要約ジェネレータとレビュアーを用いる。
広範に使用されている3つの文書要約ベンチマーク上でSummQを評価する。
論文 参考訳(メタデータ) (2025-09-25T08:36:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。