論文の概要: Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
- arxiv url: http://arxiv.org/abs/2606.00579v1
- Date: Sat, 30 May 2026 07:04:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.533823
- Title: Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
- Title(参考訳): サンドボックス符号化エージェントは競合するOmniモードタスクソルバーである
- Authors: Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou,
- Abstract要約: テキスト・イメージ・アクセスとサンドボックス・ツール・ユース・インタフェースしか持たないコーディング・エージェントがSOTAネイティブ・オムニモーダル・モデルと一致することを示す。
私たちの軌道分析は、その強みがコードを書き、関連する証拠を抽出するためのツールを編成することに由来することを示唆しています。
我々は,OmniCodingトラジェクトリデータセットと検証可能な報酬を含むトレーニングレシピであるCode-Xを紹介し,Qwen-3.5-9BとQwen-3.6-27Bのベースラインを提供する。
- 参考スコア(独自算出の注目度): 22.269016330825128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As multimodal LLMs increasingly target video and audio, it is often assumed that such tasks require native omnimodal models. We show that this is not always the case: coding agents with only text+image access and a sandboxed tool-use interface can match, and in several settings outperform, SOTA native omnimodal models and predefined multimodal agent scaffolds across multiple audio-video benchmarks. Our trajectory analysis suggests that their strength comes from writing code and orchestrating tools to extract relevant evidence from transcripts, frames, and other modality signals, thereby converting omnimodal tasks into retrieval and information-processing problems rather than ingesting entire media streams. We further characterize their limitations through a failure taxonomy and process-level trace analysis, and show that simple skill injection, including human-written and self-distilled skills, substantially improves performance. To explore open-source elicitation, we introduce Code-X, a training recipe with the OmniCoding trajectory dataset and verifiable reward, and provide baselines on Qwen-3.5-9B and Qwen-3.6-27B. Finally, we argue that the next frontier is many-modality processing, and introduce TerminalBench-O, a process-level benchmark for real-world omnimodal processing tasks. Code will be available at https://github.com/Dongping-Chen/OmniCoding.
- Abstract(参考訳): マルチモーダル LLM はますますビデオやオーディオをターゲットとしているため、そのようなタスクにはネイティブな雑用モデルが必要であると仮定されることが多い。
テキスト+イメージアクセスのみのコーディングエージェントとサンドボックス化されたツール・ユースインターフェースが一致し、いくつかの設定においてSOTAネイティブ・オムニモーダルモデルと、複数のオーディオベンチマークベンチマークにまたがる事前定義されたマルチモーダル・エージェント・スキャフォールドが適合する。
トラジェクトリ分析では,テキストやフレーム,その他のモダリティ信号から関連する証拠を抽出し,全メディアストリームの取り込みよりも全タスクを検索や情報処理に変換する,という手法が提案されている。
さらに, 故障分類とプロセスレベルのトレース分析により, それらの限界を特徴づけ, 人間の手書きや自己蒸留技術を含む簡易なスキル注入により, 性能が著しく向上することを示す。
OmniCodingトラジェクトリデータセットと検証可能な報酬を備えたトレーニングレシピであるCode-Xを紹介し,Qwen-3.5-9BとQwen-3.6-27Bのベースラインを提供する。
最後に、次のフロンティアは多モード処理であり、実世界の雑用処理タスクのプロセスレベルベンチマークである TerminalBench-O を導入する。
コードはhttps://github.com/Dongping-Chen/OmniCoding.comで入手できる。
関連論文リスト
- OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments [5.613789567241434]
我々はOmniGUIを紹介した。OmniGUIは、Omniモードのスマートフォン環境でGUIエージェントを評価するために設計された最初のステップレベルベンチマークである。
データセットには、29のアプリケーションにわたる709のエキスパートデモエピソード(2,579のアクションステップ)が含まれている。
我々の経験的評価は、現在のモデルは視覚的に静的なタスクに能力を示すが、その動作予測性能は同期時間と聴覚信号を必要とする環境において著しく低下することを示している。
論文 参考訳(メタデータ) (2026-04-03T08:57:06Z) - OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs [31.589945976149973]
我々は、Attributionを世代追跡問題として形式化する軽量でモデルに依存しないフレームワークであるOmniTraceを紹介した。
本研究では, 世代別スパンレベルの属性が, 自己帰属よりも安定かつ解釈可能な説明をもたらすことを示す。
この結果から,属性を構造化された生成時トレース問題として扱うことは,オムニモーダル言語モデルにおける透明性のスケーラブルな基盤となることが示唆された。
論文 参考訳(メタデータ) (2026-03-20T17:25:00Z) - A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos [76.98722001848493]
LongShOTBenchは、長めのマルチモーダルビデオ理解のための診断ベンチマークである。
これには、オープンエンド、インテント駆動の質問、シングルターンとマルチターンの対話、マルチモーダル推論とエージェントツールの使用を必要とするタスクが含まれる。
LongShOTAgentは、前処理、検索、反復的な精細化を通じて、長いビデオを分析するエージェントシステムである。
論文 参考訳(メタデータ) (2025-12-18T18:59:27Z) - What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities [56.646832992178105]
我々は、制御可能な複雑性のタスクを合成するための自動パイプラインを備えたクロスプラットフォームグラフベースのベンチマークであるOmniBenchを紹介した。
OmniEvalは、サブタスクレベルの評価、グラフベースのメトリクス、および10機能にわたる包括的なテストを含む多次元評価フレームワークである。
我々のデータセットには、20のシナリオにわたる36万のグラフ構造化タスクが含まれており、人間の受け入れ率は91%に達する。
論文 参考訳(メタデータ) (2025-06-10T15:59:38Z) - Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks [94.19506319646376]
本稿では,実世界のマルチモーダル環境での視覚中心エージェント評価のためのベンチマークであるAgent-Xを紹介する。
Agent-Xは、828のエージェントタスクと、イメージ、マルチイメージ比較、ビデオ、命令テキストを含む、真の視覚的コンテキストを備えている。
その結果、GPT、Gemini、Qwenファミリーを含む最高のパフォーマンスモデルでさえ、多段階視覚タスクの解決に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-30T17:59:53Z) - OmniBench: Towards The Future of Universal Omni-Language Models [63.16606414452612]
OmniBenchは、視覚的、音響的、テキスト的入力を同時に認識し、解釈し、推論する能力を評価するために設計された新しいベンチマークである。
評価の結果,オープンソース OLM は三モーダル文脈における命令追従や推論に重大な制限があることが明らかとなった。
我々は,OLM性能を向上させるため,より堅牢な3モーダル統合技術とトレーニング戦略の開発を提唱する。
論文 参考訳(メタデータ) (2024-09-23T17:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。