論文の概要: Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks
- arxiv url: http://arxiv.org/abs/2610.02001v1
- Date: Thu, 01 Oct 2026 16:32:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.287739
- Title: Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks
- Title(参考訳): Mingbird: ローカルファーストのエージェントが小さなオープンモデルを使ってタスクを完了させるハーネス
- Abstract要約: 小型のオープンウェイトモデル(2-9B)は普通のラップトップ上で動作しますが、クラウドスケールのエージェントで実際のタスクを完了することはめったにありません。
これらの失敗のかなりの割合は、モデルよりもハーネスに起因していることを示す。
我々は,Windows と Ollama 用のローカルファーストエージェントハーネスである Mingbird を紹介した。
- 参考スコア(独自算出の注目度): 5.632168383670357
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Small open-weight models (2-9B) run on ordinary laptops, but under cloud-scale agent harnesses they rarely complete real tasks: tool prefill overflows the context, self-correction diverges, tool demonstrations loop, and tasks are silently abandoned. We present evidence, from a controlled single-machine comparison and one third-party benchmark, that a substantial share of these failures is attributable to the harness rather than the model. We introduce Mingbird, a local-first agent harness for Windows and Ollama whose ten mechanisms compensate point-by-point for small-model failure forms, three of them representative: a byte-level net-zero prefill budget, a finish gate that re-reads the task before accepting completion, and signature-level loop detection. On LRAB, a controlled comparison holding machine, models, budgets, and scoring fixed (4 harnesses $\times$ 4 open models (2B-35B) $\times$ 18 real tasks, deterministic artifact scoring), Mingbird reaches 0.886 overall against 0.631 (goose), 0.479 (opencode), and 0.405 (agent-mini), with all 288 cells published; on $τ^2$-bench (278 tasks, three arms, one protocol) it totals 0.856 against 0.791 and 0.737; and a frontier-model probe on the same 18 tasks spans 0.997 to 0.478 across harnesses, with well-formed scaffolds staying within 0.072 of each other. A leave-one-mechanism-out ablation is reported as directional only: same-night replications of the same arm move its mean by up to 0.069, the size of every nominal single-trial delta, and the one batch-matched comparison (full mechanism stack versus text re-read alone) gives the executable completion guards a paired +0.10 across three replications. The evidence carries stated limits: a self-built benchmark, a single machine, and single-trial scoring.
- Abstract(参考訳): 小型のオープンウェイトモデル(2-9B)は通常のラップトップ上で実行されるが、クラウドスケールのエージェントハーネスの下では、コンテキストのオーバーフロー、自己補正の分岐、ツールのデモループ、タスクが静かに放棄されるなど、実際のタスクを完遂することは滅多にない。
制御された単一マシン比較と1つのサードパーティベンチマークから、これらの失敗のかなりの割合はモデルよりもハーネスに起因しているという証拠を提示する。
我々は、WindowsとOllamaのローカルファーストエージェントハーネスであるMingbirdを紹介し、その10のメカニズムは、小モデル故障フォームのポイント・バイ・ポイントを補うもので、そのうち3つは、バイトレベルのネットゼロプリフィル予算、完了を受け入れる前にタスクを再読み込みするフィニッシュゲート、署名レベルのループ検出である。
LRABでは、制御された比較保持マシン、モデル、予算、定点固定(4つのハーネス$\times$4 オープンモデル(2B-35B)$\times$18 実タスク、決定論的アーティファクトスコア)、Mingbirdは0.631 (goose)、0.479 (opencode)、0.405 (agent-mini)に対して0.886に達し、288セルが発行されている。
同一腕の同夜の複製は0.069まで平均を移動し、名目上の1つのデルタの大きさと、1つのバッチマッチング比較(フル機構スタックとテキスト再読み取りのみ)は、3つのレプリケーションにまたがってペア +0.10 を与える。
このエビデンスには、自作のベンチマーク、シングルマシン、シングルトライアルスコアといった制限がある。
関連論文リスト
- A Function-Level Vulnerability Score Measures Flag Rate More Than the Model: Protocol Effects on Paired Benchmarks [0.0]
ペアテストでは、モデルが脆弱な関数にフラグを付け、修正コミット後にバージョンをクリアしなければならない。
7つのフロンティアと大きなオープンモデルが、5つのリリースされたペアベンチマークと1つのプロトコルでプールされたセットで評価された。
68モデル中37モデルの場合、正対と逆対の差は95%の間隔でゼロとなる。
論文 参考訳(メタデータ) (2026-09-26T19:23:48Z) - SCX Router: Streaming Zero-Shot Model Selection with a Decoder-KV Classifier and a Real-World Task Ontology [47.16406021922537]
本稿では,GLiClassをベースとした軽量ルータであるルータを紹介し,自動生成なしで各推論時間モデルラベルに適合点を割り当てる。
タスク生成には、23のファミリー、115のタスクタイプ、345のルータブルなサブタイプ、1,173の合成例と30のドメインの軸を持つタスク構造を構築する。
次に、これらのタスクでQwen3デコーダをトレーニングし、学習された要求予測を、適格性、コスト、キャッシュ再利用、安全性、主権といった属性に対するタスクごとのポリシーから明確に分離します。
論文 参考訳(メタデータ) (2026-09-02T08:40:07Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance [2.8543100656957883]
共有作業空間に対する管理作業者の足場の影響について検討する。
監督のオプス5は1回のパスで91%の得点を記録した。
マネジャーの実行はトークンの請求書を3倍にしますが、より大きなモデルに移行するよりも、より安価で精度が得られます。
論文 参考訳(メタデータ) (2026-08-27T00:11:41Z) - Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep [0.3384279376065155]
このパイロットは、逆電荷による境界境界VAT決定の選択について研究する。
アクティビティサーフェスを固定する(サブタスク、ツール、I/Oスキーマ、検証チェック、オーケストレータ、ベースモデル、マージポリシー)。
プログラムは40ケースのメインスイープ、マッチしたトケンアーム、エージェントカウント効果から即時予算を分離する3つの失敗インジェクションアームを含む4,400回に及ぶ。
論文 参考訳(メタデータ) (2026-08-24T15:40:15Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents [0.0]
CFAgentBenchは、自律的な建設ファイナンスエージェントのベンチマークである。
8つのドメインと77のファミリーにまたがる1014のマシングレード可能なタスク仕様を含んでいる。
最強のエージェントはpass1 = 0.67に達するが、pass5 = 0.38のみである。
論文 参考訳(メタデータ) (2026-06-20T11:34:52Z) - Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks [75.92297551160692]
OpenClawのような汎用エージェントは、自律的なツールユーザとしてますます利用されている。
マルチリンガルなSWEベンチマークおよびアダプタプロトコルであるClaw-SWE-Benchを紹介する。
Claw-SWE-Benchは、SWEスタイルの符号化エージェント評価の第一級軸として、ハーネスとコスト会計を扱う。
論文 参考訳(メタデータ) (2026-06-10T17:16:23Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。