FuguReport
最新の週次テーマと直近の日次レポートをまとめて確認できます。
2026-08-14 - 2026-08-20
最新の日次レポート
Glass Surface Detection Grounded in 3D Visual Geometry
本論文は、ガラス表面検出を主に2Dの外観手がかりに依存する手法から、3D視覚幾何学に基づくタスクへと再構成しています。
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
本論文は、動画生成モデルを視覚的世界モデルとして評価するには、単一ロールアウトの妥当性のみを判断するのではなく、固定された観測および行動のもとで起こり得る未来の分布を評価する必要があると主張している。
TTPO: Test-Time Policy Optimization
本論文では、数学的推論モデルのためのラベル不要なテスト時訓練手法であるTest-Time Policy Optimization(TTPO)を提案する。
TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes
本論文では、Vision-Language-Action(VLA)モデルに対する新たなバックドア攻撃設定として「Configured Failure Trapping」を研究しています。
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
本論文では、Flow Matchingモデル向けに教師モデルを必要としないオンポリシー蒸留フレームワークであるSelf-OPDを提案しています。
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
VoiceMemは、事実を扱う「左脳」と感情・ペルソナを重視する「右脳」にメモリを分離し、ストリーミングメモリI/Oを通じて接続する、リアルタイム音声対話向けのメモリアーキテクチャです。
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
本論文では、固定された手動設計のスキャフォールドに依存するのではなく、タスク適応的なエージェントハーネスをオンデマンドで生成するように訓練されたモデルであるJIT-Agentを提案します。
Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
Video-IFBenchは、単なる回答の正確性を測定するだけでなく、動画理解環境においてマルチモーダル大規模言語モデル(MLLM)がどれだけ適切に指示に従えるかを評価するために設計されたベンチマークです。
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
本論文は、ビジョン・言語モデルの事後学習における視覚的忠実性を研究し、この問題を単なる評価の課題ではなく信用割り当ての課題として位置付けています。
Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
本論文では、ゼロショットのタスク横断ロボット操作をコンテキスト内学習(in-context learning)の問題として定式化し、展開時に言語だけでなく人間のデモ動画によって未知のタスクを指定する手法を提案しています。
StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
StepGuardは、候補となるツールアクションの実行前チェックと完了した軌跡の事後監査の両方をサポートする、LLMエージェント向けの4Bステップレベルガードモデルです。
Investigating Knowledge Transfer Across Interactive Dialogue Games
本論文は、clembenchスイートのタスクを用いて共通のLLMをファインチューニングし、タスク間での性能を評価することにより、対話型ゲーム間で知識がどのように転移するかを調査しています。
Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning
Ockhamaretoは、欠陥検出の有効性とスイートの簡潔性を同時に最適化しながら完全なユニットテストスイートを生成する、シングルショットGRPOフレームワークです。
Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026
本論文では、医療対話音声からSOAP形式の臨床記録を直接生成する、KITのBeTraC 2026軽量トラック向けシステムを提示します。
MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters
本論文は、大規模な基盤モデルの利用コストが高く、少数のサポートセットしか得られないリソース制約環境を対象として、軽量な時系列予測モデルのフューショット学習を研究しています。
EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards
EarthVerseは、動的な地球システムや自然災害に関するマルチソース調査を実行する科学エージェントを評価するために設計されたベンチマークです。
ReWorld: An Interactive World Model with Long-Horizon Memory
ReWorldは、ユーザーのカメラ操作への追従、過去に訪れた場所の記憶保持、およびリアルタイム動作を同時に実現するように設計されたインタラクティブなストリーミング世界モデルです。
Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
本論文は、拡散モデルにおける報酬ファインチューニングには尤度ベースの方策勾配機構は不要であり、モデル固有の速度表現で直接定式化可能であると主張している。
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
本論文では、長期にわたるタスクにおいてLLMエージェントの外部ハーネスを自動的に改善するフレームワークであるAutoSaddlerを提案する。
EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting
EMPIREは、マルチモーダルな観測と動作生成の間に明示的な操作計画を挿入する、一人称視点(エゴセントリック)の両手動作予測のための2段階フレームワークです。
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents
本論文では、外部ジャッジやパッチ実行による検証を用いずに、Mixture-of-Experts(MoE)のネイティブなルータートレースがソフトウェア工学エージェントのテスト時スケーリングを誘導できるかを検証しています。
Coalition-Aware Skill Reliability for Self-Evolving Agents
本論文では、自己進化型LLMエージェントのスキルバンクに保存されたスキルが、単に集約された成果指標を向上させるだけでなく、正のメカニズム的貢献を果たしているかを調査しています。
Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation
本論文では、LLMに基づくヘイトスピーチモデレーションにおける判定後の攻撃対象領域として、モデルに当初の正しい判断を再検討させるアノテーター風の反論を検証しています。
DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue
DeepSAGEは、CBT(認知行動療法)の初回カウンセリングセッションを、治療目標と自動完了基準を持つ11の明示的な段階のシーケンスとして実施するためのLLMとDRLのハイブリッドフレームワークです。
Autonomous Cyber Defense: Real-Time Attack Detection and Mitigation in Software-Defined Networks Using Machine Learning
本論文は、リアルタイムのトラフィック監視、機械学習に基づく攻撃診断、および自動緩和策を組み合わせた、ソフトウェア定義ネットワーク(SDN)向けの自動サイバー防衛システムを提案しています。
ORBIT++: Benchmarking SfM in the Wild with 360° Video
本論文では、オンラインの360度映像から得られた難度の高い実世界動画においてStructure-from-Motion(SfM)およびカメラ姿勢推定を評価するための、ORBITベンチマークの更新版であるORBIT++を提案しています。
Revisiting N2DCG: An Empirically Grounded Reformulation of Carousel Recommendation Evaluation
本論文は、カルーセル型推薦インターフェース向けにNDCGを2次元へと拡張したN2DCGを再検証し、従来の定式化が実際のカルーセルレイアウトでは成り立たない前提を置いていると主張しています。
Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs
本論文では、Mixture-of-Experts(MoE)大規模言語モデルにおける圧縮技術を個別のステップとしてではなく、エンドツーエンドの展開ワークフローとして評価するベンチマーク「MoE-XBench」を提案しています。
Beyond Fresh Starts: Stateful Inference for Streaming ASR in Conversational Voice Agents
本論文では、低遅延ストリーミングASRにおける状態(ステート)処理が対話型音声エージェントに与える影響を、ターンの境界、長い無音、短い相槌(バックチャネル)ターンに着目して分析しています。
Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence
本論文は、複雑で長期的なタスクに対処するために、LLMベースのシステムが単一エージェントの個体知能から複数コンポーネントによるシステム知能へとどのように移行しているかを包括的に調査したサーベイです。
CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents
本論文は、固定されたDreamerV3を対象として、視覚的世界モデルエージェントに対するホワイトボックスかつ因果的でオンラインの敵対的攻撃を研究している。
FlatLand: Personalized Graph Federated Learning via Tailored Lorentz Space
FlatLandは、共有されたユークリッド幾何学を仮定するのではなく、各クライアントを専用に調整されたローレンツ空間の埋め込みに配置するグラフデータ向けの個別化連合学習手法です。
Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors
本論文は、LLMによって書き直されたPythonのエラーメッセージが、標準的なインタプリタの出力よりも効果的にプログラマーのデバッグを支援するかどうかを調査した研究です。
PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
PhysCaPは、視覚のみでは推論できない潜在的な物理特性に成否が依存するロボット操作タスクにおいて、能動的知覚を行うために設計された物理情報を活用するCode-as-Policyエージェントです。
VGI-BENCH: Probing Visual Intelligence in Video Generation Models
本論文では、プロセスを重視した視覚的グラウンディングタスクを通じて動画生成モデルの視覚的知能を評価するベンチマークであるVGI-Benchを導入する。
Coupled Optimal Transport with Landmark Constraints
本論文は、輸送コストの最小化のみでは分布間の幾何学的に意味のある変換を特定できない場合があるという、標準的な最適輸送の課題に対処しています。
Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation
本論文は、各候補スペシャリストの価値推定自体にコストがかかる状況におけるAIモデルルーティングを研究しています。
Rethinking the Evaluation and Optimization of LLM-Based Social Simulation
本論文は、人間の応答は本質的に決定論的ではなく分布的であるため、従来の正解率に基づく評価やハードラベル学習はLLMベースの社会シミュレーションに適していないと主張しています。
Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners
本論文では、因果的Transformerが先行するパッチから次のlog-melスペクトログラムパッチの埋め込みを予測する自己教師あり音声学習フレームワーク「NAPE」を提案しています。
DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer
本論文では、動的3D Gaussian再構成とダウンサンプリングされたキーポイント上のダイナミクスモデリングを組み合わせることで、限られた視覚的観測から物体の動きを予測するフレームワークであるDyG2Tを提案します。
VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation
本論文では、個別の自動評価指標ではなく人間の選好フィードバックを用いて、動画・音声の共同生成に対する報酬モデリングを研究しています。
What is Missing from AI Post-Training AI: An Empirical Analysis
本論文は、大規模言語モデルのエンドツーエンドな事後学習を実行するAIエージェントを調査し、実行レベルの能力(確立されたパイプライン内での反復)と戦略レベルの能力(根拠に基づいて高レベルのパラダイムやワークフローを改訂すること)を区別して評価しています。
DocClaw: A Unified Agentic System for Intelligent Document Processing
DocClawは、OCR、文書質問応答(DocQA)、および重要情報抽出(KIE)をエージェントと文書間の反復的な相互作用として定式化する、インテリジェント文書処理のための統合エージェントシステムです。
SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
本論文では、エピソード中に候補群からどのスキルファイルを読み込むかを選択する必要がある長期エージェントにおける、方策内のスキル選択を研究しています。
ASI-Bench: At the Dawn of Artificial Superintelligence
ASI-Benchは、人間の方法論的ガイダンスが段階的に削減される中で、AIシステムがプロジェクトレベルの科学研究を遂行できるかを評価するためのベンチマークである。
HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety
本論文は、エージェントハーネスの安全性に関するライフサイクル指向のベンチマークであるHarnessRiskを紹介します。
Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing
本論文は、生成されたトレースに記述されている以上の潜在的な推論状態を明らかにするために、Mixture-of-Experts(MoE)推論モデル向けの2段階の内部読み出し(readout)手法を提案しています。
Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing
本論文は、モデルがクロスドメインシフトと未知の攻撃タイプの両方に対処しなければならない、オープンワールドの顔なりすまし検知について研究している。
Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation
本論文は、識別的で埋め込みベースのランキング設定のもと、コンパクトな大規模言語モデル(LLM)を用いたスケーラブルなシーケンシャル推薦について研究している。
VicEdit: Learning to Edit Videos from Visual In-Context Examples
本論文は、テキストの指示に加えて、単一画像、画像ペア、またはビデオペアの形式で視覚的な例を補完するビデオ編集パラダイムである「Visual In-context Editing」を提案しています。
アーカイブ
週次アーカイブ
15インタラクティブモデルとエージェントのためのベンチマーク
今週のテーマは、モデル評価を狭いオフライン指標から、身体性世界モデルやマルチモーダルGUIエージェント向けの実行可能でタスクに根ざしたベンチマークへと移行させることに焦点を当てている。
幾何学を考慮した3D再構成と生成
本テーマは、視覚的な生成・再構成を幾何学、カメラパラメータ、シーン構造に明示的に基づかせることに関するものである。
スケーラブルな汎用強化学習
今週の強化学習研究は、RLシステムのさらなる汎用化、計算効率の向上、および高負荷な訓練体制下での安定性に焦点を当てている。
科学LLMの評価と適応
本テーマは、基盤モデルが科学的・マルチモーダルな用途に向けてどのように評価・改善されているかに焦点を当てており、事前学習戦略、データの現実性、効率的なクロスモーダル設計が重視されている。
スパースニューラル表面再構成
今週のテーマは、スパースビュー条件下でニューラル表面再構成の汎化性能と効率性の両立を目指す研究に焦点を当てている。
自己進化型LLMマルチエージェントシステム
本テーマは、静的で中央集権的に制御されるLLMエージェントから、役割・記憶・ツール・協調方法を時間とともに適応させる自己進化型・分散型マルチエージェントシステムへの移行を追跡する。
根拠付きマルチモーダルQAベンチマーク
マルチモーダル質問応答のベンチマーク研究は、モデルが浅い多肢選択の手がかりに頼るのではなく、証拠を検索・根拠付けすることが求められる、より困難で信頼性の高い評価設定を志向する傾向が強まっている。
コンピュータ操作エージェントの評価
コンピュータ操作およびGUIエージェントの評価は、タスク成功率の測定から、安全性・効率性・クロスプラットフォーム能力の診断へと移行しつつある。
オンライン模倣学習と世界モデル強化学習
代表的な論文群は、静的な模倣学習や標準的なモデルベース制御に共通する限界に収束している。
マルチモーダル推論評価
本テーマは、テキストのみのベンチマークを超えて進化する高性能な言語・マルチモーダルモデルの評価と制御のあり方に焦点を当てている。
マニピュレーションの汎化と評価
今週のテーマは、視覚のみの教師信号や狭い範囲で収集されたロボットデータでは不十分な、接触を多く伴う環境での身体的マニピュレーションの評価と改善に焦点を当てている。
LLMソフトウェア工学評価
このテーマは、狭いベンチマークや最終出力指標を超えた、AIコーディングアシスタントおよびソフトウェア工学エージェントの評価に焦点を当てている。
LLMコードエージェントの評価
本テーマは、現実的なソフトウェアエンジニアリングタスク、特にリポジトリレベルのイシュー解決におけるLLMベースコーディングエージェントの評価に焦点を当てている。
ロボット学習のための身体性世界モデル
今週のテーマは、身体性世界モデルをリアルな未来の生成だけでなく、ロボットポリシーの評価・監督・改善に活用することに焦点を当てている。
対話型LLM行動評価
今週のテーマは、単一ターンのテキスト品質だけでなく、対話的かつ社会的に根拠のある設定におけるLLMの行動評価に焦点を当てている。