FuguReport

FuguReport

最新の週次テーマと直近の日次レポートをまとめて確認できます。

ページ基準日: 2026-08-27
Weekly

2026-08-14 - 2026-08-20

Daily

最新の日次レポート

50 件のレポート
2026-08-27 Task / Surface Detection / Glass surface detection in scenes

Glass Surface Detection Grounded in 3D Visual Geometry

本論文は、ガラス表面検出を主に2Dの外観手がかりに依存する手法から、3D視覚幾何学に基づくタスクへと再構成しています。

2026-08-27 Evaluation / Benchmarking / Probabilistic alignment evaluation

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

本論文は、動画生成モデルを視覚的世界モデルとして評価するには、単一ロールアウトの妥当性のみを判断するのではなく、固定された観測および行動のもとで起こり得る未来の分布を評価する必要があると主張している。

2026-08-27 Method / Reinforcement Learning / Policy optimization via rollout agreement

TTPO: Test-Time Policy Optimization

本論文では、数学的推論モデルのためのラベル不要なテスト時訓練手法であるTest-Time Policy Optimization(TTPO)を提案する。

2026-08-27 Task / Backdoor Injection / Trapping failure modes in VLA models

TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes

本論文では、Vision-Language-Action(VLA)モデルに対する新たなバックドア攻撃設定として「Configured Failure Trapping」を研究しています。

2026-08-27 Method / Self-Distillation / On-policy distillation framework

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

本論文では、Flow Matchingモデル向けに教師モデルを必要としないオンポリシー蒸留フレームワークであるSelf-OPDを提案しています。

2026-08-26 Method / Memory Networks / Dual-brain memory architecture

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

VoiceMemは、事実を扱う「左脳」と感情・ペルソナを重視する「右脳」にメモリを分離し、ストリーミングメモリI/Oを通じて接続する、リアルタイム音声対話向けのメモリアーキテクチャです。

2026-08-26 Method / Agent / Task-adaptive agent harness synthesis

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

本論文では、固定された手動設計のスキャフォールドに依存するのではなく、タスク適応的なエージェントハーネスをオンデマンドで生成するように訓練されたモデルであるJIT-Agentを提案します。

2026-08-26 Evaluation / Instruction Following Evaluation / Multimodal LLMs on video tasks

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Video-IFBenchは、単なる回答の正確性を測定するだけでなく、動画理解環境においてマルチモーダル大規模言語モデル(MLLM)がどれだけ適切に指示に従えるかを評価するために設計されたベンチマークです。

2026-08-26 Method / Reinforcement Learning / Visuals-based reinforcement learning approach

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

本論文は、ビジョン・言語モデルの事後学習における視覚的忠実性を研究し、この問題を単なる評価の課題ではなく信用割り当ての課題として位置付けています。

2026-08-26 Method / Video Action Modeling / In-context causal modeling from videos

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

本論文では、ゼロショットのタスク横断ロボット操作をコンテキスト内学習(in-context learning)の問題として定式化し、展開時に言語だけでなく人間のデモ動画によって未知のタスクを指定する手法を提案しています。

2026-08-25 Method / Model Safety / Step-level tool action checking

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

StepGuardは、候補となるツールアクションの実行前チェックと完了した軌跡の事後監査の両方をサポートする、LLMエージェント向けの4Bステップレベルガードモデルです。

2026-08-25 Application / Dialogue Systems / Interactive dialogue game tasks

Investigating Knowledge Transfer Across Interactive Dialogue Games

本論文は、clembenchスイートのタスクを用いて共通のLLMをファインチューニングし、タスク間での性能を評価することにより、対話型ゲーム間で知識がどのように転移するかを調査しています。

2026-08-25 Method / Reinforcement Learning / Segment-level credit assignment techniques

Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning

Ockhamaretoは、欠陥検出の有効性とスイートの簡潔性を同時に最適化しながら完全なユニットテストスイートを生成する、シングルショットGRPOフレームワークです。

2026-08-25 Method / Speech Synthesis / Synthetic data generation for medical dialogues

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

本論文では、医療対話音声からSOAP形式の臨床記録を直接生成する、KITのBeTraC 2026軽量トラック向けシステムを提示します。

2026-08-24 Method / Multi-Agent Systems / Meta-harness optimized agent framework

MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters

本論文は、大規模な基盤モデルの利用コストが高く、少数のサポートセットしか得られないリソース制約環境を対象として、軽量な時系列予測モデルのフューショット学習を研究しています。

2026-08-24 Evaluation / Scientific Agent Evaluation / Benchmarking scientific agents on Earth systems

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerseは、動的な地球システムや自然災害に関するマルチソース調査を実行する科学エージェントを評価するために設計されたベンチマークです。

2026-08-24 Method / World Modeling / Interactive and high-fidelity multi-step modeling

ReWorld: An Interactive World Model with Long-Horizon Memory

ReWorldは、ユーザーのカメラ操作への追従、過去に訪れた場所の記憶保持、およびリアルタイム動作を同時に実現するように設計されたインタラクティブなストリーミング世界モデルです。

2026-08-24 Method / Reinforcement Learning / Scaling RL for diffusion models

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

本論文は、拡散モデルにおける報酬ファインチューニングには尤度ベースの方策勾配機構は不要であり、モデル固有の速度表現で直接定式化可能であると主張している。

2026-08-24 Method / Optimization / Iterative harness updates from failures

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

本論文では、長期にわたるタスクにおいてLLMエージェントの外部ハーネスを自動的に改善するフレームワークであるAutoSaddlerを提案する。

2026-08-23 Method / Motion Prediction / Two-stage framework with intermediate representation

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

EMPIREは、マルチモーダルな観測と動作生成の間に明示的な操作計画を挿入する、一人称視点(エゴセントリック)の両手動作予測のための2段階フレームワークです。

2026-08-23 Method / MoE Routing / Routing-guided steering and selection

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

本論文では、外部ジャッジやパッチ実行による検証を用いずに、Mixture-of-Experts(MoE)のネイティブなルータートレースがソフトウェア工学エージェントのテスト時スケーリングを誘導できるかを検証しています。

2026-08-23 Method / Skill Reliability / Reliability interventions in skill selection

Coalition-Aware Skill Reliability for Self-Evolving Agents

本論文では、自己進化型LLMエージェントのスキルバンクに保存されたスキルが、単に集約された成果指標を向上させるだけでなく、正のメカニズム的貢献を果たしているかを調査しています。

2026-08-23 Evaluation / Model Safety Evaluation / Robustness against rebuttal attacks

Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation

本論文では、LLMに基づくヘイトスピーチモデレーションにおける判定後の攻撃対象領域として、モデルに当初の正しい判断を再検討させるアノテーター風の反論を検証しています。

2026-08-23 Method / Reinforcement Learning / Stage-aware dialogue modeling

DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue

DeepSAGEは、CBT(認知行動療法)の初回カウンセリングセッションを、治療目標と自動完了基準を持つ11の明示的な段階のシーケンスとして実施するためのLLMとDRLのハイブリッドフレームワークです。

2026-08-22 Method / Network Security / ML-based intrusion prevention

Autonomous Cyber Defense: Real-Time Attack Detection and Mitigation in Software-Defined Networks Using Machine Learning

本論文は、リアルタイムのトラフィック監視、機械学習に基づく攻撃診断、および自動緩和策を組み合わせた、ソフトウェア定義ネットワーク(SDN)向けの自動サイバー防衛システムを提案しています。

2026-08-22 Evaluation / Benchmarking / Benchmark for SfM in real-world scenarios

ORBIT++: Benchmarking SfM in the Wild with 360° Video

本論文では、オンラインの360度映像から得られた難度の高い実世界動画においてStructure-from-Motion(SfM)およびカメラ姿勢推定を評価するための、ORBITベンチマークの更新版であるORBIT++を提案しています。

2026-08-22 Method / Ranking Metrics / Normalized discounted cumulative gain reformulation

Revisiting N2DCG: An Empirically Grounded Reformulation of Carousel Recommendation Evaluation

本論文は、カルーセル型推薦インターフェース向けにNDCGを2次元へと拡張したN2DCGを再検証し、従来の定式化が実際のカルーセルレイアウトでは成り立たない前提を置いていると主張しています。

2026-08-22 Evaluation / Benchmarking / Composable compression quality assessment

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

本論文では、Mixture-of-Experts(MoE)大規模言語モデルにおける圧縮技術を個別のステップとしてではなく、エンドツーエンドの展開ワークフローとして評価するベンチマーク「MoE-XBench」を提案しています。

2026-08-22 Method / State Management / Techniques for storing utterance context in ASR

Beyond Fresh Starts: Stateful Inference for Streaming ASR in Conversational Voice Agents

本論文では、低遅延ストリーミングASRにおける状態(ステート)処理が対話型音声エージェントに与える影響を、ターンの境界、長い無音、短い相槌(バックチャネル)ターンに着目して分析しています。

2026-08-21 Application / Multi-Agent Coordination / System intelligence with LLM agents

Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

本論文は、複雑で長期的なタスクに対処するために、LLMベースのシステムが単一エージェントの個体知能から複数コンポーネントによるシステム知能へとどのように移行しているかを包括的に調査したサーベイです。

2026-08-21 Method / Adversarial Attacks / Critic-induced value-subspace attacks

CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents

本論文は、固定されたDreamerV3を対象として、視覚的世界モデルエージェントに対するホワイトボックスかつ因果的でオンラインの敵対的攻撃を研究している。

2026-08-21 Method / Federated Learning / Personalized FL with Lorentz embeddings

FlatLand: Personalized Graph Federated Learning via Tailored Lorentz Space

FlatLandは、共有されたユークリッド幾何学を仮定するのではなく、各クライアントを専用に調整されたローレンツ空間の埋め込みに配置するグラフデータ向けの個別化連合学習手法です。

2026-08-21 Method / Natural Language Generation / Generating adaptive explanations for errors

Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors

本論文は、LLMによって書き直されたPythonのエラーメッセージが、標準的なインタプリタの出力よりも効果的にプログラマーのデバッグを支援するかどうかを調査した研究です。

2026-08-21 Method / Policy Learning / Physics-informed code-as-policy agent

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaPは、視覚のみでは推論できない潜在的な物理特性に成否が依存するロボット操作タスクにおいて、能動的知覚を行うために設計された物理情報を活用するCode-as-Policyエージェントです。

2026-08-20 Evaluation / Visual Reasoning Evaluation / Assessing visual inference in video models

VGI-BENCH: Probing Visual Intelligence in Video Generation Models

本論文では、プロセスを重視した視覚的グラウンディングタスクを通じて動画生成モデルの視覚的知能を評価するベンチマークであるVGI-Benchを導入する。

2026-08-20 Method / Optimal Transport / Coupled OT framework with landmarks

Coupled Optimal Transport with Landmark Constraints

本論文は、輸送コストの最小化のみでは分布間の幾何学的に意味のある変換を特定できない場合があるという、標準的な最適輸送の課題に対処しています。

2026-08-20 Method / Model Routing / Query routing to experts

Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

本論文は、各候補スペシャリストの価値推定自体にコストがかかる状況におけるAIモデルルーティングを研究しています。

2026-08-20 Evaluation / Subjectivity Evaluation / Impact of subjectivity on accuracy and training

Rethinking the Evaluation and Optimization of LLM-Based Social Simulation

本論文は、人間の応答は本質的に決定論的ではなく分布的であるため、従来の正解率に基づく評価やハードラベル学習はLLMベースの社会シミュレーションに適していないと主張しています。

2026-08-20 Method / Self-Supervised Learning / Framework for audio representation

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

本論文では、因果的Transformerが先行するパッチから次のlog-melスペクトログラムパッチの埋め込みを予測する自己教師あり音声学習フレームワーク「NAPE」を提案しています。

2026-08-19 Method / Graph Neural Networks / Temporal-spatial particle graph transformer

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

本論文では、動的3D Gaussian再構成とダウンサンプリングされたキーポイント上のダイナミクスモデリングを組み合わせることで、限られた視覚的観測から物体の動きを予測するフレームワークであるDyG2Tを提案します。

2026-08-19 Method / Reward Modeling / Chain of omni reward model for multimodal generation

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

本論文では、個別の自動評価指標ではなく人間の選好フィードバックを用いて、動画・音声の共同生成に対する報酬モデリングを研究しています。

2026-08-19 Evaluation / Capability Analysis / Empirical study of agent abilities

What is Missing from AI Post-Training AI: An Empirical Analysis

本論文は、大規模言語モデルのエンドツーエンドな事後学習を実行するAIエージェントを調査し、実行レベルの能力(確立されたパイプライン内での反復)と戦略レベルの能力(根拠に基づいて高レベルのパラダイムやワークフローを改訂すること)を区別して評価しています。

2026-08-19 Method / Agent / Unified agentic system for documents

DocClaw: A Unified Agentic System for Intelligent Document Processing

DocClawは、OCR、文書質問応答(DocQA)、および重要情報抽出(KIE)をエージェントと文書間の反復的な相互作用として定式化する、インテリジェント文書処理のための統合エージェントシステムです。

2026-08-19 Method / Skill Learning / Training in-policy skill selection

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents

本論文では、エピソード中に候補群からどのスキルファイルを読み込むかを選択する必要がある長期エージェントにおける、方策内のスキル選択を研究しています。

2026-08-18 Evaluation / Benchmarking / Multi-domain AI system evaluation

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Benchは、人間の方法論的ガイダンスが段階的に削減される中で、AIシステムがプロジェクトレベルの科学研究を遂行できるかを評価するためのベンチマークである。

2026-08-18 Evaluation / Agent Safety Evaluation / Lifecycle phase safety benchmarking

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

本論文は、エージェントハーネスの安全性に関するライフサイクル指向のベンチマークであるHarnessRiskを紹介します。

2026-08-18 Method / Interpretable Models / Internal readout for reasoning states

Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing

本論文は、生成されたトレースに記述されている以上の潜在的な推論状態を明らかにするために、Mixture-of-Experts(MoE)推論モデル向けの2段階の内部読み出し(readout)手法を提案しています。

2026-08-18 Method / Visual Prompting / Compositional prompt learning framework

Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing

本論文は、モデルがクロスドメインシフトと未知の攻撃タイプの両方に対処しなければならない、オープンワールドの顔なりすまし検知について研究している。

2026-08-18 Method / Recommendation Models / LLM-based ranking framework

Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation

本論文は、識別的で埋め込みベースのランキング設定のもと、コンパクトな大規模言語モデル(LLM)を用いたスケーラブルなシーケンシャル推薦について研究している。

2026-08-17 Method / Video Editing / Visual in-context video editing paradigm

VicEdit: Learning to Edit Videos from Visual In-Context Examples

本論文は、テキストの指示に加えて、単一画像、画像ペア、またはビデオペアの形式で視覚的な例を補完するビデオ編集パラダイムである「Visual In-context Editing」を提案しています。

ページ基準日: 2026-08-27
Archive

アーカイブ

週次アーカイブ

15

インタラクティブモデルとエージェントのためのベンチマーク

今週のテーマは、モデル評価を狭いオフライン指標から、身体性世界モデルやマルチモーダルGUIエージェント向けの実行可能でタスクに根ざしたベンチマークへと移行させることに焦点を当てている。

2026-08-14 - 2026-08-20

幾何学を考慮した3D再構成と生成

本テーマは、視覚的な生成・再構成を幾何学、カメラパラメータ、シーン構造に明示的に基づかせることに関するものである。

2026-08-14 - 2026-08-20

スケーラブルな汎用強化学習

今週の強化学習研究は、RLシステムのさらなる汎用化、計算効率の向上、および高負荷な訓練体制下での安定性に焦点を当てている。

2026-08-14 - 2026-08-20

科学LLMの評価と適応

本テーマは、基盤モデルが科学的・マルチモーダルな用途に向けてどのように評価・改善されているかに焦点を当てており、事前学習戦略、データの現実性、効率的なクロスモーダル設計が重視されている。

2026-08-07 - 2026-08-13

スパースニューラル表面再構成

今週のテーマは、スパースビュー条件下でニューラル表面再構成の汎化性能と効率性の両立を目指す研究に焦点を当てている。

2026-08-07 - 2026-08-13

自己進化型LLMマルチエージェントシステム

本テーマは、静的で中央集権的に制御されるLLMエージェントから、役割・記憶・ツール・協調方法を時間とともに適応させる自己進化型・分散型マルチエージェントシステムへの移行を追跡する。

2026-08-07 - 2026-08-13

根拠付きマルチモーダルQAベンチマーク

マルチモーダル質問応答のベンチマーク研究は、モデルが浅い多肢選択の手がかりに頼るのではなく、証拠を検索・根拠付けすることが求められる、より困難で信頼性の高い評価設定を志向する傾向が強まっている。

2026-07-31 - 2026-08-06

コンピュータ操作エージェントの評価

コンピュータ操作およびGUIエージェントの評価は、タスク成功率の測定から、安全性・効率性・クロスプラットフォーム能力の診断へと移行しつつある。

2026-07-31 - 2026-08-06

オンライン模倣学習と世界モデル強化学習

代表的な論文群は、静的な模倣学習や標準的なモデルベース制御に共通する限界に収束している。

2026-07-31 - 2026-08-06

マルチモーダル推論評価

本テーマは、テキストのみのベンチマークを超えて進化する高性能な言語・マルチモーダルモデルの評価と制御のあり方に焦点を当てている。

2026-07-24 - 2026-07-30

マニピュレーションの汎化と評価

今週のテーマは、視覚のみの教師信号や狭い範囲で収集されたロボットデータでは不十分な、接触を多く伴う環境での身体的マニピュレーションの評価と改善に焦点を当てている。

2026-07-24 - 2026-07-30

LLMソフトウェア工学評価

このテーマは、狭いベンチマークや最終出力指標を超えた、AIコーディングアシスタントおよびソフトウェア工学エージェントの評価に焦点を当てている。

2026-07-24 - 2026-07-30

LLMコードエージェントの評価

本テーマは、現実的なソフトウェアエンジニアリングタスク、特にリポジトリレベルのイシュー解決におけるLLMベースコーディングエージェントの評価に焦点を当てている。

2026-07-17 - 2026-07-23

ロボット学習のための身体性世界モデル

今週のテーマは、身体性世界モデルをリアルな未来の生成だけでなく、ロボットポリシーの評価・監督・改善に活用することに焦点を当てている。

2026-07-17 - 2026-07-23

対話型LLM行動評価

今週のテーマは、単一ターンのテキスト品質だけでなく、対話的かつ社会的に根拠のある設定におけるLLMの行動評価に焦点を当てている。

2026-07-17 - 2026-07-23
このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。