FuguReport
最新の週次テーマと直近の日次レポートをまとめて確認できます。
2026-09-25 - 2026-10-01
最新の日次レポート
Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs
本論文では、視覚的トークンプルーニングがマルチモーダル脱獄攻撃下における視覚言語モデルの安全性に与える影響を調査しています。
Long-WAM: Scaling the Context of World-Action Models
Long-WAMは、リアルタイムなロボット制御の制約下において、因果的世界行動モデルの視覚コンテキストをスケーリングするためのモデルおよびシステムフレームワークです。
RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning
RLHNDは、事前学習済み動画拡散バックボーンを決定論的な特徴抽出器として利用し、3D両手動作と手表面の密な触覚信号の両方を予測する、単眼自己中心型動画向けの手追跡手法です。
ExperienceIndex: Artifact-Grounded Memory
本論文では、過去の推論トレースから抽出された成果物に接地した経験を保存・再利用する、AIエージェント向けメモリレイヤーであるExperienceIndex(ExpIdx)を提案しています。
Oscillatory Neural Dynamics over Sheaves
本論文では、2階の振動ダイナミクスと学習された行列値の層(シーフ)輸送作用素を組み合わせた、長距離グラフ学習のための層ニューラルネットワークフレームワークであるONDAを提案します。
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
VeriFineは、ポリシー、トレーニングカリキュラム、および判定器(judge)を共進化させることで、身体性推論における検証をスケーリングするエージェントハーネスフレームワークとして提案されています。
The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models
本論文は、トリガーがユーザーの入力ではなくモデル自身の過去の応答に配置される、マルチターンにおけるバックドアの脅威を明らかにしています。
DecepEval: A Benchmark for Evaluating Deception in LLM Agents
DecepEvalは、ツール利用と証拠報告、コーディングとテストの悪用、長期プロセスの完全性という3つのタスクファミリーにわたり、LLMエージェントの欺瞞的行動を体系的に評価するためのベンチマークです。
UNREAL: Unifying Retrieval and Long-Context with a Single Model
UNREALは、単一の凍結されたデコーダー専用LLMをコーパス検索と長文コンテキスト推論の双方に用いる、モデルネイティブな根拠選択フレームワークです。
Towards In-Parameter Memory Augmentation for Large Language Models
本論文は、大規模言語モデル(LLM)のデプロイ時におけるパラメータ内メモリ(IPM)拡張に関するサーベイを提示しています。
Is this machine playing?
本論文では、明示的なタスクや報酬、成功指標が与えられていない未知のシミュレーション世界に配置された際、コーディングアシスタントベースの身体化エージェントがどのように振る舞うかを調査しています。
Grounding What Shapes the Plan: Rethinking Groundedness for Physical Intelligence in Autonomous Driving
本論文は、自動運転におけるグラウンディングされた推論は、最終的な行動に対して実質的な影響を及ぼし続けなければ不十分であると主張しています。
A Single-Loop, Constant-Batch First-Order Penalty Method for Stochastic Bilevel Optimization
本論文では、1次確率的勾配のみを用いる非凸-強凸確率的2段階最適化問題を研究しています。
Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge
本論文では、内部の隠れ状態ではなく、最初のトークンの出力確率分布に含まれる潜在的な安全性シグナルを利用して有害なクエリを検出する大規模言語モデル向け防御手法「LADE」を提案しています。
Activation Denoising: A Robustness View on Parallel vs Sequential LLM Quantization
本論文は、大規模言語モデルにおける並列および逐次的な学習後量子化のトレードオフを研究し、その性能差を上流での量子化誤差の累積に起因するロバスト性の問題として捉えています。
Topology-Consistent Task Planning over Cellular Workflow Complexes for LLM-based Agents
本論文では、順次またはDAG状の依存関係を超えるワークフロー構造を対象とした、LLMエージェント向けタスク計画フレームワークであるTopoPlannerを提案しています。
When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models
本論文は視覚言語モデル(VLM)における自己検証を研究し、モデルが現在の回答を信頼すべきタイミングと再考すべきタイミングに焦点を当てています。
Mask-Guided KV Cache Eviction in Block Diffusion Language Models
本論文では、デノイジング中に長いプレフィックスがメモリに保存され繰り返し読み出されるブロック拡散言語モデルを対象に、推論時のKey-Value(KV)キャッシュ管理を研究しています。
EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans
本論文は、生成型報酬モデル(GRM)が単に正確なペアワイズ嗜好判断を予測するだけでなく、その自然言語による批評が信頼性の高いものとなるように訓練する方法を調査しています。
Asymptotically Optimal Best Arm Identification with Fixed-Budget under Differential Privacy
本論文では、適応的なトランスクリプト全体を保護する必要がある純粋なε-差分プライバシー下でのベルヌーイバンディットにおける固定予算最良腕識別を研究しています。
Metonymic Circuits for Abstract Concept Grounding in Vision Transformers
本論文は、直接的な指示的教師データが乏しい状況において、Vision Transformerが画像内の抽象的な概念をどのように認識しているかを調査しています。
ROMA: LLM System for Real-World Object-Centric Multi-Sensory Active Perception
本論文では、視覚、音響、触覚、および力覚センシングにまたがる推論・相互作用・フィードバックのループを完結させる、実世界における物体中心のアクティブ知覚のためのLLMベースのシステム「ROMA」を提案します。
Verifiable, Articulable, and Tacit Components of Preference
本論文は、人間の選好が明示的なルールによってどの程度捉えられ、何が言語化や検証の困難な要素として残るのかを調査している。
Continual Graph Memory for Mathematical Research Agents
本論文では、長期的な証明探索のための構造化メモリシステムであるContinual Graph Memoryを中心に構築された数学研究エージェント「Ansatz」を提案する。
Large Language Continuous Diffusion Models
本論文では、離散トークン状態ではなく操作可能な16次元の潜在軌道上で動作する、3Bおよび8Bパラメータの連続拡散言語モデルファミリー「Sigma」を提案しています。
Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards
本論文では、約500万件のペアワイズ投票で学習されたBradley–Terry人間の選好報酬と、オープンエンドでプロンプト条件付けされたルーブリック報酬を組み合わせた、オープンドメインのテキストから画像へのモデル向け事後学習レシピを提案します。
EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras
EyeRobot 2.
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research
ScholarCatalystは、研究プロジェクトを有意義に前進させた、あるいは前進させ得た過去の論文を検索するためのベンチマークです。
GeoLatent: Geometry-Guided Latent Structuring with Routed Optimization for 3D Reasoning
GeoLatentは、位置、方向、大域的幾何学に対する分解された潜在表現を改善することにより、視覚言語モデルにおける3次元空間推論に対処します。
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
OneStreamerは、リアルタイムの知覚、再利用可能なメモリ形成、およびプロアクティブなタスク応答を単一の因果的生成プロセス内で統合するように設計された4Bストリーミング動画大規模言語モデルです。
Agents Are Systems, Not Models: Rethinking Agentic Evaluation
本論文は、エージェントの評価においてエージェントを固定されたモデルではなく構成可能なシステムとして扱うべきであると主張しています。
Hierarchical Continuous Diffusion Language Models
本論文では、単一の逆過程において離散トークン生成と連続潜在軌道を結合する拡散フレームワークであるHierarchical Continuous Diffusion Language Models(HC-DLM)を提案します。
Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models
本論文では、ロボット操作におけるワールドアクションモデル向けのアクション経験辞書(AED)を提案しています。
UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement
本論文では、自身の視覚的批評を活用してその後の画像生成を改善するマルチモーダルモデル向け自己進化フレームワーク、UniEvo-VLを提案しています。
Looped Diffusion Transformer
本論文では、各ノイズ除去ステップ内で共有されたTransformerブロックのグループを繰り返し実行することで、パラメータを追加することなく計算深度を深め、テキストから画像への拡散モデルをスケーリングする手法を調査しています。
Tactile Curiosity Drives Robot Interaction
本論文では、認識的不確実性を感覚モダリティごとに分解し、触覚の不確実性を明示的に重み付けすることで、ロボットの行動を接触の多いインタラクションへと誘導する強化学習探索フレームワーク「TacEx」を提案しています。
Beyond the Shadows of Plato's Cave: Evaluating False Memory in Autonomous Agents via Counterfactual Reasoning
本論文では、過去の経験から形成された記憶が新たな状況において不適切な信念をもたらすケースとして定義される、自律型エージェントにおける「偽の記憶(false memory)」を研究しています。
Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation
本論文では、少数の実世界の人間の動画からヒューマノイドの移動マニピュレーション(loco-manipulation)を学習させるreal-to-sim-to-realフレームワークであるPRISMを提案しています。
Chinese-Jev: Bringing System One Model to Chinese-Language Tasks
Chinese-Jevは、選択肢選択、命題判断、順序スコアリングなどの限定的な意思決定タスク向けに設計された中国語のSystem Oneモデルです。
Context Language Models
本論文では、実行中のコンテキストを追記専用で拡張するのではなく、モデルが直接編集可能なファイルとして表現することで、コンテキスト管理をモデル本来のネイティブな能力とするContext Language Models(CLM)を提案しています。
Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering
Imagine3D-LLMは、画像トークンとテキストトークンの間に学習可能な少数のガウス要約トークンを挿入し、回答を生成する前にそれらのトークンをコンパクトな3D Gaussian Splattingシーン表現へとデコードするマルチビュー対応のマルチモーダル大規模言語モデルです。
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
本論文では、長時間動作する言語モデルエージェントにおいてタスク実行と制御決定を分離する推論時制御フレームワークである、エージェント的メタ推論(agentic meta-reasoning)を提案します。
Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision
本論文では、GPT-6 Astraを含む6つの最先端汎用AIシステムを対象に、コンピュータビジョンの9つの領域にわたる34の能力および55のベンチマークで評価を行っています。
Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts
本論文では、検出器や視覚言語モデルなどの学習ベースの評価器ではなく、決定論的なプログラム検証器を用いて画像生成出力をスコアリングするフレームワークであるVerifiable Visual Rewards(VVR)を提案しています。
On the spectral properties of generative denoiser Jacobians
本論文では、拡散モデルやフローマッチングモデルで使用される生成的デノイザーのヤコビ行列を調査し、出力品質指標を超えてデノイザーの違いを特徴付ける手段としてそのスペクトルに着目しています。
Bilinear World Models: Learning Representations with Structured Dynamics for Efficient Control
本論文では、潜在ダイナミクスを双線形パラメータ化に従うよう制約し、効率的な計画と制御を支援する正規化アクションマップを備えたJEPAスタイルの世界モデルを提案しています。
GeoWind2Plan: Mission-Time 3D Urban Wind Prediction for Energy-Efficient UAV Planning
GeoWind2Planは、UAVのミッション回廊に沿った建物を考慮した3次元都市風を予測し、その予測をエネルギー効率の高い軌道計画に活用するミッション時フレームワークです。
Diffusion Reward Models
本論文では、報酬モデリングを単一のスカラー値の予測ではなく、プロンプトと応答のペアが与えられた際の報酬に関する条件付き密度推定として再構築するDiffusion Reward Models(DRM)を提案します。
MomWorld: Momentum-Aware Latent World Model for Long-Horizon Autonomous Driving
MomWorldは、シーン構成と潜在モメンタム状態の双方を明示的にモデル化する、長期ホライズン自動運転向けの潜在ワールドモデルです。
Risk-Controlled Selective LLM Answering by Pricing Label-Free Checks
本論文は、明示的なリスク制御下におけるLLMの選択的回答を研究し、回答を提供すべきか棄権すべきかを判断する方法に焦点を当てています。
アーカイブ
週次アーカイブ
15継続的視覚表現学習
本テーマは、新しいクラスを学習しながら有用な視覚表現を保持することを中心とする。
物理に基づくロボット学習とRLファインチューニング
今週のテーマは、物理的に裏付けられたデモンストレーション生成と強化学習によるファインチューニングを結び付け、ロボットデータの不足とデモンストレーションの限られたカバレッジという課題に取り組むものである。
編集と拡散モデルの評価
今週の知見は、集計的な生成品質を超えた評価の重要性を強調している。
自己回帰型動画のためのメモリと表現
自己回帰型動画モデルの研究は、互いに関連する二つの課題を中心に展開している。
オープンLLMのポストトレーニングと評価
本テーマは、評価と検証がデータ選択、選好チューニング、強化学習を導く、オープンで多段階のLLMポストトレーニングを中心とする。
適応的マルチモーダル表現学習
本テーマは、一様な処理に頼るのではなく、異種の視覚・言語入力に合わせて表現を適応させることを中心とする。
LLM KVキャッシュ圧縮
本テーマは、急速に増大するKVキャッシュのメモリフットプリントを削減し、長コンテキストLLM推論を実用化することを中心に据えている。
複雑系のための基盤型ワールドモデル
本テーマは、直接的な回答生成を超えて、意思決定や予測の前にシステムの基盤的なダイナミクスをシミュレートするモデルへの移行を中心としている。
全二重対話の評価
本テーマは、聞きながら同時に話す音声言語システムの評価に焦点を当て、従来のターンベース評価を超える方向へ進んでいる。
統合マルチモーダル表現学習
今週のテーマは、単一のシステムで画像の理解・生成・編集を行うマルチモーダルモデルにおいて、視覚情報をどのように表現すべきかに焦点を当てている。
頑健な音声認識システム
本テーマは、クリーンな単一話者条件を超えて動作する音声認識システムを扱い、騒音環境・遮音環境、話者重複、チャネル不一致への対応を対象とする。
リスク制御された自己改善
本テーマは、学習システムが自身を改善したり推論を修正したりする際に、有害な変更を暗黙的に蓄積しない方法に焦点を当てている。
翻訳・エージェント向け評価ベンチマーク
今週のテーマは、簡易的なテスト設定ではなく、より現実的で高制約のベンチマークへと評価が移行している点に焦点を当てている。
3D再構成と動的ガウシアンモデリング
本テーマは、純粋な光度フィッティングを超え、スパースビューや単眼条件下での3D/4D再構成・レンダリングの実用化を目指すものである。
強化学習における目的関数設計
本テーマは、標準的な期待リターン訓練を超えて、強化学習が何を最適化すべきかを再考することに焦点を当てている。