FuguReport

FuguReport

最新の週次テーマと直近の日次レポートをまとめて確認できます。

ページ基準日: 2026-10-07
Weekly

2026-09-25 - 2026-10-01

Daily

最新の日次レポート

50 件のレポート
2026-10-07 Method / Model Optimization / Token pruning strategies in VLMs

Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs

本論文では、視覚的トークンプルーニングがマルチモーダル脱獄攻撃下における視覚言語モデルの安全性に与える影響を調査しています。

2026-10-07 Method / World-Action Models / Causal prediction with historical and future structure

Long-WAM: Scaling the Context of World-Action Models

Long-WAMは、リアルタイムなロボット制御の制約下において、因果的世界行動モデルの視覚コンテキストをスケーリングするためのモデルおよびシステムフレームワークです。

2026-10-07 Method / Hand Tracking / Monocular egocentric hand pose estimation

RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning

RLHNDは、事前学習済み動画拡散バックボーンを決定論的な特徴抽出器として利用し、3D両手動作と手表面の密な触覚信号の両方を予測する、単眼自己中心型動画向けの手追跡手法です。

2026-10-07 Method / Memory Mechanisms / Artifact-grounded memory layer

ExperienceIndex: Artifact-Grounded Memory

本論文では、過去の推論トレースから抽出された成果物に接地した経験を保存・再利用する、AIエージェント向けメモリレイヤーであるExperienceIndex(ExpIdx)を提案しています。

2026-10-07 Method / Graph Neural Networks / Long-range graph learning via operator-valued waves

Oscillatory Neural Dynamics over Sheaves

本論文では、2階の振動ダイナミクスと学習された行列値の層(シーフ)輸送作用素を組み合わせた、長距離グラフ学習のための層ニューラルネットワークフレームワークであるONDAを提案します。

2026-10-06 Method / Policy Verification / Scaling verification via co-evolution

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

VeriFineは、ポリシー、トレーニングカリキュラム、および判定器(judge)を共進化させることで、身体性推論における検証をスケーリングするエージェントハーネスフレームワークとして提案されています。

2026-10-06 Method / Backdoor Attack / Answer-side multi-turn triggers

The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models

本論文は、トリガーがユーザーの入力ではなくモデル自身の過去の応答に配置される、マルチターンにおけるバックドアの脅威を明らかにしています。

2026-10-06 Evaluation / Benchmarking / Deception capability assessment

DecepEval: A Benchmark for Evaluating Deception in LLM Agents

DecepEvalは、ツール利用と証拠報告、コーディングとテストの悪用、長期プロセスの完全性という3つのタスクファミリーにわたり、LLMエージェントの欺瞞的行動を体系的に評価するためのベンチマークです。

2026-10-06 Method / Retrieval / Unified retrieval with frozen LLM

UNREAL: Unifying Retrieval and Long-Context with a Single Model

UNREALは、単一の凍結されたデコーダー専用LLMをコーパス検索と長文コンテキスト推論の双方に用いる、モデルネイティブな根拠選択フレームワークです。

2026-10-06 Method / Memory Augmentation / Enhancing LLM with parametric memory

Towards In-Parameter Memory Augmentation for Large Language Models

本論文は、大規模言語モデル(LLM)のデプロイ時におけるパラメータ内メモリ(IPM)拡張に関するサーベイを提示しています。

2026-10-05 Application / Embodied AI / AI agent animating virtual body

Is this machine playing?

本論文では、明示的なタスクや報酬、成功指標が与えられていない未知のシミュレーション世界に配置された際、コーディングアシスタントベースの身体化エージェントがどのように振る舞うかを調査しています。

2026-10-05 Method / Physical Intelligence / Causally grounded planning

Grounding What Shapes the Plan: Rethinking Groundedness for Physical Intelligence in Autonomous Driving

本論文は、自動運転におけるグラウンディングされた推論は、最終的な行動に対して実質的な影響を及ぼし続けなければ不十分であると主張しています。

2026-10-05 Method / Bilevel Optimization / Single-loop stochastic bilevel method

A Single-Loop, Constant-Batch First-Order Penalty Method for Stochastic Bilevel Optimization

本論文では、1次確率的勾配のみを用いる非凸-強凸確率的2段階最適化問題を研究しています。

2026-10-05 Method / Model Safety Evaluation / Safety signals from latent knowledge

Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge

本論文では、内部の隠れ状態ではなく、最初のトークンの出力確率分布に含まれる潜在的な安全性シグナルを利用して有害なクエリを検出する大規模言語モデル向け防御手法「LADE」を提案しています。

2026-10-05 Method / Model Compression / Activation denoising in quantization

Activation Denoising: A Robustness View on Parallel vs Sequential LLM Quantization

本論文は、大規模言語モデルにおける並列および逐次的な学習後量子化のトレードオフを研究し、その性能差を上流での量子化誤差の累積に起因するロバスト性の問題として捉えています。

2026-10-04 Method / Task Planning / Topology-consistent task planning method

Topology-Consistent Task Planning over Cellular Workflow Complexes for LLM-based Agents

本論文では、順次またはDAG状の依存関係を超えるワークフロー構造を対象とした、LLMエージェント向けタスク計画フレームワークであるTopoPlannerを提案しています。

2026-10-04 Method / Self-Supervision / Multi-view self-verification

When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models

本論文は視覚言語モデル(VLM)における自己検証を研究し、モデルが現在の回答を信頼すべきタイミングと再考すべきタイミングに焦点を当てています。

2026-10-04 Method / Memory Management / Mask-guided KV cache eviction

Mask-Guided KV Cache Eviction in Block Diffusion Language Models

本論文では、デノイジング中に長いプレフィックスがメモリに保存され繰り返し読み出されるブロック拡散言語モデルを対象に、推論時のKey-Value(KV)キャッシュ管理を研究しています。

2026-10-04 Method / Reward Modeling / Generative reward modeling training

EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans

本論文は、生成型報酬モデル(GRM)が単に正確なペアワイズ嗜好判断を予測するだけでなく、その自然言語による批評が信頼性の高いものとなるように訓練する方法を調査しています。

2026-10-03 Method / Best Arm Identification / Fixed-budget best arm under privacy

Asymptotically Optimal Best Arm Identification with Fixed-Budget under Differential Privacy

本論文では、適応的なトランスクリプト全体を保護する必要がある純粋なε-差分プライバシー下でのベルヌーイバンディットにおける固定予算最良腕識別を研究しています。

2026-10-03 Method / Concept Representation / Metonymic circuit mechanism

Metonymic Circuits for Abstract Concept Grounding in Vision Transformers

本論文は、直接的な指示的教師データが乏しい状況において、Vision Transformerが画像内の抽象的な概念をどのように認識しているかを調査しています。

2026-10-03 Method / Multimodal Perception / Multi-sensory inference and feedback loop

ROMA: LLM System for Real-World Object-Centric Multi-Sensory Active Perception

本論文では、視覚、音響、触覚、および力覚センシングにまたがる推論・相互作用・フィードバックのループを完結させる、実世界における物体中心のアクティブ知覚のためのLLMベースのシステム「ROMA」を提案します。

2026-10-02 Method / Preference Learning / Modeling human preferences in text

Verifiable, Articulable, and Tacit Components of Preference

本論文は、人間の選好が明示的なルールによってどの程度捉えられ、何が言語化や検証の困難な要素として残るのかを調査している。

2026-10-02 Method / Graph Models / Cross-problem graph memory design

Continual Graph Memory for Mathematical Research Agents

本論文では、長期的な証明探索のための構造化メモリシステムであるContinual Graph Memoryを中心に構築された数学研究エージェント「Ansatz」を提案する。

2026-10-02 Method / Diffusion Models / Continuous latent diffusion modeling

Large Language Continuous Diffusion Models

本論文では、離散トークン状態ではなく操作可能な16次元の潜在軌道上で動作する、3Bおよび8Bパラメータの連続拡散言語モデルファミリー「Sigma」を提案しています。

2026-10-02 Method / Reward Modeling / Composing preference and rubric rewards

Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

本論文では、約500万件のペアワイズ投票で学習されたBradley–Terry人間の選好報酬と、オープンエンドでプロンプト条件付けされたルーブリック報酬を組み合わせた、オープンドメインのテキストから画像へのモデル向け事後学習レシピを提案します。

2026-10-02 Application / Robot Manipulation / Precise manipulation using active gaze

EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras

EyeRobot 2.

2026-10-01 Evaluation / Benchmarking / Research paper retrieval benchmark

ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

ScholarCatalystは、研究プロジェクトを有意義に前進させた、あるいは前進させ得た過去の論文を検索するためのベンチマークです。

2026-10-01 Method / Representation Learning / Geometry-supervised latent learning

GeoLatent: Geometry-Guided Latent Structuring with Routed Optimization for 3D Reasoning

GeoLatentは、位置、方向、大域的幾何学に対する分解された潜在表現を改善することにより、視覚言語モデルにおける3次元空間推論に対処します。

2026-10-01 Method / Video Understanding / Unified perception and response in streaming video

OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction

OneStreamerは、リアルタイムの知覚、再利用可能なメモリ形成、およびプロアクティブなタスク応答を単一の因果的生成プロセス内で統合するように設計された4Bストリーミング動画大規模言語モデルです。

2026-10-01 Method / Agent Design / Decomposition of agent components

Agents Are Systems, Not Models: Rethinking Agentic Evaluation

本論文は、エージェントの評価においてエージェントを固定されたモデルではなく構成可能なシステムとして扱うべきであると主張しています。

2026-10-01 Method / Diffusion Models / Hierarchical continuous diffusion process

Hierarchical Continuous Diffusion Language Models

本論文では、単一の逆過程において離散トークン生成と連続潜在軌道を結合する拡散フレームワークであるHierarchical Continuous Diffusion Language Models(HC-DLM)を提案します。

2026-09-30 Method / Action Modeling / Learning from historical trajectories

Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models

本論文では、ロボット操作におけるワールドアクションモデル向けのアクション経験辞書(AED)を提案しています。

2026-09-30 Method / Self-Distillation / On-policy training recipe

UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

本論文では、自身の視覚的批評を活用してその後の画像生成を改善するマルチモーダルモデル向け自己進化フレームワーク、UniEvo-VLを提案しています。

2026-09-30 Method / Diffusion Models / Looped transformer execution

Looped Diffusion Transformer

本論文では、各ノイズ除去ステップ内で共有されたTransformerブロックのグループを繰り返し実行することで、パラメータを追加することなく計算深度を深め、テキストから画像への拡散モデルをスケーリングする手法を調査しています。

2026-09-30 Method / Exploration Strategy / Tactile curiosity-based exploration

Tactile Curiosity Drives Robot Interaction

本論文では、認識的不確実性を感覚モダリティごとに分解し、触覚の不確実性を明示的に重み付けすることで、ロボットの行動を接触の多いインタラクションへと誘導する強化学習探索フレームワーク「TacEx」を提案しています。

2026-09-30 Evaluation / Agent Performance / False memory assessment

Beyond the Shadows of Plato's Cave: Evaluating False Memory in Autonomous Agents via Counterfactual Reasoning

本論文では、過去の経験から形成された記憶が新たな状況において不適切な信念をもたらすケースとして定義される、自律型エージェントにおける「偽の記憶(false memory)」を研究しています。

2026-09-29 Method / Video Generation / Generating diverse humanoid-object interaction videos

Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation

本論文では、少数の実世界の人間の動画からヒューマノイドの移動マニピュレーション(loco-manipulation)を学習させるreal-to-sim-to-realフレームワークであるPRISMを提案しています。

2026-09-29 Method / Language Modeling / System One model for Chinese inference

Chinese-Jev: Bringing System One Model to Chinese-Language Tasks

Chinese-Jevは、選択肢選択、命題判断、順序スコアリングなどの限定的な意思決定タスク向けに設計された中国語のSystem Oneモデルです。

2026-09-29 Method / Context Management / Zero-shot context management strategies

Context Language Models

本論文では、実行中のコンテキストを追記専用で拡張するのではなく、モデルが直接編集可能なファイルとして表現することで、コンテキスト管理をモデル本来のネイティブな能力とするContext Language Models(CLM)を提案しています。

2026-09-29 Method / 3D Representation Learning / Learning compact 3D scene representations

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

Imagine3D-LLMは、画像トークンとテキストトークンの間に学習可能な少数のガウス要約トークンを挿入し、回答を生成する前にそれらのトークンをコンパクトな3D Gaussian Splattingシーン表現へとデコードするマルチビュー対応のマルチモーダル大規模言語モデルです。

2026-09-29 Method / Meta-Reasoning / Structured inference control harness

Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning

本論文では、長時間動作する言語モデルエージェントにおいてタスク実行と制御決定を分離する推論時制御フレームワークである、エージェント的メタ推論(agentic meta-reasoning)を提案します。

2026-09-28 Evaluation / Vision Benchmarking / Assessment across 34 abilities and 55 benchmarks

Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision

本論文では、GPT-6 Astraを含む6つの最先端汎用AIシステムを対象に、コンピュータビジョンの9つの領域にわたる34の能力および55のベンチマークで評価を行っています。

2026-09-28 Method / Reinforcement Learning / Visual reward-based RL training

Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts

本論文では、検出器や視覚言語モデルなどの学習ベースの評価器ではなく、決定論的なプログラム検証器を用いて画像生成出力をスコアリングするフレームワークであるVerifiable Visual Rewards(VVR)を提案しています。

2026-09-28 Method / Spectral Analysis / Analyzing generative denoiser Jacobians

On the spectral properties of generative denoiser Jacobians

本論文では、拡散モデルやフローマッチングモデルで使用される生成的デノイザーのヤコビ行列を調査し、出力品質指標を超えてデノイザーの違いを特徴付ける手段としてそのスペクトルに着目しています。

2026-09-28 Method / Representation Learning / Learning structured world model dynamics

Bilinear World Models: Learning Representations with Structured Dynamics for Efficient Control

本論文では、潜在ダイナミクスを双線形パラメータ化に従うよう制約し、効率的な計画と制御を支援する正規化アクションマップを備えたJEPAスタイルの世界モデルを提案しています。

2026-09-28 Method / Environmental Modeling / 3D urban wind prediction framework

GeoWind2Plan: Mission-Time 3D Urban Wind Prediction for Energy-Efficient UAV Planning

GeoWind2Planは、UAVのミッション回廊に沿った建物を考慮した3次元都市風を予測し、その予測をエネルギー効率の高い軌道計画に活用するミッション時フレームワークです。

2026-09-27 Method / Reward Models / Conditional density reward estimation

Diffusion Reward Models

本論文では、報酬モデリングを単一のスカラー値の予測ではなく、プロンプトと応答のペアが与えられた際の報酬に関する条件付き密度推定として再構築するDiffusion Reward Models(DRM)を提案します。

2026-09-27 Method / World Models / Momentum-aware latent dynamics modeling

MomWorld: Momentum-Aware Latent World Model for Long-Horizon Autonomous Driving

MomWorldは、シーン構成と潜在モメンタム状態の双方を明示的にモデル化する、長期ホライズン自動運転向けの潜在ワールドモデルです。

2026-09-27 Method / Risk Management / Risk-controlled answer selection

Risk-Controlled Selective LLM Answering by Pricing Label-Free Checks

本論文は、明示的なリスク制御下におけるLLMの選択的回答を研究し、回答を提供すべきか棄権すべきかを判断する方法に焦点を当てています。

ページ基準日: 2026-10-07
Archive

アーカイブ

週次アーカイブ

15

継続的視覚表現学習

本テーマは、新しいクラスを学習しながら有用な視覚表現を保持することを中心とする。

2026-09-25 - 2026-10-01

物理に基づくロボット学習とRLファインチューニング

今週のテーマは、物理的に裏付けられたデモンストレーション生成と強化学習によるファインチューニングを結び付け、ロボットデータの不足とデモンストレーションの限られたカバレッジという課題に取り組むものである。

2026-09-25 - 2026-10-01

編集と拡散モデルの評価

今週の知見は、集計的な生成品質を超えた評価の重要性を強調している。

2026-09-25 - 2026-10-01

自己回帰型動画のためのメモリと表現

自己回帰型動画モデルの研究は、互いに関連する二つの課題を中心に展開している。

2026-09-18 - 2026-09-24

オープンLLMのポストトレーニングと評価

本テーマは、評価と検証がデータ選択、選好チューニング、強化学習を導く、オープンで多段階のLLMポストトレーニングを中心とする。

2026-09-18 - 2026-09-24

適応的マルチモーダル表現学習

本テーマは、一様な処理に頼るのではなく、異種の視覚・言語入力に合わせて表現を適応させることを中心とする。

2026-09-18 - 2026-09-24

LLM KVキャッシュ圧縮

本テーマは、急速に増大するKVキャッシュのメモリフットプリントを削減し、長コンテキストLLM推論を実用化することを中心に据えている。

2026-09-11 - 2026-09-17

複雑系のための基盤型ワールドモデル

本テーマは、直接的な回答生成を超えて、意思決定や予測の前にシステムの基盤的なダイナミクスをシミュレートするモデルへの移行を中心としている。

2026-09-11 - 2026-09-17

全二重対話の評価

本テーマは、聞きながら同時に話す音声言語システムの評価に焦点を当て、従来のターンベース評価を超える方向へ進んでいる。

2026-09-11 - 2026-09-17

統合マルチモーダル表現学習

今週のテーマは、単一のシステムで画像の理解・生成・編集を行うマルチモーダルモデルにおいて、視覚情報をどのように表現すべきかに焦点を当てている。

2026-09-04 - 2026-09-10

頑健な音声認識システム

本テーマは、クリーンな単一話者条件を超えて動作する音声認識システムを扱い、騒音環境・遮音環境、話者重複、チャネル不一致への対応を対象とする。

2026-09-04 - 2026-09-10

リスク制御された自己改善

本テーマは、学習システムが自身を改善したり推論を修正したりする際に、有害な変更を暗黙的に蓄積しない方法に焦点を当てている。

2026-09-04 - 2026-09-10

翻訳・エージェント向け評価ベンチマーク

今週のテーマは、簡易的なテスト設定ではなく、より現実的で高制約のベンチマークへと評価が移行している点に焦点を当てている。

2026-08-28 - 2026-09-03

3D再構成と動的ガウシアンモデリング

本テーマは、純粋な光度フィッティングを超え、スパースビューや単眼条件下での3D/4D再構成・レンダリングの実用化を目指すものである。

2026-08-28 - 2026-09-03

強化学習における目的関数設計

本テーマは、標準的な期待リターン訓練を超えて、強化学習が何を最適化すべきかを再考することに焦点を当てている。

2026-08-28 - 2026-09-03
このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。