ランキング(注目度スコア)
スコア算出日: 2026-06-30
合計スコア = √(HF Upvotes) + √(GitHub Stars) + cvFactor + venueBonus(HF・Stars が 0 のとき各 √ 項は 0、cvFactor は LLM による 100 点満点、venueBonus は学会採択加点)(算定方法の詳細)
「Spatial Computing Weekly」の創刊にあたり、我々は2026年上半期のコンピュータビジョンおよび空間コンピューティング分野における膨大な論文群を遡及調査しました。この半年間、研究の潮流は単なる「3D再構築」の枠を超え、マルチモーダルな入力を受けて動的な世界をシミュレーションする「ワールドモデル」へと劇的な進化を遂げています。特にGaussian Splatting(3DGS)を核とした生成技術と、パノラマ画像からの高精度な空間理解、そしてビデオ・リシューティングといった「時間軸(4D)」を伴う空間制御技術が、次世代の空間コンピューティングを形作る主要な柱となっています。本レポートでは、これらのトレンドを象徴するトップ12の論文を厳選して紹介します。
トップ5の深掘り
【第1位】HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
概要 テキスト、単一画像、マルチビュー画像、ビデオといった多様なモダリティを統合的に処理し、ナビゲーション可能な高精度な3D Gaussian Splatting (3DGS) シーンを生成するマルチモーダル・ワールドモデル・フレームワーク。
新規性 テキストや単一画像から高品質な3Dシーンを生成するため、パノラマ生成から始まる4段階のプロセスを導入。従来の生成モデルよりも、シミュレーションに耐えうる一貫した3D世界表現の構築に成功している。
なぜ選ばれたか(スコア内訳を数字で) 合計スコア154.27(HF 127, ★2304, cvFactor 95)という圧倒的な数値。特にGitHubでのスター数2304★は、この技術がコミュニティにおいて極めて高い実用性と注目を集めていることを示している。
関連リンク: arXiv | Hugging Face | GitHub
【第2位】InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields
概要 従来の離散的なグリッド表現による深度推定の限界を打破し、Neural Implicit Fields(神経暗黙場)を用いて、任意の解像度で微細な深度推定を可能にする手法。
新規ity 局所的な暗黙デコーダを介することで、連続的な2D座標に対して深度をクエリできるようにし、解像度に依存しない極めて精細な幾何学的詳細の復元を実現した。
なぜ選ばれたか(スコア内訳を数字で) 合計スコア134.34(HF 104, ★1033, cvFactor 92)。解像度の制約を排除するという、コンピュータビジョンの長年の課題に対する強力な回答として高い評価を得た。
関連リンク: arXiv | Hugging Face | GitHub
【第3位】Vista4D: Video Reshooting with 4D Point Clouds
概要 入力ビデオとターゲットカメラを4Dポイントクラウドに接地させることで、動的なシーンを異なるカメラ軌跡や視点から再合成するビデオ・リシューティング・フレームワーク。
新規性 既存手法が苦戦していた、現実世界の動的ビデオにおける深度推定のアーティファクトを克服。コンテンツの外見を維持しつつ、困難なシナリオでも精密なカメラ制御を可能にした。
なぜ選ばれたか(スコア内訳を数字で) 合計スコア129.70(HF 12, ★540, cvFactor 88)。CVPR 2026への採択論文であり、動的シーンの空間制御における重要性が認められている。
関連リンク: arXiv | Hugging Face | GitHub
【第4位】Genie Sim PanoRecon: Fast Immersive Scene Generation from Single-View Panorama
概要 ロボットの操作シミュレーション向けに、単一のパノラマ画像から高品質かつ低コストな3Dシーンを高速生成する、フィードフォワードなGaussian Splattingパイプライン。
新規性 パノラマを6つのキューブマップ面に分解して並列処理し、深度を考慮した融合戦略と訓練不要の深度注入モジュールを用いることで、幾何学的な一貫性を保証している。
なぜ選ばれたか(スコア内訳を数字で) 合計スコア127.83(HF 0, ★1078, cvFactor 95)。GitHubでのスター数が1078★と非常に高く、ロボティクス分野における実用的な需要が極めて高い。
関連リンク: arXiv | Hugging Face | GitHub
【第5位】PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery
概要 パノラマ画像の歪みを克服し、単一または複数のパノラマからカメラ姿勢、深度マップ、3Dポイントクラウドを単一のフォワードパスで予測するフレームワーク。
新規性 置換等変性(Permutation-equivariant)を持つTransformerを採用。従来のパースペクティブカメラ向けモデルでは困難だった、パノラマ特有の歪みを含む3D再構築を解決した。
なぜ選ばれたか(スコア内訳を数字で) 合計スコア124.32(HF 3, ★92, cvFactor 98)。CVPR 2026採択論文であり、パノラマ画像を用いた3D再構築の基盤技術として高いポテンシャルを持つ。
関連リンク: arXiv | Hugging Face | GitHub
第6位〜第12位 クイックレビュー
【第6位】CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video パースペクティブビデオから、時空間的な自己回帰モデルを用いて4Kの360度ビデオを生成する技術。 関連リンク: arXiv | Hugging Face | GitHub
【第7位】tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction テスト時学習(Test-Time Training)を活用することで、長いコンテキストを持つ自己回帰的な3D再構築を可能にする手法。 関連リンク: arXiv | Hugging Face | GitHub
【第8位】UniSHARP: Universal Sharp Monocular View Synthesis 単眼画像から、極めて鮮明なビュー合成を実現するユニバーサルな手法。 関連リンク: arXiv | Hugging Face | GitHub
【第9位】MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold パノラマGaussian Scaffoldを利用して、ビデオの世界モデルをリアルタイムで構築する技術。 関連リンク: arXiv | Hugging Face | GitHub
【第10位】Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing 強化学習を用いて、2Dでの編集を3Dのマルチビュー一貫性で検証・実行するシーン編集技術。 関連リンク: arXiv | Hugging Face | GitHub
【第11位】MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources ノイズを含む多様なデータソースを用いて、メトリック深度(実寸深度)の事前学習をスケールアップさせる手法。 関連リンク: arXiv | Hugging Face | GitHub
【第12位】SonoWorld: From One Image to a 3D Audio-Visual Scene 一枚の画像から、音響と視覚が統合された3Dシーンを生成する技術。 関連リンク: arXiv | Hugging Face | GitHub
編集後記
今回の調査を通じて、3D再構築の分野は「静止した形状の復元」から「動的な世界そのものの生成・シミュレーション」へと、その目的関数が明らかに変化していることが分かります。特に、AIが生成する空間が、単なる見た目だけでなく、物理的な整合性や音響的なリアリティ、そしてロボットが干渉可能な「意味のある空間」へと進化している点は非常にエキサイティングです。次号では、これらの技術がどのようにウェアラブルデバイスやロボティクスに実装されていくのか、その実装フェーズの動向に焦点を当ててお伝えします。お楽しみに。