動いている人を3D動画にできるのか〜4D Gaussian Splattingで何が必要か調べてみた
動いている人を3D空間ごと記録できるという4D Gaussian Splatting(4DGS)について、自分のRTX 3090で動かせるのかを調べてみました。ふだんはUbuntu PCにRTX 3090とRTX 3060の2枚を挿して、ローカルLLMや画像生成の検証をしている環境です。
前回の記事で、スマホで撮った写真から静止物の3Dモデルを作るフォトグラメトリを紹介しました。ただ、あれはあくまで「静止した物体」の話です。動いている人——たとえば踊っている人、遊んでいる子ども、ステージで動いている人——を3D空間に記録して、あとから自由な角度で見返す。これはフォトグラメトリでは原理的に不可能でした。撮影中に被写体が動いたら3Dモデルが破綻するからです。
2026年に入って、この壁を越える技術がついに実用レベルに近づいてきました。4D Gaussian Splatting(4DGS)です。3D Gaussian Splattingに「時間軸」を加えた技術で、動きのあるシーンを丸ごと自由視点映像として再構成できます。
本記事は、手元の環境で4DGSができるのかどうかを調べた記録です。まだ実際には撮影も処理もしていません。何が必要で、どこに壁があるのかを、公開されている情報から整理しました。
動いている人を3D動画にすることは、個人の手元でどこまでできるのでしょうか。
3DGSでは、異なる角度から撮った写真のそれぞれの瞬間を「同じ静止シーンの別視点」として扱います。時間が経過しても被写体は動かない前提です。
4DGSでは、各フレームが「ある時刻における3Dシーン」を表します。時刻tのフレーム群から3Dシーンを復元し、時刻t+1のフレーム群からまた別の3Dシーンを復元する。この連続が「動く3D映像」を構成します。
3D空間内の任意の点 x における、あるガウス球の影響度は以下の式で計算されます。
現在主流なのはDeformable 3DGSベースのアプローチのようです。
三脚はダイソーやセリアで売っているスマホ用クリップ付きのもので十分です。3台なら1,500円〜3,000円程度の出費で揃います。
被写体を中心に正面+左右60度の扇形に配置します。正面側の約120度をカバーできます。背面は撮れないので、被写体が主にカメラ側を向いている前提です。
6台の場合:
被写体を中心に等間隔60度で6台を配置します。全方向360度をカバーできるので、どの角度から見ても穴が少なくなります。ただしスマホ6台の確保がハードルです。家族や友人のスマホを借りるのが現実的でしょう。
スマホ6台で360度を狙うのとは真逆のアプローチです。3台を近い角度に集中させることで、「客席の最前列で頭を少し動かしたときの視差」を再現します。ライブやダンスの記録では、この配置が没入感の高い6DoF映像(前後左右と上下、さらに見る向きまで自由に動かせる映像)を生み出します。
[kimono_bar title="解像度別:VRAM使用量(30秒動画、RTX 3090)" unit="GB" color="#e53935″ highlight="4″ max="28″]
1080p|10
2K|14
4K|20
5.7K|24
[/kimono_bar]
[kimono_bar title="解像度別:合計処理時間(30秒動画、RTX 3090)" unit="時間" color="#1976d2″ highlight="1″ max="10″]
1080p|1
2K|2
4K|4
5.7K|8
[/kimono_bar]
自前処理の最大のメリットは「データを外に出さなくて済む」ことです。子どもの映像や、許諾が必要な出演者の映像など、プライバシー面でクラウド送信に抵抗がある場合は、ローカル処理一択です。
逆に、「とにかく早く結果を見たい」「GPU環境がない」ならクラウドに任せるのが合理的です。ただし4DGSを丸ごと引き受けてくれるサービスはまだ無いので、当面はGPUを時間貸しで借りて自分で回す形になりそうです。
調べた範囲では、まず無償公開されているWebビューワーで見て、VRで見たい場合はUnityで自作するのが現状の流れのようです。 Quest 3向けのネイティブ4DGSビューワーは2026年4月時点ではまだ成熟しておらず、BDViewerの4DGS対応も実験的な段階です。
Gracia AIのWebXRは法人利用がメインですが、技術的にはQuest、Pico、Vision Proの各デバイスをWebブラウザ経由でサポートしているのが強みです。将来的にこういったプラットフォームが個人にも開放されれば、デバイスを選ばない4DGS再生が普通になるかもしれません。
目次
3DGS(静止)と4DGS(動的)の違い
3DGSと4DGSの関係を整理します。3DGS(3D Gaussian Splatting)は2023年にSIGGRAPHで発表され、2024年から急速に広まった3D再構成の技術で、写真や動画から静止シーンのフォトリアルな3D表現を作ります。4DGSはこれに時間軸を追加したもので、「動きのある3Dシーン」を扱えます。| 項目 | 3DGS(静止) | 4DGS(動的) |
|---|---|---|
| 入力 | 写真20〜50枚、または動画 | 同期された複数視点動画(1台でも可) |
| 出力 | 静止した3Dシーン | 時間軸を持つ3D動画 |
| 対象 | 建物、部屋、静物 | 人物の動き、パフォーマンス、動く物体 |
| 処理時間(30秒分) | 10〜30分 | 1時間〜半日 |
| GPU要件 | RTX 3060以上(12GB VRAM=GPUに載る作業用メモリ) | RTX 3090推奨(24GB VRAM) |
| 再生方法 | Webブラウザ、VRヘッドセット | 専用ビューワー、WebXR |
3D Gaussian Splattingの数式を直感的に理解する
4DGSを理解するには、まず土台となる3DGSの仕組みを知る必要があります。数式が出てきますが、一つひとつ「何をやっているか」を説明していきます。ガウス分布で空間を表現する
従来の3Dモデルは「三角形の集合体(メッシュ)」で表現していました。3DGSはまったく異なるアプローチで、3D空間に無数の「ぼやけた光の球」を配置して、その重ね合わせでシーンを表現します。 1つのガウス球(3D Gaussian)は、以下のパラメータを持ちます。| パラメータ | 数式記号 | 直感的な意味 |
|---|---|---|
| 位置 | μ(ミュー) | 球の中心がどこにあるか(x, y, z座標) |
| 共分散行列 | Σ(シグマ) | 球の大きさと向き(楕円形に伸びている方向と度合い) |
| 不透明度 | α(アルファ) | 球の濃さ(透明〜完全に不透明) |
| 色 | SH係数 | 見る角度によって変わる色(球面調和関数で表現) |
G(x) = exp( -1/2 · (x - μ)ᵀ · Σ⁻¹ · (x - μ) )
要点: ガウス球の中心(μ)に近い点ほどG(x)が1に近づき、遠い点ほど0に近づく。要するに「中心が明るくて、端に行くほどフェードアウトする光の球」です。この球を数十万〜数百万個、空間中にばらまくことで、複雑なシーンを表現します。1つの球が壁のレンガ1個分、木の葉1枚分、といった感覚です。
レンダリング(3Dデータを画面に映る絵として描き出す処理):カメラから見た色をどう計算するか
3DGSのレンダリングは、カメラの視線方向に沿って手前から奥に向かってガウス球を重ね合わせます。各ピクセルの色 C は以下の式で計算されます。C = Σᵢ cᵢ · αᵢ · Tᵢ ただし Tᵢ = Π(j<i) (1 - αⱼ)
要点: 手前のガウス球から順番に色を重ねていく。手前の球が不透明(αが大きい)なら、奥の球はほとんど見えなくなる。半透明なら奥が透けて見える。これは、色つきのセロハンを何枚も重ねて向こう側を見るのと同じ原理です。Tᵢは「このガウス球より手前の球がどれだけ光を遮っているか」を表す透過率で、手前が濃いほどTᵢは小さくなり、奥の球の影響が弱まります。
この計算は並列化しやすいため、GPUで高速に処理できます。だからこそ3DGSはリアルタイムレンダリング(30fps以上)が可能なのです。
4DGSへの拡張:時間軸の追加方法
3DGSでは各ガウス球のパラメータ(μ, Σ, α, 色)は固定でした。4DGSではこれらを時間 t の関数にします。μ(t) = μ₀ + Δμ(t) ← 位置が時間とともに変化 Σ(t) = Σ₀ + ΔΣ(t) ← 形状が時間とともに変化 α(t) = α₀ + Δα(t) ← 不透明度が時間とともに変化
要点: 各ガウス球が「時刻ごとにちょっとずつ動いたり、形が変わったり、消えたり現れたりする」ことで動きを表現します。手を振る人を4DGSで表現するなら、手の部分にあるガウス球群が時間とともに位置をずらしていく。体幹部分のガウス球はほぼ動かない。この「球ごとの動き方」をニューラルネットワークで学習するのが4DGSの本質です。
時間変化の表現方法は複数の手法が提案されています。
| 手法 | 時間の表現方法 | メリット | デメリット |
|---|---|---|---|
| Deformable 3DGS | Deformation MLPで各ガウスの変位を予測 | 滑らかな動き。メモリ効率が良い | 急な動きに弱い |
| 4D Gaussian(CVPR 2024) | 4Dガウス分布(空間3D + 時間1D) | 理論的にエレガント。高品質 | 計算コストが高い |
| Per-frame最適化 | フレームごとに独立して3DGSを学習 | 実装が簡単 | フレーム間の整合性がない |
注意点: 4DGSは3DGSより計算コストが格段に高く、処理時間は5〜10倍以上かかります。GPUのVRAMも多く必要で、公開されている要件・報告値を見る限り、RTX 3060(12GB)だと1080p・短尺が限界、RTX 3090(24GB)でも4K以上は厳しい状況のようです。
スマホ1台で完結する構想は、まだ「夢」の段階でした
調べはじめた時点で、いちばん期待していたのがこれです。スマホで撮った動画をアップロードするだけで、クラウドが4DGSに変換してくれる。追加費用0円で試せるなら、これ以上ない入口です。
★調べて分かったこと: このサービス(4DGS.jp)の発表は、PR TIMESの「April Dream」という企画で出されたものでした。4月1日に「いつか叶えたい夢」を発信するという趣旨の企画です。つまりまだ提供されていません。うっかり「もう使える」と思い込むところでした。
発表された構想の中身
構想としては、被写体の周りをスマホで歩きながら撮るだけで、クラウド側が数十秒で4DGSデータへ自動変換する、というものです。カメラ位置の推定(SfM)と4DGS学習を一括で処理する形が想定されています。1回の生成で最大1時間ぶんのデータに対応する、とも書かれています。 実現すれば入口としては理想的ですが、時期は明記されていません。ただし、ビューワーは実在します
同じIZUTSUYAが、2025年10月に4DGS専用ビューワーを無償公開しています。こちらは構想ではなく実物です。WebGL/WebGPUを使ったブラウザ表示で、Windows・Mac・Linux・モバイルのいずれでも動きます。 生成は自分でやる必要がありますが、できたものを見せる手段はすでにあるということです。
調査メモ: 手軽なクラウド入口がまだ無い以上、いま4DGSを試すなら自前で処理するしかないようです。ここから先が現実的な話です。
中級編:スマホ複数台で自前4DGS
なぜ複数台が必要か
スマホ1台では、撮影中に被写体の周りを歩く必要があります。このとき2つの問題が生じます。- 撮影者の映り込み: 被写体の周囲を歩くと、被写体側から見て撮影者が動いている。他のカメラがあれば撮影者が映り込んでしまう可能性がある
- 同時刻の全方向データが取れない: 時刻t=0秒では正面の映像しかなく、t=5秒で側面、t=10秒で背面……というように、同じ瞬間を複数角度で記録できない
必要な機材
| 機材 | 数量 | 目安費用 | 備考 |
|---|---|---|---|
| スマホ | 3〜6台 | 手持ち or 中古 | 1080p/30fps以上。機種が異なってもOK |
| 三脚(100均やスマホ用) | 3〜6台 | 1台500〜1,000円 | 100均のフレキシブル三脚で十分 |
| PC | 1台 | 手持ち(RTX 3090推奨) | VRAM 24GBあると余裕がある |
| ffmpeg | – | 無料 | フレーム抽出・音声同期に使用 |
| COLMAP | – | 無料 | カメラキャリブレーション |
| 4DGS実装 | – | 無料(GitHub公開) | 学習・レンダリング |
同期方法:手を叩いて音声同期
プロの映像制作ではタイムコード同期を使いますが、スマホ同士では使えません。代わりに、撮影開始時に「手を叩く(クラップ)」方法が実用的です。- 全スマホの録画を開始
- 被写体の前で手を「パン!」と叩く
- 撮影を実行
- 録画停止
# ffmpegでクラップ音の位置を検出する例 ffmpeg -i camera1.mp4 -af "silencedetect=noise=-30dB:d=0.1" -f null -
ワークフロー
- 撮影: スマホを三脚に固定して配置 → 全台同時録画開始 → クラップ → 被写体がパフォーマンス → 録画停止
- フレーム抽出: ffmpegで各動画からフレームを抽出(5fpsが目安。30fpsは処理が重すぎる)
- 音声同期: クラップ音でフレームの時刻を揃える
- COLMAP: 各カメラの位置と内部パラメータを推定
- 4DGS学習: 同期済みフレーム群を入力として4DGSモデルを学習
- ビューワーで確認: 学習済みモデルを専用ビューワーやWebビューワーで再生
スマホの配置例
3台の場合:CAMERA LAYOUT
3台配置(扇形120°カバー)
被写体
カメラL
左60°
カメラC
正面
カメラR
右60°
CAMERA LAYOUT
6台配置(360°フルカバー)
カメラ1
正面
正面
カメラ2
右60°
右60°
カメラ3
右後120°
右後120°
カメラ4
背面
背面
カメラ5
左後120°
左後120°
カメラ6
左60°
左60°
被写体
本格編:ミラーレスカメラ3台で高品質4DGS
5K以上で撮影できるミラーレスカメラを3台使う構成は、調べた範囲では、個人が手の届く最高品質ルートとして挙げられます。スマホの1080pとは大きく異なる情報量を入力にできるためです。 ただし費用は正直に書いておきます。5K以上で撮れる機種は1台20万円前後のものが多く、3台そろえると60万円ほど。カメラが本業の方ならともかく、4DGSのためだけに買う金額ではありません。すでに複数台お持ちの方向けの選択肢、と考えたほうが現実的だと思います。5.7K解像度の利点
- ディテールの再現: 衣装の模様、肌のテクスチャ、楽器の木目など、スマホの1080pでは潰れてしまう細部まで記録できます
- 遠景の奥行き: 被写体から少し離れて撮影しても、十分な解像度が維持されます。スマホだと被写体に近づく必要があり、レンズの歪みが問題になりがちです
- クロップ耐性: 5.7Kで撮影しておけば、あとから1080pや2Kにリサイズしても情報量は十分。処理時間とのバランスで解像度を選べます
タイムコード同期(フレーム精度)
機種によっては、タイムコード端子(TC IN/OUT)を備えているものがあります。BNC変換ケーブルを使って3台のタイムコードを同期させれば、フレーム単位(1/24秒 = 約42ms)で正確に映像を揃えられます。スマホのクラップ同期より1桁高い精度です。 タイムコード同期のメリットは、長時間の撮影でもズレが蓄積しないことです。スマホの音声同期だと、録画開始から時間が経つにつれてフレームレートの微妙な差でズレが広がることがあります。5分以上の撮影ではタイムコード同期が事実上必須です。カメラの配置:正面+左右15度
ミラーレス3台では、正面+左右15度の狭い扇形に配置するのが良いようです。カメラ配置:正面+左右15度
3台を狭い扇形に置きます。左右の開きが小さいほど映像の重なりが増え、再構成が安定するようです。
異なる画角(焦点距離)の扱い
3台のカメラにそれぞれ異なるレンズ(たとえば25mm、35mm、50mm)を付けても問題ありません。COLMAPが各カメラの内部パラメータ(焦点距離、歪み係数)を個別にキャリブレーションしてくれます。ただし、あまりに画角が異なると重なり領域が減って品質が落ちるので、近い焦点距離で揃える方が安定します。処理前のリサイズ推奨
5.7Kのフルサイズで4DGSを学習させると、処理時間が膨大にふくらみます。30秒の動画でも8時間以上かかる見込みです。現実的には、処理前にffmpegで1080p〜2Kにリサイズすることを強くおすすめします。# ffmpegで2Kにリサイズする例 ffmpeg -i input_5.7k.mp4 -vf scale=2048:-1 -c:v libx264 -crf 18 output_2k.mp45.7Kで撮影する意味は「情報を最大限記録しておく」ことにあります。リサイズは後からいくらでもできますが、低解像度で撮った映像を後から高精細にすることはできません。
調査メモ: 公開されている作例やユーザー報告を見る限り、高解像度ソースを2Kにリサイズして処理したものは、スマホ1080p由来の4DGSと比べて差が出るとされています。特に被写体のエッジ(輪郭線)のシャープさと、背景と被写体の分離がきれいに出やすいようです。リサイズしてもソースの情報量が効いてくる、ということのようです。
処理時間の目安
4DGSで一番気になるのは「どれくらい時間がかかるのか」でしょう。解像度別・動画の長さ別に処理時間の目安をまとめました。いずれもRTX 3090(24GB VRAM)を想定した推定値です。解像度別(30秒の動画、5fps抽出、RTX 3090)
| 入力解像度 | COLMAP | 4DGS学習 | 合計目安 | VRAM使用量 |
|---|---|---|---|---|
| 1080p | 10〜20分 | 20〜40分 | 約1時間 | 8〜12GB |
| 2K | 20〜40分 | 40〜80分 | 約2時間 | 12〜16GB |
| 4K | 40〜90分 | 1〜3時間 | 約4時間 | 16〜24GB |
| 5.7K | 1〜2時間 | 3〜6時間+ | 約8時間 | 24GB+(ギリギリ) |
動画の長さ別(1080p、5fps抽出、RTX 3090)
| 長さ | フレーム数 | COLMAP | 4DGS学習 | 合計目安 | 出力サイズ |
|---|---|---|---|---|---|
| 5秒 | 25枚 | 3〜5分 | 5〜10分 | 約15分 | 数十MB |
| 30秒 | 150枚 | 10〜20分 | 30〜60分 | 約1時間 | 100〜300MB |
| 1分 | 300枚 | 20〜40分 | 1〜2時間 | 約2.5時間 | 300〜600MB |
| 5分 | 1,500枚 | 1〜2時間 | 5〜10時間 | 約半日 | 1〜3GB |
| 10分 | 3,000枚 | 3〜5時間 | 12〜24時間 | 約1日 | 3〜6GB |
VRAMと処理時間の関係式
4DGSの処理時間とVRAM使用量は、入力解像度と動画の長さに概ね比例します。公開されている報告値を整理すると、概ね以下の関係が読み取れます。VRAM使用量 ≒ 基準(8GB) × (解像度/1080p)² × カメラ台数補正 処理時間 ≒ 基準(1h) × (解像度/1080p)² × (動画長/30秒) × カメラ台数
要点: 解像度を2倍にすると、VRAMも処理時間も約4倍に増えます(2乗で効きます)。1080pから4Kは解像度が約2倍なので、処理時間は約4倍の4時間。5.7Kは約2.8倍なので、8倍近い8時間。「まず1080pで試す → うまくいったら2Kに上げる」というアプローチが、時間の無駄を防ぐ最も合理的な進め方です。
この表の読み方ガイド
まず5秒のクリップから試してください。目安どおりなら15分ほどで結果が出るので、設定やカメラ配置の試行錯誤が高速に回せます。 ※ 処理時間についての注意: 上記の時間は4DGS論文(CVPR 2024、NVIDIA A6000 GPUで5秒動画=約8分)を基準に推定した目安です。RTX 3090はA6000とVRAM容量(24GB vs 48GB)や演算性能が異なるため、実際の処理時間は変わります。シーンの複雑さ(動きの量、テクスチャの細かさ)や解像度によっても大幅に変動します。RTX 3090での実測データは、環境を構築でき次第追記予定です。 30秒で合計約1時間は覚悟が必要です。1回の試行に1時間かかるということは、パラメータを変えて5回やり直すと5時間。最初は短いクリップで設定を追い込んでから本番に臨む方が効率的です。 5分以上は一晩放置する前提です。就寝前に学習を開始し、翌朝に結果を確認する運用が現実的でしょう。 5.7Kフルサイズでの4DGS学習は、報告値ベースではRTX 3090でもVRAM 24GBをほぼ使い切るようです。OOM(Out of Memory)で落ちるリスクがあるので、1080p〜2Kにリサイズして処理する方が現実的です。クラウドに任せる場合と、自前で処理する場合
| 項目 | クラウドに任せる | 自前処理(RTX 3090) |
|---|---|---|
| 処理時間 | 20〜30分 | 1時間〜半日 |
| コスト | サービス料または借りたGPUの時間料金 | 電気代のみ(RTX 3090で約0.35kW) |
| 最大解像度 | 高解像度は非推奨 | GPUのVRAM次第(24GBで4Kまで) |
| データの場所 | クラウドに送信 | 完全ローカル保持 |
| カスタマイズ | 不可(サービス側の設定固定) | パラメータ調整可能(学習率、反復回数など) |
| 再現性 | サービス側のバージョンに依存 | コードとモデルを手元に保持 |
どこで見る?再生プラットフォーム比較
4DGSを作っても、再生環境がなければ意味がありません。2026年4月時点での主要な再生プラットフォームを比較します。| プラットフォーム | デバイス | 3DGS対応 | 4DGS対応 | 費用 | 備考 |
|---|---|---|---|---|---|
| 4DGS.jp(Web) | ブラウザ | ○ | ◎ | 無料 | 手元で生成した4DGSデータのストリーミング再生 |
| BDViewer | Quest 3 | ◎ | △ | 無料 | 3DGSの再生品質が高い。4DGSは実験的対応 |
| Scaniverse | Quest 3/3S | ◎ | × | 無料 | Nianticが開発。3DGSの閲覧に特化 |
| WebXR(Gracia AI) | Quest/Pico/Vision Pro | ◎ | ◎ | 要問合せ | WebXR経由で各種HMDに対応。法人向けの色が強い |
| Unity自作 | PCVR/Quest | ◎ | ◎ | 無料(開発コスト) | 自由度は最高だが開発スキルが必要 |
コスト vs 品質:散布図で見る各方法の立ち位置
4DGSにかかる追加費用と、得られる映像品質の関係を整理しました。[散布図データ]
- X軸: 追加費用(円)。PCは手持ちのものを使う前提で、カメラなど新しく買う必要のあるものだけを数えています
- Y軸: 4D映像品質スコア(10点満点)
| 方法 | 追加費用 (X) | 品質 (Y) | 備考 |
|---|---|---|---|
| スマホ3台 + 100均三脚 + RTX 3090(手持ち) | 1,500円 | 6 | 三脚代のみ。コスパ最強 |
| スマホ6台 + 三脚 + RTX 3090 | 3,000円 | 7 | 360度カバーで穴が減る |
| ミラーレス3台 + RTX 3090 | 60万円 | 8 | 1台20万円前後×3台。すでに3台お持ちなら0円 |
| プロスタジオ(20台+) | 50万円〜 | 10 | 放送・映画レベルの品質 |
品質
2
4
6
8
10
スマホ3台+三脚
スマホ6台+三脚
ミラーレス3台(新規に買うと60万円)
プロスタジオ(20台以上)
0
1,000
3,000
10,000
100,000
500,000
追加費用(円)
左上に寄るほど、少ない出費で高い品質が得られます。すでに持っている機材の費用は含みません。
散布図の読み方ガイド
- 左上に近いほどコスパが良い方法です。追加費用が少ないのに品質が高い
- ミラーレス3台は、右端のプロスタジオのすぐ隣にいます。5K以上で撮れる機種は1台20万円前後が多く、3台で60万円ほど。品質は8で、10のプロスタジオには届きません。費用の割に合わない位置です。すでに3台お持ちなら費用0で左端へ移りますが、ミラーレスを3台持っている方はそう多くないと思います
- スマホ3台+三脚(1,500円)が最もバランスの良い選択肢です。品質6/10は「動きのある被写体が3D空間で見られて、角度も変えられる。ただし穴や歪みは目立つ」というレベル。個人の記録用途なら十分実用的です
- プロスタジオ(50万円〜)は別次元です。カメラ20台以上を専用スタジオに設置し、照明・背景まで制御します。商業映像向けなので、個人が目指す必要はありません
技術的な制約と限界
4DGSは万能ではありません。2026年時点での主要な制約を把握しておくことが重要です。動きの速さに上限がある
モーションブラー(被写体ブレ)が大きいフレームは、4DGSの学習で正しく処理できません。シャッター速度が1/60秒の場合、その間に被写体が大きく動くとフレームがぼやけ、特徴点の推定精度が落ちます。- 立ち位置が動かない動作(歌う、話す、手元の作業): ○ 体幹の動きが小さく、手の動きも比較的予測しやすい
- ゆっくりした踊り(日舞、太極拳): ○ 動きが滑らかで破綻しにくい
- 激しいダンス(ブレイクダンス、ヒップホップ): △ 手足の速い動きでゴーストが出やすい
- スポーツ(バスケ、バドミントン): △〜× ボールやラケットの速度がシャッター速度を超える
髪の毛・透明物体・反射面が苦手
これは3DGSから引き継いだ弱点です。髪の毛のような細い構造、ガラスや水のような透明物体、金属の反射面は、Gaussian Splattingが正しく表現しにくい。4DGS固有の問題ではありませんが、動く被写体では髪の毛の揺れが加わるので、静止時よりさらに難易度が上がります。 2026年に入って、髪の毛の表現を改善する論文(GaussianHair等)が発表されていますが、まだ実装が広く使える段階にはなっていません。照明変化に弱い
スポットライトが明滅するステージ演出、窓から差し込む日光の変化など、撮影中に照明が変わると4DGSの品質が大幅に低下します。Gaussian Splattingは「各ガウス球の色」を学習するため、照明変化でその色が変わると整合性が取れなくなります。 なるべく均一で安定した照明下で撮影するのが理想です。カメラ台数と死角の関係
カメラの台数が少ないと、撮影されていない角度は文字通り「穴が空く」状態です。3台で正面側120度をカバーしても、背面側240度は情報がない。4DGSのアルゴリズムはある程度補完してくれますが、見たことのない角度の品質は明らかに落ちます。VRでのスケール感
4DGSで生成した映像をVRヘッドセットで見ると、人物のサイズが実際と異なって見えることがあるとの報告があります。カメラのキャリブレーションが正確でないと、巨人のようにも小人のようにも見えてしまう。Unity等でVRコンテンツに組み込む際は、実寸との合わせ込みが必要です。実用シナリオ:4DGSを何に使うか
技術として面白いだけでなく、実際にどんな場面で役立つのか。現時点で見えている用途を5つ挙げます。1. 子どもの成長記録を空間映像で残す
写真や動画では「その時見ていた角度」からしか振り返れません。4DGSなら、子どもが歩いている姿を後から任意の角度で見返せます。5年後、10年後にVRヘッドセットで「あの頃の空間」に入り直す体験は、フラットな動画とは質的に異なるものになるでしょう。 スマホ3台+100均三脚で始められるので、コスト的にもハードルは低い。ただし、クラウドサービスに子どもの映像を送ることに抵抗がある場合は、ローカル処理を選択するのが安心です。2. ダンス・スポーツのフォーム確認
自分の動きを正面だけでなく横や後ろから確認できます。ダンスの練習で「鏡で見た自分」と「他人から見た自分」のギャップを埋めるのに有効です。スポーツのコーチングでも、選手に「斜め後ろからの視点」を見せることで、通常のビデオ分析では伝えにくいポイントを共有できます。3. 不動産の内覧(動く人入りバーチャルツアー)
MatterportやPolycamで作る静的な3Dツアーは増えていますが、人が動いている生活感のある空間は作れませんでした。4DGSなら、リビングで家族がくつろいでいる空間を丸ごとバーチャルツアー化できます。不動産内覧の文脈では「実際に人が暮らしている感じ」が伝わるのは大きい。4. ライブやイベントの記録
ライブや発表会、イベントを4DGSで記録すれば、自分が座っていた席からの視点だけでなく、ステージ上の視点や真横からの視点で見返せます。ただし、出演者の肖像権・パブリシティ権への配慮が必須です。無断で4DGS化して公開することは、通常の動画撮影以上にセンシティブな問題を含みます(3Dデータは顔の立体情報を含むため)。必ず事前に出演者の許諾を取ってください。5. VRChat等のアバター素材
4DGSで生成した人物の動きデータを、VRChat等のアバターアニメーションの参考にする使い方もあります。直接4DGSデータをアバターとして使うのは現状では難しい(メッシュ変換が必要)ですが、動きのリファレンスとしては有用です。将来的に4DGSデータをリアルタイムでストリーミング表示する技術が成熟すれば、「リアルの自分がそのままVR空間に入る」ことも視野に入ってきます。まとめ:できるのかどうか
調べた範囲での結論は、できそうだというものです。ただし段階によって前提が変わります。- スマホ1台+クラウド: 構想は発表されているが、まだ提供されていない
- スマホ3〜6台 + 自前処理: 三脚代1,500〜3,000円で品質が一段上がる。RTX 3090があればローカルで完結
- ミラーレス3台 + タイムコード同期: 5K以上の情報量とフレーム精度の同期で、プロに迫る品質。ただし新規に買うと60万円ほどで、すでに持っている方向けです
調べてみて、どう思ったか
意外だったのは、いちばん重いはずの処理側が、すでに手元で足りていたことでした。RTX 3090 の24GBがあれば、中級編までは自前で回せる計算でした。 足りないのはカメラ側だけです。スマホを数台と、固定するための三脚。ここは数千円の話でした。 この方法であれば、いま持っている機材で実行できそうだ、というのが調べた結論です。あとは実際にやってみるだけになりました。撮ってみたら、また記録します。
関連記事
スマホで撮った写真から3Dモデルを作る:フォトグラメトリ入門 — 静止物の3Dスキャンはこちらで整理しています。
スマホで撮った写真から3Dモデルを作る:フォトグラメトリ入門 — 静止物の3Dスキャンはこちらで整理しています。
参考にした情報
- 4DGS.jp の発表(PR TIMES・2026年4月1日・April Dream企画)
- April Dream とは(公式サイト)
- IZUTSUYA「4DGS専用ビューワーを無償公開」(2025年10月)
- リアライズ・イノベーションズ「4DGSボリュメトリックビデオスタジオを開設」(2025年12月)