Domaine 02 · Gaussian splatting
Des environnements 3D photoréalistes, à partir de photos
Quelques centaines de photographies suffisent : la scène est reconstruite en millions de gaussiennes, et s'affiche en temps réel avec ses reflets et ses matières.
Démonstration
Des photographies à la scène 3D navigable
Scènes réelles reconstruites à partir de photographies, comparées aux méthodes précédentes. Images de l'équipe de recherche GraphDeco (Inria, Université Côte d'Azur), à l'origine de la méthode.
- 01
Avant
Des photographies ordinaires, prises autour du sujet.
- 02
Pendant
Des millions de gaussiennes ajustées jusqu'à reproduire chaque photo.
- 03
Après
Une scène 3D libre de mouvement, affichée à plus de 100 images par seconde.
Ce que c'est
Une scène faite de millions de gaussiennes
Le Gaussian splatting décrit une scène non pas par des surfaces, mais par des millions de petits nuages colorés, flous sur les bords, qui se superposent pour former l'image.
Chaque gaussienne est un ellipsoïde défini par cinq propriétés : sa position dans l'espace ; sa forme et son orientation (on peut l'étirer en aiguille ou l'aplatir en disque) ; son opacité ; et sa couleur, qui peut varier selon l'angle de vue. C'est ce dernier point qui rend les reflets, les vernis, le métal et le verre, là où la photogrammétrie classique échoue.
Pour afficher la scène, chaque gaussienne est projetée sur l'écran sous forme de tache elliptique : c'est le splatting. Les taches sont triées de la plus lointaine à la plus proche, puis fondues les unes sur les autres. Aucun réseau de neurones n'intervient à l'affichage : c'est de la rastérisation, le travail pour lequel les cartes graphiques sont faites. D'où des performances de jeu vidéo, plus de cent images par seconde, avec une qualité photographique.
Ce que ça change par rapport aux autres méthodes
- Face à la photogrammétrie et au maillage : la végétation, les cheveux, les surfaces brillantes ou transparentes sont restitués fidèlement, sans « fondre » en surfaces molles.
- Face aux champs de radiance neuronaux (NeRF) : même niveau de réalisme, mais un affichage cent à mille fois plus rapide, compatible avec le web et la réalité virtuelle.
- Face à la modélisation 3D manuelle : des jours de travail d'artiste remplacés par une capture de quelques minutes et un calcul de quelques dizaines de minutes.
Pour quoi faire
- Des environnements 3D immersifs pour le web, les casques de réalité virtuelle et les applications.
- Le patrimoine, l'immobilier de prestige, le tourisme : un lieu montré tel qu'il est, lumière comprise.
- Le produit et l'e-commerce : un objet réel, tournant sous tous les angles.
- Le cinéma et la publicité : décors réels réutilisés en production virtuelle.
- La simulation : des jumeaux photoréalistes pour entraîner et tester robots et véhicules.
Comment c'est fait
De la capture à l'affichage temps réel
- 01
Capture
100 à 300 photographies, ou une vidéo, en tournant autour du sujet ou en parcourant le lieu. Lumière constante, fort recouvrement.
- 02
Poses des caméras
Retrouver d'où chaque image a été prise : structure from motion, ou un modèle de reconstruction directe.
- 03
Initialisation
Les points 3D obtenus deviennent les premières gaussiennes.
- 04
Optimisation
Des dizaines de milliers d'itérations sur GPU : on rend l'image, on la compare à la photo, on corrige chaque gaussienne.
- 05
Densification
Là où le détail manque, les gaussiennes se dédoublent ; les inutiles, transparentes, sont retirées.
- 06
Diffusion
Compression, puis affichage temps réel dans un navigateur, un casque ou un moteur 3D.
La capture décide de tout
La méthode n'invente rien : elle ne restitue que ce que les photos ont vu. Il faut donc couvrir chaque zone sous plusieurs angles, avec un fort recouvrement entre images, une exposition fixe et une lumière qui ne change pas pendant la prise de vue. Une vidéo lente, ou une série de photographies en cercles concentriques, suffit pour un objet ; un lieu se parcourt pièce par pièce, comme pour une visite.
Retrouver les caméras
Avant d'apprendre la scène, il faut savoir d'où chaque image a été prise. Le structure from motion apparie des milliers de détails d'une photo à l'autre et en déduit à la fois la position des caméras et un nuage de points clairsemé. Depuis 2024, des modèles de reconstruction directe produisent ce résultat en une seule passe, en quelques secondes.
L'optimisation : apprendre par comparaison
Les points de départ deviennent des gaussiennes. Puis la boucle commence : on rend l'image depuis la position d'une photo, on mesure l'écart avec la vraie photo (une combinaison d'erreur pixel à pixel et de similarité de structure), et l'on corrige chaque paramètre de chaque gaussienne dans la direction qui réduit l'écart. Le rendu étant différentiable, cette correction se calcule exactement. Quelques dizaines de milliers d'itérations, soit de quelques minutes à une heure sur une carte graphique récente, suffisent pour une scène.
Pendant l'optimisation, la scène s'adapte : là où l'erreur reste forte, les gaussiennes sont clonées ou divisées pour ajouter du détail ; celles qui deviennent transparentes sont élaguées. Une scène finale compte de quelques centaines de milliers à plusieurs millions de gaussiennes.
Compresser et diffuser
Brute, une scène pèse facilement plusieurs centaines de mégaoctets : chaque gaussienne porte une soixantaine de valeurs. La compression combine élagage, réduction des coefficients de couleur, quantification et codage par blocs, jusqu'à des tailles compatibles avec le web. L'affichage se fait alors dans le navigateur (WebGL, WebGPU), dans un casque, ou dans les moteurs de jeu grâce à des extensions dédiées.
Les limites, à connaître
- La lumière est figée : elle est « cuite » dans la scène. Rééclairer reste un sujet de recherche.
- L'édition est délicate : déplacer un objet ou retoucher une zone n'est pas aussi simple que sur un maillage.
- La mesure est indirecte : pour des cotes fiables, on couple le splatting à un relevé, ou l'on en extrait une surface.
- Hors du champ capturé, rien : une zone jamais photographiée apparaît floue ou peuplée de flotteurs.
- Gaussienne 3D
- Un petit nuage ellipsoïdal, flou sur les bords, défini par une position, une forme, une orientation, une opacité et une couleur.
- Covariance
- Ce qui donne à chaque gaussienne sa forme étirée et son orientation : une échelle sur trois axes et une rotation.
- Harmoniques sphériques
- Une manière de coder une couleur qui change selon l'angle de vue : reflets, brillances, matières satinées.
- Splatting
- « Écraser » chaque gaussienne sur l'image comme une tache elliptique, puis les superposer de l'arrière vers l'avant.
- Rendu différentiable
- Un rendu dont on peut calculer comment l'image change si l'on modifie un paramètre : c'est ce qui permet l'apprentissage.
- Flotteurs
- Des gaussiennes parasites, suspendues dans le vide, là où les photos manquaient d'information.
Recherche & évolutions 2026
Trois ans qui ont transformé le rendu 3D
Présenté à SIGGRAPH en 2023 par une équipe de l'Inria, le Gaussian splatting est devenu en moins de trois ans l'un des sujets les plus actifs de l'informatique graphique, avec des milliers de travaux dérivés. La recherche avance sur quatre fronts : la qualité (anticrénelage, reflets), la géométrie (extraire des surfaces mesurables), la compacité (des scènes diffusables) et le mouvement (des scènes qui vivent dans le temps).
Moins de photos, moins d'attente
Les modèles de reconstruction directe fournissent caméras et géométrie initiale en une passe : la capture se simplifie, et le délai entre la prise de vue et la scène se raccourcit.
Un format qui se normalise
La compression progresse vite, et des travaux de normalisation sont engagés pour que les scènes par gaussiennes circulent entre outils, comme les maillages avec glTF.
Des scènes qui bougent
Le splatting dynamique étend la méthode au temps : des scènes filmées que l'on revoit sous n'importe quel angle, vers la vidéo volumétrique.
Générer plutôt que capturer
Des modèles génératifs produisent désormais des mondes 3D directement sous forme de gaussiennes, à partir d'une image ou d'un texte : la frontière entre relevé et création s'estompe.
Les publications de référence
- 2025VGGT: Visual Geometry Grounded Transformer
La position des caméras et la géométrie initiale prédites en une passe : l'étape la plus fragile de la chaîne, jusque-là confiée à une optimisation longue, devient quasi instantanée.
- 2024Mip-Splatting: Alias-free 3D Gaussian Splatting
Supprime le crénelage et les scintillements quand on zoome ou qu'on s'éloigne, grâce à un filtrage 3D et 2D des gaussiennes. Indispensable pour une visite où l'on change constamment de distance.
- 2024SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction
Travaux de l'École des Ponts ParisTech : les gaussiennes sont contraintes à se coucher sur les surfaces, ce qui permet d'en extraire un maillage éditable en quelques minutes.
- 20242D Gaussian Splatting for Geometrically Accurate Radiance Fields
Remplace les ellipsoïdes par des disques plats orientés : la géométrie devient cohérente d'un point de vue à l'autre, et les surfaces reconstruites nettement plus justes.
- 2024Gaussian Opacity Fields: Efficient Adaptive Surface Reconstruction in Unbounded Scenes
Extrait directement des gaussiennes une surface détaillée, y compris pour des scènes extérieures sans limites : la mesure et le photoréalisme à partir de la même capture.
- 2024Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering
Organise les gaussiennes autour d'ancres structurées : moins de redondance, un stockage réduit et une meilleure tenue aux changements de point de vue.
- 2024LightGaussian: Unbounded 3D Gaussian Compression with 15× Reduction and 200+ FPS
Élagage des gaussiennes peu utiles, distillation des couleurs et quantification : une scène quinze fois plus légère, sans perte visible. La compression est ce qui rend le splatting diffusable sur le web.
- 20243D Gaussian Splatting as Markov Chain Monte Carlo
Remplace les règles empiriques de densification par un cadre probabiliste : un budget de gaussiennes maîtrisé, et une qualité moins dépendante des réglages.
- 20244D Gaussian Splatting for Real-Time Dynamic Scene Rendering
Des gaussiennes qui se déforment dans le temps : des scènes en mouvement, filmées puis revisitées sous n'importe quel angle. La voie vers la vidéo volumétrique.
- 20233D Gaussian Splatting for Real-Time Radiance Field Rendering
L'article fondateur, issu de l'Inria et de l'Université Côte d'Azur. Il montre qu'une scène faite de millions de gaussiennes, optimisée à partir de photos, atteint la qualité des meilleures méthodes neuronales tout en s'affichant à plus de cent images par seconde.
- 2022Instant Neural Graphics Primitives with a Multiresolution Hash Encoding
Fait passer l'apprentissage d'une scène neuronale de plusieurs heures à quelques secondes. Il a prouvé que la capture par apprentissage pouvait devenir pratique.
- 2020NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis
Le prédécesseur : une scène apprise par un réseau de neurones interrogé le long de chaque rayon. Un réalisme saisissant, mais des secondes par image là où le splatting en demande quelques millisecondes.
Collaborer
Un sujet technique qui résiste ?
Faisabilité, méthode, mesure du résultat.