Vers une édition sémantique de vidéos volumétriques: segmentation 4D basée Gaussian Splatting et moyens d’évaluation
(Towards semantic editing of volumetric video: a Gaussian splatting-based 4D segmentation method and evaluation framework)

Wei, Bangning - (2025-10-09) / Université de Rennes - Vers une édition sémantique de vidéos volumétriques: segmentation 4D basée Gaussian Splatting et moyens d’évaluation

Langue : Anglais
Directeur de thèse:  Zhang, Lu
Laboratoire :  IETR
Ecole Doctorale : MATISSE

Thématique : Sciences de l'ingénieur
Accès à la ressource : https://ged.univ-rennes1.fr/nuxeo/site/esupversion...

Mots-clés : Vidéo volumétrique, Segmentation sémantique, Reconstruction 3D, Synthèse de vues nouvelles, Jeu de données, Réalité virtuelle, Imagerie quadridimensionnelle

Résumé : La vidéo volumétrique permet des représentations 3D dynamiques de scènes réelles, offrant une exploration multi-vues et une navigation naturelle en six degrés de liberté (6 DoF). Pour une interaction véritablement immersive, la segmentation sémantique est essentielle afin de permettre une compréhension des objets au niveau individuel. Bien que les méthodes récentes de synthèse de vues nouvelles, telles que les Neural Radiance Fields (NeRF) et le 3D Gaussian Splatting (3DGS), aient considérablement fait progresser la reconstruction 3D et la segmentation de scènes statiques, la segmentation sémantique dans des scènes dynamiques 4D reste relativement peu explorée. Les principaux défis incluent le maintien de la cohérence sémantique dans l’espace et le temps, ainsi que le manque de jeux de données multi-vues richement annotés pour les environnements dynamiques. Cette thèse répond à ces limitations en introduisant MUVOD, un jeu de données de segmentation d’objets en vidéo multi-vues, couvrant 17 scènes réelles avec des masques 4D cohérents pour 459 instances réparties sur 73 catégories. Un benchmark est proposé pour l’évaluation des méthodes de segmentation 4D. Nous proposons également une nouvelle approche de segmentation 4D fondée sur 3DGS, qui étend la segmentation d’objets statiques aux scènes dynamiques en intégrant un vecteur d’identité d’objet apprenable dans le pipeline de reconstruction. Cette méthode permet le rendu photoréaliste en RGB ainsi que la génération de masques d’objets à n’importe quel point de vue et instant temporel, offrant ainsi une solution efficace et portable pour la compréhension et l’édition de scènes 4D.

Résumé (anglais) : Volumetric video enables dynamic 3D representations of real-world scenes, supporting free-viewpoint exploration and natural 6 Degrees of Freedom (6 DoF) navigation. To achieve truly immersive interaction, semantic segmentation is essential for object-level understanding. While recent novel view synthesis methods, such as Neural Radiance Fields (NeRF) and 3D Gaussian Splatting (3DGS), have advanced 3D reconstruction and static scene segmentation, semantic segmentation in 4D dynamic scenes remains relatively underexplored. Key difficulties include maintaining semantic consistency across space and time, as well as the lack of richly annotated multi-view datasets for dynamic environments. This thesis addresses this gap by introducing MUVOD, a multi-view video object segmentation dataset featuring 17 real-world scenarios with 4D-consistent object masks for 459 instances across 73 categories. A benchmark is established for evaluating 4D segmentation methods. Furthermore, we propose a novel 4D segmentation approach based on 3DGS, extending static object segmentation to dynamic scenes by incorporating a learnable Object Identity Encoding into the reconstruction pipeline. The method supports photorealistic RGB and mask rendering at arbitrary viewpoints and timepoints, offering an efficient and portable solution for 4D scene understanding and editing.

Identifiant : rennes1-ori-wf-1-21265
Exporter au format XML