Multimodal Floorplan Encoding: Learning Dense Modality-Invariant Representations
Published in TwinWorld Workshop, ECCV 2026, 2026 — Honorable Mention
MMFE maps diverse 2D indoor representations — vector CAD drawings, raster renderings, sensor-derived density maps — into a shared dense latent grid, combining a frozen DINOv3 backbone with a trainable DPT head trained with a per-cell InfoNCE objective. Evaluated on Structured3D for cross-modal dense matching, similarity alignment and retrieval.
