Fra fotografier til romlig forståelse
Navigerbar 3D fra vanlige mobilbilder
Vetle Wammer
Sammendrag
Systemet bygger navigerbare 3D-modeller fra vanlige mobilbilder, slik at en bolig kan vurderes uten visning. Arbeidet kombinerer monokulær dybdeestimering, semantisk sceneforståelse og menneskelig romlig kognisjon – og de praktiske lærdommene fra utrulling av teknologien i det norske eiendomsmarkedet.
Problemområdet
Eiendomsvurdering har tradisjonelt krevd fysisk tilstedeværelse. En kjøper må reise til boligen, koordinere avtaler med meglere og bruke tid på å gå gjennom rom for å forstå planløsning og tilstand.
Kan en 3D-modell bygget fra bilder erstatte visningen?
Systemarkitektur
Pipelinen går fra foto- eller videoopptak til interaktiv 3D-visning i disse stegene:
En grov romlig modell er klar i løpet av sekunder. Rekonstruksjoner med høyere kvalitet behandles asynkront og erstatter den første utgaven automatisk.
Metodisk grunnlag
Systemet bygger på etablerte teknikker innen maskinsyn, tilpasset bilder tatt i boliger:
Featuredeteksjon og matching
Vi benytter SuperPoint [1] for lært featuredeteksjon, med SIFT [2] som fallback ved krevende lysforhold. SuperGlue matcher features mellom bildene.
Monokulær dybdeestimering
Primær dybdeinferens bruker MiDaS v3.1 [3], med Depth Anything [4] for kryssvalidering i tvetydige områder. Skala justeres mot kjente objektpriorer og matrikkelreferanser der de finnes.
Kameraets posisjonsestimering
Multivisningsgeometrien gjenfinnes med en COLMAP-avledet pipeline [5] tilpasset innendørsscener. Bundle adjustment finjusterer kameraparametere og sparsomme punktskyer iterativt.
Scenerekonstruksjon
Tett rekonstruksjon bruker Neural Radiance Fields [6] for fotorealisme, mens 3D Gaussian Splatting [7] gir sanntidsrendering på vanlig forbrukermaskinvare. Punktskytetthet justeres adaptivt basert på enhetskapasitet.
Observerte resultater
Systemet er evaluert internt på 50 testeiendommer med 25 brukere.
Utfordringer og begrensninger
Begrensningene er reelle og avgjør hvor systemet kan brukes:
Avhengighet av lysforhold
Dybdeestimering er sterkt avhengig av konsistente lysforhold. Dårlig opplyste rom – vanlig i norske vintre – produserer upålitelig geometri, særlig i hjørner og skyggefulle områder. Rom med høy dynamisk kontrast (lyse vinduer, mørke interiører) skaper eksponeringsartefakter. Systemet oppdager slike forhold og merker resultatet med lavere sikkerhet.
Artefakter i videoopptak
Håndholdt smarttelefonvideo introduserer bevegelsesuskarphet, rolling-shutter-forvrengning og komprimering med variabel bitrate. Raske kamerabevegelser gir svikt i feature-sporing. Vi plukker ut stabile keyframes med rammeseleksjon, men aggressive bevegelsesmønstre er fortsatt utfordrende.
Reflekterende og transparente overflater
Speil, vinduer og blanke overflater forvirrer dybdeestimeringen – et speil kan fremstå som en portal til et annet rom og skape geometriske motsigelser. Glassflater produserer inkonsistente dybdemålinger. Refleksjonsdeteksjonen vår oppnår omtrent 78 % recall, men randtilfeller gjenstår.
Okklusjon og dekning
Møbler og gjenstander blokkerer utsyn til vegger og gulv. Systemet kan ikke se bak en sofa eller inn i skap. Multivisningsopptak avhjelper dette, men full romdekning krever bevisste opptaksstrategier som tilfeldige brukere sjelden følger.
Skalausikkerhet
Uten kjente referanseobjekter forblir absolutt skala usikker. Et lite rom med vidvinkellinse kan ligne et stort rom med smalere linse. Vi kalibrerer mot matrikkelen der eiendommen er registrert, men ikke-listede eiendommer mangler mål med kjent fasit.
Dynamiske sceneelementer
Personer, kjæledyr eller bevegelige objekter under opptak skaper rekonstruksjonsartefakter. Gardiner i bevegelse, flimrende lys og TV-skjermer introduserer tidsmessige inkonsistenser. Pipelinen vår forutsetter statiske scener og flagger bilder med oppdaget bevegelse.
Norsk markedskontekst
Det norske eiendomsmarkedet har formet flere av de tekniske valgene:
- Lysforhold: Lange perioder med lite naturlig lys i vintermånedene (polarnatt i nord) gjør at systemet må tåle rom som bare er kunstig belyst.
- Byggestandarder: TEK17-regelverket skaper forutsigbare romlige mønstre – standard dørbredder, takhøyder og baderomsmål – som vi bruker som geometriske priorer.
- Matrikkelintegrasjon: Matrikkelen gir autoritative eiendomsgrenser og registrert bruksareal. Der oppføringer finnes, kalibrerer vi skala mot dem.
- Sameieformer: Borettslag og sameier påvirker dokumentasjonskvaliteten – fellesarealer krever andre opptaks- og attribusjonsstrategier.
Videre arbeid
Dynamisk NeRF for video
Utvide rekonstruksjonen til å håndtere bevegelige elementer – dører som åpnes, lys som slås av og på – slik at scenen også forstås i tid.
Sanntids dybdefusjon
Bruke dybdesensorene i telefonen (LiDAR, ToF) til umiddelbar, skalanøyaktig rekonstruksjon uten etterprosessering.
Automatisk plantegningsekstraksjon
Utlede 2D-plantegninger fra 3D-rekonstruksjonene, med veggdeteksjon, romgrenser og kvadratmeterberegning.
Agentisk analyse i 3D
Gi språkmodeller romlig kontekst, slik at de kan vurdere tilstand, foreslå oppussing og støtte verdivurdering.
Objektsegmentering for oppussing
Forståelse på instansnivå av møbler, inventar og overflater – grunnlaget for virtuell styling og visualisering av oppussing.
Sammenkobling av flere rom
Sy sammen rom som er tatt opp hver for seg til én eiendomsrekonstruksjon med konsistent skala.
Referanser
- DeTone, D., Malisiewicz, T., Rabinovich, A. (2018). “SuperPoint: Self-Supervised Interest Point Detection and Description.” CVPR 2018 Deep Learning for Visual SLAM Workshop.
- Lowe, D.G. (2004). “Distinctive Image Features from Scale-Invariant Keypoints.” International Journal of Computer Vision, 60(2), 91-110.
- Ranftl, R., Bochkovskiy, A., Koltun, V. (2021). “Vision Transformers for Dense Prediction.” ICCV 2021.
- Yang, L., et al. (2024). “Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data.” CVPR 2024.
- Schönberger, J.L., Frahm, J.M. (2016). “Structure-from-Motion Revisited.” CVPR 2016.
- Mildenhall, B., et al. (2020). “NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis.” ECCV 2020.
- Kerbl, B., et al. (2023). “3D Gaussian Splatting for Real-Time Radiance Field Rendering.” SIGGRAPH 2023.