← Forskning

Fra fotografier til romlig forståelse

Navigerbar 3D fra vanlige mobilbilder

Vetle Wammer

Sammendrag

Systemet bygger navigerbare 3D-modeller fra vanlige mobilbilder, slik at en bolig kan vurderes uten visning. Arbeidet kombinerer monokulær dybdeestimering, semantisk sceneforståelse og menneskelig romlig kognisjon – og de praktiske lærdommene fra utrulling av teknologien i det norske eiendomsmarkedet.

Problemområdet

Eiendomsvurdering har tradisjonelt krevd fysisk tilstedeværelse. En kjøper må reise til boligen, koordinere avtaler med meglere og bruke tid på å gå gjennom rom for å forstå planløsning og tilstand.

Kan en 3D-modell bygget fra bilder erstatte visningen?

Systemarkitektur

Pipelinen går fra foto- eller videoopptak til interaktiv 3D-visning i disse stegene:

Inndata
Foto- / videoopptak
Forbehandling
Stabilisering · Fargenormalisering
Feature-ekstraksjon
SuperPoint · SIFT
Dybdeestimering
MiDaS · Depth Anything
Poseestimering
COLMAP Pipeline
Scenesemantikk
Romklassifisering
3D-rekonstruksjon
Point Cloud · Mesh
Neural Rendering
NeRF · Gaussian Splatting
Interaktiv visning
WebGL · Three.js
Agentlag
Cortex-analyse

En grov romlig modell er klar i løpet av sekunder. Rekonstruksjoner med høyere kvalitet behandles asynkront og erstatter den første utgaven automatisk.

Metodisk grunnlag

Systemet bygger på etablerte teknikker innen maskinsyn, tilpasset bilder tatt i boliger:

Featuredeteksjon og matching

Vi benytter SuperPoint [1] for lært featuredeteksjon, med SIFT [2] som fallback ved krevende lysforhold. SuperGlue matcher features mellom bildene.

Monokulær dybdeestimering

Primær dybdeinferens bruker MiDaS v3.1 [3], med Depth Anything [4] for kryssvalidering i tvetydige områder. Skala justeres mot kjente objektpriorer og matrikkelreferanser der de finnes.

Kameraets posisjonsestimering

Multivisningsgeometrien gjenfinnes med en COLMAP-avledet pipeline [5] tilpasset innendørsscener. Bundle adjustment finjusterer kameraparametere og sparsomme punktskyer iterativt.

Scenerekonstruksjon

Tett rekonstruksjon bruker Neural Radiance Fields [6] for fotorealisme, mens 3D Gaussian Splatting [7] gir sanntidsrendering på vanlig forbrukermaskinvare. Punktskytetthet justeres adaptivt basert på enhetskapasitet.

Observerte resultater

Systemet er evaluert internt på 50 testeiendommer med 25 brukere.

Reduksjon i fysiske visninger43 %
Reduksjon i tid til første bud33 %
Treffrate for romklassifisering91 %
Punktskytetthet~100 000 punkter/rom
Brukertilfredshet4,1/5

Utfordringer og begrensninger

Begrensningene er reelle og avgjør hvor systemet kan brukes:

Avhengighet av lysforhold

Dybdeestimering er sterkt avhengig av konsistente lysforhold. Dårlig opplyste rom – vanlig i norske vintre – produserer upålitelig geometri, særlig i hjørner og skyggefulle områder. Rom med høy dynamisk kontrast (lyse vinduer, mørke interiører) skaper eksponeringsartefakter. Systemet oppdager slike forhold og merker resultatet med lavere sikkerhet.

Artefakter i videoopptak

Håndholdt smarttelefonvideo introduserer bevegelsesuskarphet, rolling-shutter-forvrengning og komprimering med variabel bitrate. Raske kamerabevegelser gir svikt i feature-sporing. Vi plukker ut stabile keyframes med rammeseleksjon, men aggressive bevegelsesmønstre er fortsatt utfordrende.

Reflekterende og transparente overflater

Speil, vinduer og blanke overflater forvirrer dybdeestimeringen – et speil kan fremstå som en portal til et annet rom og skape geometriske motsigelser. Glassflater produserer inkonsistente dybdemålinger. Refleksjonsdeteksjonen vår oppnår omtrent 78 % recall, men randtilfeller gjenstår.

Okklusjon og dekning

Møbler og gjenstander blokkerer utsyn til vegger og gulv. Systemet kan ikke se bak en sofa eller inn i skap. Multivisningsopptak avhjelper dette, men full romdekning krever bevisste opptaksstrategier som tilfeldige brukere sjelden følger.

Skalausikkerhet

Uten kjente referanseobjekter forblir absolutt skala usikker. Et lite rom med vidvinkellinse kan ligne et stort rom med smalere linse. Vi kalibrerer mot matrikkelen der eiendommen er registrert, men ikke-listede eiendommer mangler mål med kjent fasit.

Dynamiske sceneelementer

Personer, kjæledyr eller bevegelige objekter under opptak skaper rekonstruksjonsartefakter. Gardiner i bevegelse, flimrende lys og TV-skjermer introduserer tidsmessige inkonsistenser. Pipelinen vår forutsetter statiske scener og flagger bilder med oppdaget bevegelse.

Norsk markedskontekst

Det norske eiendomsmarkedet har formet flere av de tekniske valgene:

  • Lysforhold: Lange perioder med lite naturlig lys i vintermånedene (polarnatt i nord) gjør at systemet må tåle rom som bare er kunstig belyst.
  • Byggestandarder: TEK17-regelverket skaper forutsigbare romlige mønstre – standard dørbredder, takhøyder og baderomsmål – som vi bruker som geometriske priorer.
  • Matrikkelintegrasjon: Matrikkelen gir autoritative eiendomsgrenser og registrert bruksareal. Der oppføringer finnes, kalibrerer vi skala mot dem.
  • Sameieformer: Borettslag og sameier påvirker dokumentasjonskvaliteten – fellesarealer krever andre opptaks- og attribusjonsstrategier.

Videre arbeid

Dynamisk NeRF for video

Utvide rekonstruksjonen til å håndtere bevegelige elementer – dører som åpnes, lys som slås av og på – slik at scenen også forstås i tid.

Sanntids dybdefusjon

Bruke dybdesensorene i telefonen (LiDAR, ToF) til umiddelbar, skalanøyaktig rekonstruksjon uten etterprosessering.

Automatisk plantegningsekstraksjon

Utlede 2D-plantegninger fra 3D-rekonstruksjonene, med veggdeteksjon, romgrenser og kvadratmeterberegning.

Agentisk analyse i 3D

Gi språkmodeller romlig kontekst, slik at de kan vurdere tilstand, foreslå oppussing og støtte verdivurdering.

Objektsegmentering for oppussing

Forståelse på instansnivå av møbler, inventar og overflater – grunnlaget for virtuell styling og visualisering av oppussing.

Sammenkobling av flere rom

Sy sammen rom som er tatt opp hver for seg til én eiendomsrekonstruksjon med konsistent skala.

Referanser

  1. DeTone, D., Malisiewicz, T., Rabinovich, A. (2018). “SuperPoint: Self-Supervised Interest Point Detection and Description.” CVPR 2018 Deep Learning for Visual SLAM Workshop.
  2. Lowe, D.G. (2004). “Distinctive Image Features from Scale-Invariant Keypoints.” International Journal of Computer Vision, 60(2), 91-110.
  3. Ranftl, R., Bochkovskiy, A., Koltun, V. (2021). “Vision Transformers for Dense Prediction.” ICCV 2021.
  4. Yang, L., et al. (2024). “Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data.” CVPR 2024.
  5. Schönberger, J.L., Frahm, J.M. (2016). “Structure-from-Motion Revisited.” CVPR 2016.
  6. Mildenhall, B., et al. (2020). “NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis.” ECCV 2020.
  7. Kerbl, B., et al. (2023). “3D Gaussian Splatting for Real-Time Radiance Field Rendering.” SIGGRAPH 2023.

Denne publikasjonen beskriver proprietær teknologi utviklet av Wammer for Dreamward-terminalen. Implementasjonsdetaljer er utelatt.

For henvendelser om denne forskningen, kontakt research@wammer.tech.