← Todos los capítulos
Capítulo 2 · Demo

Un distrito inventado, un precio

Un distrito del censo, no una casa: unos 1,200 habitantes y 400 hogares. Lo que sale es el valor mediano de sus viviendas. El modelo entero viaja al navegador y predice aquí, sin servidor detrás.

Cargando el modelo, 296 KB…

Qué se está ejecutando

El modelo servido es xgboost_tuned, 300 árboles exportados a JSON que llegan al navegador en 296 KB. Esa cifra sale de pedirle el archivo al sitio, no de comprimirlo en local: al máximo son 186 KB, pero un servidor que comprime al vuelo no gasta ese esfuerzo. No es el mejor modelo del capítulo: extra_trees_tuned baja el error a 0.4063, y su artefacto ocupa 703 MB. La demo existe gracias a un modelo 290 veces más ligero que cuesta 0.023 de RMSE.

Dos de las seis variables no tienen control: dormitorios por hogar y población del distrito. Con un distrito cargado se usan sus valores verdaderos, así que la demo predice lo mismo que el pipeline completo, 103 dólares de diferencia en promedio, que es lo que cuesta redondear las entradas al exportarlas. Con un barrio inventado se rellenan con la mediana estatal, y ahí la desviación sube a 6,385 dólares de media.

Los deslizadores de personas y habitaciones por hogar paran en el percentil 99. Más arriba hay cuarteles y residencias, con hasta 502 personas por hogar, y con ese tope el 99% de los casos cabría en el primer píxel del control.

El botón carga un distrito que existió, con su valor real al lado del predicho. En cuanto se mueve un control deja de ser ese distrito y pasa a ser un caso hipotético, así que la comparación desaparece. El 96.1% de los distritos reales cabe dentro de los controles; los otros 160 llegan recortados, la demo lo dice, y ahí la diferencia con el pipeline sube a 12,400 dólares.

La proximidad al océano no se pregunta: sale del distrito real más cercano al punto elegido. El punto ya contiene esa información.

El desarrollo completo Capítulo 2