Cómo funciona el borrado de fondo con IA: U2-Net, límites prácticos y cómo obtener mejores resultados
El borrado de fondo moderno con IA usa una red de detección de saliencia —normalmente U2-Net— que predice una máscara a nivel de píxel del objeto visualmente más prominente de la imagen. La máscara controla la transparencia del PNG de salida. Cuando el sujeto está bien definido y bien iluminado contra un fondo contrastado, los resultados son casi instantáneos y convincentes. Cuando el sujeto se mezcla con el fondo o tiene estructura fina como pelo y pelaje, la calidad de la máscara cae de forma notable.
El borrado de fondo con IA es genuinamente útil para productos, retratos y objetos sobre fondos limpios, y ya es lo bastante rápido para correr en un navegador. Cuando el sujeto es complejo, trata el resultado como punto de partida y no como asset final. Para fotos de e-commerce y retratos en volumen, elimina la parte más tediosa; para tomas de estudio intrincadas, te da una máscara base sólida que refinar. Entender la confianza del modelo te dice cuándo confiar en la salida y cuándo dedicar cinco minutos a limpiarla.
Cómo funciona en realidad: detección de objetos salientes
El borrado de fondo se resuelve como un problema de detección de objeto saliente. La red no entiende 'fondo' de forma abstracta: aprende de los datos de entrenamiento a identificar el único objeto visualmente más prominente del cuadro. La salida es un mapa de saliencia: una imagen en escala de grises donde cada píxel guarda un valor de confianza de 0 (seguro fondo) a 1 (seguro primer plano).
U2-Net, publicada en 2020, lo logra con una U-net anidada en dos niveles. La U-net exterior captura el contexto global —dónde está el sujeto en el cuadro— mientras que los RSU (Residual U-blocks) internos de cada etapa capturan la estructura fina local. Esta arquitectura explica por qué U2-Net produce bordes nítidos alrededor de detalles pequeños como dedos o mechones sueltos sin perder la visión global del contorno del sujeto.
En inferencia, el mapa de saliencia se umbraliza en una máscara binaria. Los valores por encima del umbral quedan totalmente opacos en el PNG; los que están por debajo, totalmente transparentes. Algunas implementaciones usan el mapa continuo como canal alfa directamente, lo que produce bordes semitransparentes que componen con más suavidad pero pueden verse incorrectos sobre fondos opacos.
Qué maneja bien el modelo
U2-Net se entrenó con DUTS-TR, un dataset de decenas de miles de imágenes con anotaciones de saliencia a nivel de píxel. Ese dataset se inclina hacia sujetos fotográficos comunes: personas, animales, objetos sobre fondos limpios, comida y productos. Para estas categorías el modelo es notablemente preciso sin fine-tuning.
La fotografía de producto es el caso de uso más fuerte. Un bolso, un zapato o un dispositivo electrónico fotografiados sobre fondo blanco o gris de estudio tienen contraste alto, bordes bien definidos y se parecen a los datos de entrenamiento. El borrado de fondo en estas imágenes suele salir suficientemente limpio como para enviarlo sin corrección manual.
Los retratos y las fotos de tipo carné también funcionan bien para la cara y los hombros, sobre todo cuando el pelo no es demasiado fino y el fondo es relativamente uniforme. Los retratos a media distancia con fondos desenfocados se benefician de la comprensión global del silueta humana.
Dónde tiene problemas el modelo
- Pelo y pelaje finos: la red aproxima el contorno exterior del cabello en lugar de trazar cada hebra. Los mechones ultra finos se pierden en la máscara y el borde suele quedar ligeramente cortado.
- Sujetos transparentes o semitransparentes: cristal, tejido de malla, humo y agua son casi invisibles en el mapa de saliencia porque el modelo detecta opacidad y contraste, ambos bajos en objetos transparentes.
- Camuflaje y bajo contraste: un sujeto cuyos colores se parecen mucho al fondo confunde las pistas de contexto global. Perro marrón sobre alfombra marrón, gato blanco sobre sofá blanco: modos de fallo típicos.
- Varios objetos prominentes: U2-Net está entrenado para saliencia de un solo sujeto. Cuando varios objetos compiten en peso visual, la máscara suele incluirlos a todos o priorizar uno de forma arbitraria.
- Fondos ocupados o detallados: bokeh y gradientes están bien, pero un fondo texturizado detallado a la misma frecuencia que la textura del sujeto provoca fugas en el borde.
Usar la librería rembg
- Instala rembg
Ejecuta `pip install rembg`. La primera vez que la llamas, rembg descarga los pesos del modelo U2-Net (unos 176 MB) y los guarda en `~/.u2net/`. Las siguientes ejecuciones usan la caché.
- Elimina el fondo de una imagen
La llamada más simple es `rembg i input.jpg output.png`. La salida siempre es un PNG con alfa. La bandera `-m` elige el modelo: `u2net` para uso general, `u2net_human_seg` para retratos, y `isnet-general-use` para un modelo general más nuevo y a menudo más nítido.
- Procesa un directorio en lote
Ejecuta `rembg p ./input_dir ./output_dir` para procesar cada imagen del directorio. Cada archivo se procesa de forma independiente, así que aprovecha varias CPUs. La bandera `-w` activa un modo watch que procesa a medida que se añaden archivos.
- Post-procesa el canal alfa
Para pelo y pelaje, considera pasar la salida por alpha matting con `--alpha-matting` y `--alpha-matting-foreground-threshold`. Esto refina el borde suave a costa de un procesado más lento. Para producto limpio, la máscara por defecto suele bastar.
Variantes de modelo U2-Net en rembg
| Bandera del modelo | Mejor para | Notas |
|---|---|---|
| u2net | Objetos generales, productos | El más rápido, calidad estándar, 176 MB de pesos |
| u2net_human_seg | Retratos y personas | Fine-tuning en segmentación humana, más nítido en pelo |
| u2netp | Entornos con pocos recursos | Modelo pequeño (4 MB), calidad claramente menor en sujetos complejos |
| isnet-general-use | General, mayor calidad | Arquitectura más nueva, mejor detalle de borde, más lento |
Formato de salida y composición
La salida del borrado de fondo es siempre un PNG con canal alfa: no hay equivalente JPEG porque JPEG no soporta alfa. Si tu flujo aguas abajo necesita JPEG, primero debes componer el sujeto sobre un fondo sólido y luego codificar a JPEG. Guardar un PNG transparente directamente como JPEG rellena las zonas transparentes con negro, que casi nunca es lo que quieres.
Para web, WebP con alfa es una alternativa más pequeña a PNG y todos los navegadores actuales lo soportan. Convertir la salida de rembg a WebP sin pérdida preserva el canal alfa exacto; convertir a WebP con pérdida a calidad 90 o superior introduce solo artefactos menores en los bordes pero puede recortar el tamaño entre un 40 y un 60 por ciento respecto a PNG.
Al componer sobre un fondo nuevo, iguala la dirección y la temperatura de la luz entre el sujeto y el nuevo fondo. Una modelo fotografiada con luz fría de estudio pegada sobre un atardecer cálido se ve compuesta al margen de la calidad de la máscara. La máscara es solo la mitad del trabajo.
Preguntas frecuentes
- ¿Qué modelo usa el borrado de fondo con IA?
- La mayoría de las herramientas usan U2-Net o alguna variante. U2-Net es una red neuronal convolucional diseñada para detección de objetos salientes que produce un mapa de confianza por píxel que se usa como máscara de transparencia.
- ¿Por qué el borrado sale áspero alrededor del pelo?
- Los pelos finos están en o por debajo de la resolución espacial que la red puede segmentar con fiabilidad. Usa el modelo `u2net_human_seg` para retratos y activa alpha matting con `--alpha-matting` en rembg para recuperar bordes más finos.
- ¿El borrado de fondo funciona en objetos transparentes?
- Mal. Los sujetos transparentes y semitransparentes como cristal, humo y malla tienen poco contraste y opacidad, lo que los hace casi invisibles para la detección de saliencia. La máscara los trata como fondo.
- ¿Qué formato de salida produce el borrado de fondo?
- Siempre PNG con canal alfa. JPEG no soporta transparencia, así que cualquier herramienta que diga sacar un JPEG transparente está componiendo sobre un color sólido o produciendo datos inválidos.
- ¿Puedo ejecutar el borrado de fondo en un navegador sin servidor?
- Sí. ONNX Runtime Web puede ejecutar modelos U2-Net cuantizados en el navegador vía WebAssembly o WebGL. Varios proyectos open source han publicado pesos ONNX de U2-Net compatibles con navegador. Es más lento que la inferencia en servidor, pero suficiente para imágenes puntuales.