porĀ Jason Dorrier

Hubo un tiempo en que convertir una fotografía antigua en una imagen digital impresionaba a la gente. En estos días podemos hacer un poco mÔs, como dar vida a fotos antiguas al estilo de Harry Potter. Y esta semana, el fabricante de chips NVIDIA realizó otro truco de magia.

Sobre la base de trabajos anteriores, los investigadores de NVIDIA demostraron cómo una pequeña red neuronal entrenada en unas pocas docenas de imÔgenes puede representar la escena representada en 3D completo. Como demostración, el equipo transformó las imÔgenes de un modelo sosteniendo una cÔmara Polaroid, una oda a Andy Warhol, en una escena 3D.

El trabajo se destaca por algunas razones.

Primero, es muy rĆ”pido. Los modelos de IA anteriores requerĆ­an horas para entrenar y minutos para renderizar escenas 3D. La red neuronal de NVIDIA no tarda mĆ”s de unos minutos en entrenarse y renderiza la escena en decenas de milisegundos. En segundo lugar, la propia IA es diminuta en comparación con los enormes modelos de lenguaje actuales. Los modelos grandes como GPT-3 funcionan con cientos o miles de unidades de procesamiento de grĆ”ficos (GPU). La IA de representación de imĆ”genes de NVIDIA se ejecuta en una sola GPU.

El trabajo se basa en campos de radiación neuronal (NeRF), una tĆ©cnica desarrollada por investigadores de UC Berkeley, UC San Diego y Google Research, hace un par de aƱos. En resumen, un NeRF toma un conjunto de datos limitado, digamos, 36 fotografĆ­as de un sujeto capturado desde una variedad de Ć”ngulos, y luego predice el color, la intensidad y la dirección de la luz que irradia desde cualquier punto de la escena. Es decir, la red neuronal llena los espacios entre las imĆ”genes con las mejores conjeturas basadas en los datos de entrenamiento. El resultado es un espacio 3D continuo unido a partir de las imĆ”genes originales.

La contribución reciente de NVIDIA, descrita en un artĆ­culo , coloca a los NeRF en fĆ”rmacos que mejoran el rendimiento. SegĆŗn el documento, el nuevo mĆ©todo, denominado Instant NeRF, explota un enfoque conocido como codificación de cuadrĆ­cula hash de resolución mĆŗltiple para simplificar la arquitectura del algoritmo y ejecutarlo en paralelo en una GPU. Esto mejoró el rendimiento en algunos órdenes de magnitud: su algoritmo se ejecuta hasta 1000 veces mĆ”s rĆ”pido, segĆŗn una publicación de blog de NVIDIA, sin sacrificar la calidad.

NVIDIA imagina que la tecnologĆ­a podrĆ­a llegar a los robots y automóviles autónomos, ayudĆ”ndolos a visualizar y comprender mejor el mundo que los rodea. TambiĆ©n podrĆ­a usarse para hacer avatares de alta fidelidad que las personas pueden importar a mundos virtuales o para replicar escenas del mundo real en el mundo digital donde los diseƱadores pueden modificarlas y desarrollarlas.

La velocidad y el tamaño de las redes neuronales importan en tales casos, ya que la mayoría de las personas no pueden usar algoritmos enormes que requieren cantidades prodigiosas de potencia informÔtica, ni son prÔcticos para robots y automóviles sin conexiones confiables y rÔpidas a la nube.

La demostración fue parte de la conferencia de desarrolladores de NVIDIA esta semana. Otros aspectos destacados incluyeron un sistema para automóviles autónomos que tiene como objetivo mapear 300,000 millas de carreteras en centĆ­metros para 2024 y una supercomputadora de inteligencia artificial que la compaƱƭa dice que serĆ” la mĆ”s rĆ”pida del mundo una vez que se lance (una afirmación tambiĆ©n hecha por Meta recientemente ).

Todo esto encaja perfectamente en una narrativa mĆ”s amplia . El mundo digital se estĆ” desangrando en el mundo real, y viceversa. Y no solo libros, mĆŗsica, fotos, documentos y pagos, sino tambiĆ©n personas, lugares e infraestructura. Dado que los chips de NVIDIA se destacan en IA y grĆ”ficos, la empresa estĆ” bien posicionada para participar en todo. De hecho, no contenta con crear rĆ©plicas digitales de escenas individuales, la compaƱƭa ha dicho que tambiĆ©n estĆ” construyendo un gemelo digital de la Tierra  .

Por supuesto, cada vez es mĆ”s difĆ­cil trazar la lĆ­nea entre los argumentos de venta y marketing y los desarrollos serios. No es raro ver combinaciones de todas las principales palabras de moda de la tecnologĆ­a (NFT, el metaverso, IA , blockchain) en un solo titular. Pero si bien la visión parece estar superando la capacidad, hay muchos indicios de que llegaremos tarde o temprano.

Una mini IA que puede convertir una pila de polaroids en una escena 3D es solo una de ellas.

Crédito de la imagen: NVIDIA

Fuente: https://singularityhub.com/2022/03/27/nvidias-tiny-new-ai-transforms-photos-into-full-3d-scenes-in-mere-seconds/

Deja una respuesta