porĀ Jason Dorrier
Hubo un tiempo en que convertir una fotografĆa antigua en una imagen digital impresionaba a la gente.Ā En estos dĆas podemos hacer un poco mĆ”s, comoĀ dar vida a fotos antiguas alĀ estilo de Harry Potter.Ā Y esta semana, el fabricante de chips NVIDIA realizó otro truco de magia.

Sobre la base de trabajos anteriores, los investigadores de NVIDIA demostraron cómo una pequeña red neuronal entrenada en unas pocas docenas de imÔgenes puede representar la escena representada en 3D completo. Como demostración, el equipo transformó las imÔgenes de un modelo sosteniendo una cÔmara Polaroid, una oda a Andy Warhol, en una escena 3D.
El trabajo se destaca por algunas razones.
Primero, es muy rĆ”pido. Los modelos de IA anteriores requerĆan horas para entrenar y minutos para renderizar escenas 3D. La red neuronal de NVIDIA no tarda mĆ”s de unos minutos en entrenarse y renderiza la escena en decenas de milisegundos. En segundo lugar, la propia IA es diminuta en comparación con los enormes modelos de lenguaje actuales. Los modelos grandes como GPT-3 funcionan con cientos o miles de unidades de procesamiento de grĆ”ficos (GPU). La IA de representación de imĆ”genes de NVIDIA se ejecuta en una sola GPU.
El trabajo se basa en campos de radiación neuronal (NeRF), una tĆ©cnica desarrollada por investigadores de UC Berkeley, UC San Diego y Google Research, hace un par de aƱos. En resumen, un NeRF toma un conjunto de datos limitado, digamos, 36 fotografĆas de un sujeto capturado desde una variedad de Ć”ngulos, y luego predice el color, la intensidad y la dirección de la luz que irradia desde cualquier punto de la escena. Es decir, la red neuronal llena los espacios entre las imĆ”genes con las mejores conjeturas basadas en los datos de entrenamiento. El resultado es un espacio 3D continuo unido a partir de las imĆ”genes originales.
La contribución reciente de NVIDIA, descrita en un artĆculo , coloca a los NeRF en fĆ”rmacos que mejoran el rendimiento. SegĆŗn el documento, el nuevo mĆ©todo, denominado Instant NeRF, explota un enfoque conocido como codificación de cuadrĆcula hash de resolución mĆŗltiple para simplificar la arquitectura del algoritmo y ejecutarlo en paralelo en una GPU. Esto mejoró el rendimiento en algunos órdenes de magnitud: su algoritmo se ejecuta hasta 1000 veces mĆ”s rĆ”pido, segĆŗn una publicación de blog de NVIDIA, sin sacrificar la calidad.
NVIDIA imagina que la tecnologĆa podrĆa llegar a los robots y automóviles autónomos, ayudĆ”ndolos a visualizar y comprender mejor el mundo que los rodea. TambiĆ©n podrĆa usarse para hacer avatares de alta fidelidad que las personas pueden importar a mundos virtuales o para replicar escenas del mundo real en el mundo digital donde los diseƱadores pueden modificarlas y desarrollarlas.
La velocidad y el tamaƱo de las redes neuronales importan en tales casos, ya que la mayorĆa de las personas no pueden usar algoritmos enormes que requieren cantidades prodigiosas de potencia informĆ”tica, ni son prĆ”cticos para robots y automóviles sin conexiones confiables y rĆ”pidas a la nube.
La demostración fue parte de la conferencia de desarrolladores de NVIDIA esta semana. Otros aspectos destacados incluyeron un sistema para automóviles autónomos que tiene como objetivo mapear 300,000 millas de carreteras en centĆmetros para 2024 y una supercomputadora de inteligencia artificial que la compaƱĆa dice que serĆ” la mĆ”s rĆ”pida del mundo una vez que se lance (una afirmación tambiĆ©n hecha por Meta recientemente ).
Todo esto encaja perfectamente en una narrativa mĆ”s amplia . El mundo digital se estĆ” desangrando en el mundo real, y viceversa. Y no solo libros, mĆŗsica, fotos, documentos y pagos, sino tambiĆ©n personas, lugares e infraestructura. Dado que los chips de NVIDIA se destacan en IA y grĆ”ficos, la empresa estĆ” bien posicionada para participar en todo. De hecho, no contenta con crear rĆ©plicas digitales de escenas individuales, la compaƱĆa ha dicho que tambiĆ©n estĆ” construyendo un gemelo digital de la Tierra .
Por supuesto, cada vez es mĆ”s difĆcil trazar la lĆnea entre los argumentos de venta y marketing y los desarrollos serios. No es raro ver combinaciones de todas las principales palabras de moda de la tecnologĆa (NFT, el metaverso, IA , blockchain) en un solo titular. Pero si bien la visión parece estar superando la capacidad, hay muchos indicios de que llegaremos tarde o temprano.
Una mini IA que puede convertir una pila de polaroids en una escena 3D es solo una de ellas.
Crédito de la imagen: NVIDIA