AMD tiene un nuevo truco bajo la manga para hacer que los juegos se vean más brillantes, y consiste en permitir que una máquina aprenda cómo se comporta la luz en lugar de trazar rayos a través de una escena de la manera tradicional. Los investigadores de la compañía han publicado un documento titulado «Iluminación generativa temporalmente estable con un modelo de difusión de un solo paso», y la idea principal es simple: dejar que un generador de imágenes entrenado se encargue de la iluminación indirecta, fotograma a fotograma.
La idea proviene de SungYe Kim, uno de los autores, quien explicó el objetivo directamente. «Tratamos de resolver la iluminación global como un problema de generación de imágenes», dice en una presentación en video sobre el documento. «La iluminación global es lo que hace que una escena renderizada se vea real, y también es la parte más costosa de la renderización».
El Modelo de un Solo Paso
Los modelos de difusión suelen construir imágenes lentamente, trabajando a través de capas de ruido capa por capa durante muchos pasos. Los investigadores de AMD están omitiendo ese camino lento. Su modelo, llamado Stable Diffusion 2.1 Turbo, produce una imagen limpia en un solo paso de eliminación de ruido. Eso importa para la velocidad, porque la renderización en tiempo real necesita respuestas ahora, no más tarde.
El método toma un fotograma con iluminación directa como punto de partida. La luz directa proviene directamente de una fuente a un objeto, sin rebotes involucrados. Ese fotograma se convierte en la pista inicial para el modelo de difusión, dándole una idea de dónde viene la luz antes de que comience a inventar el resto.
Entrenamiento en Escenas Sintéticas
El modelo aprende de un conjunto de datos de 31,000 fotogramas renderizados en Blender Cycles, el renderizador de producción de Blender para el trazado de rayos. Cada fotograma tiene de 1 a 30 luces y objetos que se mueven, lo que significa que el modelo ve una amplia gama de condiciones de iluminación durante el entrenamiento. El conjunto de datos se ejecuta 50 veces en las GPU AMD Instinct MI210.
Las señales de entrenamiento incluyen información de iluminación dispersa, radiancia, material y geometría. Estas señales mantienen la imagen generada alineada con la forma y la superficie reales de la escena. El fotograma que se alimenta al modelo se procesa de una manera que lo obliga a concentrarse en la iluminación, no en la textura o el detalle. Ese paso de alineación es crucial, ya que la reacción pública al contenido generado por IA puede ser dura.
Manteniendo los Fotogramas Consistentes
Un problema importante con los modelos generativos es que se desvían. Realice la misma tarea una y otra vez y obtendrá resultados ligeramente diferentes cada vez, lo que se manifiesta como parpadeo o cambios repentinos cuando la tasa de fotogramas se mantiene constante. Los investigadores de AMD utilizan lo que se conoce como un VAE temporal, o TVAE, para solucionar eso.
El TVAE utiliza vectores de movimiento para alinear el fotograma actual con los fotogramas anteriores. Almacena un historial de salidas pasadas para que la iluminación no parpadee ni se vuelva extraña entre generaciones. Eso mantiene la experiencia visual fluida incluso cuando el modelo está generando continuamente nuevos fotogramas.
Cómo se compara con otros modelos generativos
Kim comparó el nuevo método con otros enfoques en la presentación. «Nuestro método recupera las sombras suaves y la iluminación de rebote, mientras que RGB↔X alucina contenido que no está presente en la escena y DiffusionRenderer distorsiona la geometría», dijo.
La comparación sugiere que el enfoque de AMD preserva la apariencia natural de la luz, en lugar de inventar detalles que no pertenecen a la escena. Esa distinción importa para los juegos, donde la diferencia entre una sombra real y una falsa es inmediatamente obvia para el jugador.
Números de rendimiento
El modelo se ejecuta a 0.29 segundos por fotograma, lo que equivale a aproximadamente 3.45 fotogramas por segundo, a una resolución de 512 x 512. Eso es en una RTX 3090, que se considera bastante rápida en comparación con otras técnicas nombradas. Todo el proceso necesita alrededor de 8–9 GB de VRAM.
Recuerde, esto es solo el paso de iluminación global, no todo el canal de procesamiento para renderizar un fotograma. El resultado final se compone con el fotograma original utilizando solo iluminación directa, lo que probablemente suaviza cualquier error un poco.
Lo que esto significa para los jugadores
El trabajo de AMD se inscribe en una tendencia más amplia hacia el renderizado neuronal. A principios de este año, Jack Huynh anunció una nueva suite de tecnologías FSR llamadas FSR Diamond, que incluye «renderizado neuronal de próxima generación». La nueva investigación se incluye en ese encabezado, junto con un escalado ascendente basado en ML, generación de fotogramas múltiples basada en ML, regeneración de rayos y trazado de rutas.
La compañía ya ha prometido renderizado neuronal para tarjetas Radeon y consolas con FSR Diamond. Este artículo muestra la base técnica para esa promesa. Si se lanza como una característica o permanece en el laboratorio depende del rendimiento y el acabado.
«La iluminación global es lo que hace que una escena renderizada se vea real, y también es la parte más costosa del renderizado».
La comparación con Nvidia
El anuncio de DLSS 5 de Nvidia provocó una fuerte reacción por parte de los jugadores, seguida de un retroceso y una reformulación para que pareciera menos agresivo para los jugadores y más útil para los desarrolladores. Los investigadores de AMD seguramente están siguiendo de cerca esa tormenta. Saben los riesgos de lanzar apresuradamente una nueva técnica de renderizado en los juegos sin pruebas adecuadas.
Ya circulan rumores sobre una aplicación de iluminación neuronal de AMD, incluyendo publicaciones del filtrador Kepler_L2 en los foros de Anandtech a través de Overclock3D. No está claro si eso se refiere a esta investigación específica o a algo más avanzado en el proceso de desarrollo.
Una cosa está clara: el renderizado neuronal ya no es exclusivo de Nvidia. AMD está impulsando su propia versión, y los detalles técnicos muestran un progreso genuino en la parte más difícil del problema.
La investigación es prometedora, pero los números muestran la brecha entre la prueba de concepto y el producto listo para su envío. 3.45 fotogramas por segundo en una GPU potente es rápido, pero está lejos de lo que los juegos necesitan para funcionar sin problemas a 60 fotogramas por segundo.
La verdadera prueba llegará cuando AMD decida cómo vender estas tecnologías a los jugadores. La compañía ha sido cuidadosa con la comunicación hasta ahora, y probablemente continuará siendo cautelosa. La investigación muestra el camino a seguir, pero la distancia desde el documento hasta el producto sigue siendo sustancial.
Por ahora, el artículo sirve como un indicador de dónde se encuentra el pensamiento de AMD. La compañía tiene un plan para el renderizado neuronal, y este trabajo es parte de él. Si se convierte en una característica práctica o permanece como una nota al pie en la historia de los gráficos por computadora depende de los próximos años de ingeniería.
Vea el video en torno al cual se construye la historia en PC Gamer.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

