La IA odia la incertidumbre. Sin embargo, para navegar por nuestro mundo impredecible, necesita aprender a tomar decisiones con informaciĂłn imperfecta, como lo hacemos todos los dĂ­as.

por Shelly Fan


DeepMind acaba de intentar resolver este enigma. El truco consistĂ­a en entretejer la teorĂ­a de juegos en una estrategia algorĂ­tmica vagamente basada en el cerebro humano llamada aprendizaje de refuerzo profundo. El resultado, DeepNash, derrocĂł a los expertos humanos en un juego de mesa altamente estratĂ©gico llamado Stratego. Un juego notoriamente difĂ­cil para la IA, Stratego requiere mĂșltiples fortalezas del ingenio humano: pensamiento a largo plazo, faroles y estrategias, todo sin conocer las piezas de tu oponente en el tablero.

“A diferencia del ajedrez y el Go, Stratego es un juego de informaciĂłn imperfecta: los jugadores no pueden observar directamente las identidades de las piezas de sus oponentes”, escribiĂł DeepMind en una publicaciĂłn de blog. Con DeepNash, “los sistemas de inteligencia artificial (IA) para juegos han avanzado a una nueva frontera”.

No todo es diversiĂłn y juegos. Los sistemas de inteligencia artificial que pueden maniobrar fĂĄcilmente la aleatoriedad de nuestro mundo y ajustar su “comportamiento” en consecuencia podrĂ­an algĂșn dĂ­a manejar problemas del mundo real con informaciĂłn limitada, como optimizar el flujo de trĂĄfico para reducir el tiempo de viaje y (con suerte) calmar la ira en la carretera como conducciĂłn autĂłnoma. los coches se vuelven cada vez mĂĄs presentes.

“Si estĂĄ haciendo un automĂłvil autĂłnomo, no quiere asumir que todos los demĂĄs conductores en la carretera son perfectamente racionales y se comportarĂĄn de manera Ăłptima”, dijo el Dr. Noam Brown de Meta AI, quien no estaba t involucrado en la investigaciĂłn.

El triunfo de DeepNash llega inmediatamente despuĂ©s de otro avance de IA este mes, donde un algoritmo aprendiĂł a jugar Diplomacia , un juego que requiere negociaciĂłn y cooperaciĂłn para ganar. A medida que la IA adquiere un razonamiento mĂĄs flexible, se vuelve mĂĄs generalizada y aprende a navegar en situaciones sociales, tambiĂ©n puede generar conocimientos sobre los procesos neuronales y la cogniciĂłn de nuestro propio cerebro.

Conoce a Stratego

En términos de complejidad, Stratego es una bestia completamente diferente en comparación con el ajedrez, el Go o el póquer, todos los juegos que la IA ha dominado previamente.

El juego es esencialmente capturar la bandera. Cada lado tiene 40 piezas que pueden colocar en cualquier posiciĂłn del tablero. Cada pieza tiene un nombre y rango numĂ©rico diferente, como “mariscal”, “general”, “explorador” o “espĂ­a”. Las piezas de rango superior pueden capturar las inferiores. El objetivo es eliminar a la oposiciĂłn y capturar su bandera.

Stratego es especialmente desafiante para la IA porque los jugadores no pueden ver la ubicaciĂłn de las piezas de sus oponentes, tanto durante la configuraciĂłn inicial como durante el juego. A diferencia del ajedrez o el Go, en los que cada pieza y movimiento estĂĄ a la vista, Stratego es un juego con informaciĂłn limitada. Los jugadores deben “equilibrar todos los resultados posibles” cada vez que toman una decisiĂłn, explicaron los autores.

Este nivel de incertidumbre es en parte la razĂłn por la que Stratego ha dejado perpleja a la IA durante mucho tiempo. Incluso los algoritmos de juego mĂĄs exitosos, como AlphaGo y AlphaZero , se basan en informaciĂłn completa. Stratego, en cambio, tiene un toque de Texas Hold’em , un juego de pĂłquer que DeepMind conquistĂł anteriormente con un algoritmo. Pero esa estrategia fracasĂł para Stratego, en gran parte debido a la duraciĂłn del juego, que a diferencia del pĂłquer, normalmente abarca cientos de movimientos.

La cantidad de jugadas potenciales es alucinante. El ajedrez tiene una posiciĂłn inicial. Stratego tiene mĂĄs de 10 66 posibles posiciones iniciales, mucho mĂĄs que todas las estrellas del universo.. El ĂĄrbol de juego de Stratego, la suma de todos los movimientos potenciales en el juego, totaliza la asombrosa cifra de 10 535 .

“La gran complejidad de la cantidad de resultados posibles en Stratego significa que los algoritmos que funcionan bien en juegos de informaciĂłn perfecta, e incluso aquellos que funcionan para el pĂłquer, no funcionan”, dijo el autor del estudio, el Dr. Julien Perolat de DeepMind. El desafĂ­o es “lo que nos entusiasmó”, dijo.

Una mente maravillosa

La complejidad de Stratego significa que la estrategia habitual para buscar movimientos de juego estĂĄ fuera de discusiĂłn. Apodada la bĂșsqueda del ĂĄrbol de Monte Carlo, un “enfoque incondicional de los juegos basados ​​en IA”, la tĂ©cnica traza rutas potenciales, como las ramas de un ĂĄrbol, que podrĂ­an resultar en la victoria.

En cambio, el toque mĂĄgico para DeepNash provino del matemĂĄtico John Nash, retratado en la pelĂ­cula A Beautiful Mind . Pionero en la teorĂ­a de juegos, Nash ganĂł el Premio Nobel por su trabajo sobre el equilibrio de Nash . En pocas palabras, en cada juego, los jugadores pueden aprovechar un conjunto de estrategias seguidas por todos, de modo que ningĂșn jugador gane nada cambiando su propia estrategia. En Statego, esto genera un juego de suma cero: cualquier ganancia que un jugador obtenga resultarĂĄ en una pĂ©rdida para su oponente.

Debido a la complejidad de Stratego, DeepNash adoptĂł un enfoque sin modelo para su algoritmo. AquĂ­, la IA no estĂĄ tratando de modelar con precisiĂłn el comportamiento de su oponente. Como un bebĂ©, tiene una especie de pizarra en blanco para aprender. Esta configuraciĂłn es particularmente Ăștil en las primeras etapas del juego, “cuando DeepNash sabe poco sobre las piezas de su oponente”, lo que hace que las predicciones sean “difĂ­ciles, si no imposibles”, dijeron los autores.

Luego, el equipo utilizĂł el aprendizaje de refuerzo profundo para potenciar DeepNash, con el objetivo de encontrar el equilibrio de Nash del juego. Es una combinaciĂłn perfecta: el aprendizaje por refuerzo ayuda a decidir el mejor prĂłximo paso en cada paso del juego, mientras que DeepNash proporciona una estrategia de aprendizaje general. Para evaluar el sistema, el equipo tambiĂ©n diseñó un “tutor” utilizando el conocimiento del juego para filtrar errores obvios que probablemente no tendrĂ­an sentido en el mundo real.

La prĂĄctica hace la perfecciĂłn

Como primer paso de aprendizaje, DeepNash jugĂł contra sĂ­ mismo en 5500 millones de juegos, un enfoque popular en el entrenamiento de IA denominado autojuego.

Cuando un lado gana, se premia a la IA y se fortalecen los parĂĄmetros actuales de su red neuronal artificial. El otro lado, la misma IA, recibe una penalizaciĂłn para amortiguar la fuerza de su red neuronal. Es como ensayar un discurso frente a un espejo. Con el tiempo, te das cuenta de los errores y te desempeñas mejor. En el caso de DeepNash, se desplaza hacia un equilibrio de Nash para lograr la mejor jugabilidad.

¿Qué pasa con el rendimiento real?

El equipo probĂł el algoritmo contra otros bots de Ă©lite de Stratego, algunos de los cuales ganaron el Campeonato Mundial de InformĂĄtica de Stratego. DeepNash aplastĂł a sus oponentes con una tasa de victorias de aproximadamente el 97 por ciento. Cuando se desatĂł contra Gravon, una plataforma en lĂ­nea para jugadores humanos, DeepNash derrotĂł a sus oponentes humanos. DespuĂ©s de mĂĄs de dos semanas de partidos contra los jugadores de Gravon en abril de este año, DeepNash subiĂł al tercer lugar en todos los partidos clasificados desde 2002.

Muestra que el arranque de los datos de juego humano a la IA no es necesario para que DeepNash alcance un rendimiento de nivel humano y lo supere.

La IA tambiĂ©n exhibiĂł un comportamiento intrigante con la configuraciĂłn inicial y durante el juego. Por ejemplo, en lugar de decidirse por una posiciĂłn inicial “optimizada” en particular, DeepNash cambiaba constantemente las piezas para evitar que su oponente detectara patrones con el tiempo. Durante el juego, la IA rebotaba entre movimientos aparentemente sin sentido, como sacrificar piezas de alto rango, para localizar las piezas de mayor rango del oponente en el contraataque.

DeepNash tambiĂ©n puede farolear. En una jugada, la IA moviĂł una pieza de bajo rango como si fuera una de alto rango, atrayendo al oponente humano para que persiguiera la pieza con su coronel de alto rango. La IA sacrificĂł el peĂłn, pero a su vez, atrajo la valiosa pieza espĂ­a del oponente a una emboscada.

Aunque DeepNash se desarrollĂł para Stratego, se puede generalizar al mundo real. El mĂ©todo central puede instruir potencialmente a la IA para que aborde mejor nuestro futuro impredecible utilizando informaciĂłn limitada, desde el control de multitudes y trĂĄfico hasta el anĂĄlisis de la agitaciĂłn del mercado.

“Al crear un sistema de IA generalizable que sea robusto frente a la incertidumbre, esperamos llevar las capacidades de resolución de problemas de la IA a nuestro mundo inherentemente impredecible”, dijo el equipo.

CrĂ©dito de la imagen: Derek Bruff / Flickr

Fuente: https://singularityhub.com/2022/12/05/deepminds-latest-ai-trounces-human-players-at-the-game-stratego/

Deja una respuesta