Gemini 3 de Google se lanzó esta semana con avances impresionantes en algunas de las evaluaciones de razonamiento mÔs difíciles del campo, un cambio que investigadores de IBM consideran refleja un avance real en las capacidades de Google como modelos de frontera.

por Sascha Brodsky – Redactor IBM

Gemini 3 introduce un conjunto de mejoras de funciones que Google describe como un avance en capacidad prĆ”ctica. SegĆŗn el anuncio de la empresa, el modelo ahora gestiona texto, imĆ”genes, audio y vĆ­deo en una Ćŗnica ventana de contexto; aƱade nuevas herramientas de codificación por agentes que permiten a los desarrolladores generar aplicaciones funcionales a partir de prompts y amplĆ­a su alcance a travĆ©s de Google Search, la app Gemini y plataformas empresariales como Vertex AI.

Impulso de benchmark

Google tambiĆ©n presume de saltos en benchmarks que, segĆŗn Ć©l, reflejan mejoras en el razonamiento y el uso de herramientas. La empresa destacó los avances en ARC-AGI, un mayor rendimiento en la ejecución de código basado en terminal y mejores resultados en tareas orientadas al desarrollador que requieren pasos de planificación y ejecución de herramientas.

Google estĆ” posicionando Gemini 3 como la pieza central de un ecosistema mĆ”s amplio basado en herramientas agentes y coordinación entre aplicaciones. El centro de ese esfuerzo es Antigravity, un entorno de desarrollo integrado diseƱado para permitir que el modelo planifique tareas, llame a herramientas, opere entre terminales y navegadores, y distribuya trabajo entre mĆŗltiples agentes.

Las primeras impresiones muestran tanto promesas como advertencias

Los primeros evaluadores seƱalaron que Google reportó avances considerables para Gemini 3 en varias evaluaciones de alta dificultad, incluyendo Humanity’s Last Exam, GPQA Diamond y ARC-AGI-2, y destacaron mejoras en cómo el modelo interpreta texto, imĆ”genes, audio y vĆ­deo juntos. TambiĆ©n seƱalaron nuevas herramientas de codificación y agentes que pueden generar aplicaciones funcionales con menos prompting que versiones anteriores. Incluso con esos avances, Marina Danilevsky, investigadora senior de IBM, dijo en un episodio reciente del podcast Mixture of Experts que Gemini 3 “sigue alucinando, y todavĆ­a le gusta dar respuestas en lugar de decir que no las conoce”.

Otros investigadores destacaron la importancia de la estrategia de ecosistemas de Google. Gabe Goodhart, arquitecto jefe de innovación abierta en IA de IBM, dijo en el podcast que “un modelo realmente bueno ya no estĆ” tan diferenciado.” Argumentó que la ventaja competitiva ahora reside en las herramientas circundantes y no solo en el tamaƱo del modelo. SeƱaló la Antigravedad como ejemplo, llamĆ”ndola “algo que no se puede encontrar en ningĆŗn otro sitio”, con la capacidad de lanzar “una flota de agentes delegados trabajadores” que pueden ejecutar tareas en paralelo.

Las pruebas prĆ”cticas hicieron que el contraste fuera mĆ”s claro. Merve Unuvar, directora de Middleware Agentico e Investigación de Aplicaciones en IA en IBM, dijo en el podcast que pidió a Gemini 3 que creara un panel personal de entrenamiento. El modelo configuró una interfaz Streamlit funcional en menos de dos minutos y ofreció un conjunto limpio de recomendaciones. Pero cuando pidió una orientación mĆ”s personalizada, le dio un consejo que ignoraba la información que ya tenĆ­a, diciĆ©ndole que “comiera alimentos ricos en nutrientes despuĆ©s del entrenamiento para ‘crecer'”, a pesar de saber su edad.

Goodhart dijo que la verdadera prueba para Gemini 3 vendrĆ” de lo bien que maneja flujos de trabajo complejos y multiagente, no solo benchmarks.

“Si el modelo realmente puede mantener ese nivel de independencia y anĆ”lisis paralelo”, dijo, “podrĆ­a ser un verdadero avance.”

Fuente: https://www.ibm.com/think/news/gemini-3-boosts-googles-standing-in-ai-tests

Tagged:

Deja una respuesta