Google lanzó Gemini 3.5 Flash el 19 de mayo y anunció una versión Pro para más adelante. La distinción es importante: el producto disponible en la presentación fue Flash; las capacidades prometidas para Pro no deben atribuirse a una herramienta que el usuario ya pueda contratar o probar en esa fecha.

La compañía presenta Flash como un modelo para tareas que combinan razonamiento y acciones mediante herramientas. El lanzamiento abarca sus aplicaciones y servicios para desarrolladores y empresas, con condiciones que varían según el producto. Los resultados de las evaluaciones publicadas pertenecen a Google y no son pruebas independientes de MMC.

De responder una pregunta a ejecutar varios pasos

Un asistente puede redactar una respuesta utilizando solo el contexto recibido. Un agente, en cambio, puede consultar una fuente, emplear una herramienta y usar ese resultado para decidir el siguiente paso. Esa secuencia amplía lo que puede hacer, pero también los lugares donde puede equivocarse.

En un flujo de trabajo, importa comprobar tanto el resultado final como las acciones intermedias. Un informe correcto no justificaría haber leído documentos fuera del alcance autorizado. Del mismo modo, una llamada a una herramienta puede completarse técnicamente y aun así corresponder a una instrucción mal interpretada.

Por eso, al evaluar un modelo para tareas con herramientas, conviene separar calidad de respuesta, selección de herramientas y cumplimiento de permisos. Son dimensiones distintas. Un porcentaje alto en una prueba pública no permite asumir que todas funcionan igual en una integración propia.

Cómo leer las comparaciones del lanzamiento

Google publica puntuaciones en diferentes conjuntos de evaluación. Cada conjunto mide una tarea con sus condiciones: ejecución de comandos, uso de herramientas o interpretación de información, entre otras. Sus porcentajes no se deben combinar como si fueran partes de una única calificación universal.

Una evaluación interna puede empezar con tareas repetibles y salidas comprobables. Además del acierto, interesa registrar los intentos fallidos, la latencia y el costo total de llegar a una respuesta utilizable. En procesos de varios pasos, repetir una llamada o corregir una acción también consume recursos.

La disponibilidad de Flash permite hacer esa comparación con una versión concreta. La mención de Pro queda como una expectativa anunciada, pendiente de su propio lanzamiento y de sus condiciones de acceso. Mantener esa separación evita elegir hoy sobre funciones que aún pertenecen a una hoja de ruta.

Para proyectos que necesitan ejecutar modelos en infraestructura propia, Gemma 4 plantea otra clase de decisión: elegir tamaño, memoria y modalidades de entrada en lugar de comparar únicamente un servicio gestionado.