Gemini Spark: la apuesta de Google para entrar en la era agéntica
Google ha presentado Gemini Spark, un agente personal de IA integrado en Gemini que promete ejecutar tareas digitales en segundo plano siguiendo...

Google DeepMind presentó el 28 de julio Gemini Robotics 2, una nueva generación de modelos que extiende el control a todo el cuerpo de robots humanoides. ER 2 ya puede probarse en preview mediante Gemini API y Google AI Studio, mientras el modelo de acción mantiene un acceso anticipado para sus partners.
Tabla de contenidos
Google DeepMind ha presentado Gemini Robotics 2, una nueva generación de modelos para IA física que amplía el control desde brazos y manipuladores hasta robots de cuerpo completo. La novedad está en coordinar locomoción, equilibrio, alcance y manipulación dentro de una misma tarea, en lugar de tratar esos movimientos como acciones aisladas.
La familia también separa mejor las funciones. Gemini Robotics ER 2 interpreta el entorno, razona y planifica, mientras Gemini Robotics 2 convierte esas decisiones en acciones físicas. Esta arquitectura acerca el comportamiento de los robots a los agentes de IA que combinan percepción, planificación y ejecución, con una diferencia importante: aquí los errores pueden trasladarse directamente al mundo físico.
La disponibilidad marca el alcance real del anuncio. ER 2 puede utilizarse en preview mediante Gemini API y Google AI Studio, mientras Gemini Robotics 2 mantiene acceso anticipado para partners y On-Device 2 continúa limitado a testers seleccionados.
Gemini Robotics 2 amplía el tipo de movimiento que puede gobernar un modelo visión-lenguaje-acción. Frente a sistemas centrados principalmente en brazos o manipuladores, Google DeepMind plantea un VLA capaz de traducir instrucciones y percepción visual en acciones coordinadas sobre todo el cuerpo. En un humanoide, esto supone combinar desplazamiento, postura, equilibrio y manipulación dentro de una misma tarea.
El cambio no consiste únicamente en controlar más articulaciones. El cuerpo pasa a formar parte de la estrategia de ejecución: el robot puede necesitar desplazarse para alcanzar un objeto, ajustar su postura antes de manipularlo o mantener el equilibrio mientras actúa. Esto obliga al modelo a coordinar decisiones motoras que antes podían resolverse como movimientos más aislados.
La diferencia se aprecia especialmente cuando una tarea exige modificar la posición del robot antes de manipular un objeto. Un humanoide puede necesitar dar un paso, agacharse, reajustar su centro de gravedad y colocar las manos antes de ejecutar la acción. Según Google DeepMind, Gemini Robotics 2 puede controlar humanoides desde los pies hasta las puntas de los dedos y coordinar esos movimientos en función de la tarea y del entorno.
Esto amplía el espacio de acciones que puede resolver un mismo modelo. El desplazamiento deja de ser una fase separada de la manipulación y pasa a formar parte de una secuencia motora coordinada, algo especialmente relevante cuando el robot debe alcanzar objetos, mantener estabilidad o adaptar su postura mientras interactúa con ellos.
La familia separa la planificación de alto nivel de la ejecución física. Gemini Robotics ER 2 funciona como capa de razonamiento: interpreta el entorno, analiza lo que ocurre y puede organizar una tarea en varios pasos antes de decidir qué debería suceder a continuación. La ejecución motora puede delegarse después en Gemini Robotics 2 u otro modelo de acción compatible.
Esta separación permite tratar percepción, planificación y movimiento como componentes relacionados pero distintos. En la práctica, un sistema puede utilizar ER 2 para decidir qué hacer y generar instrucciones para la siguiente acción, mientras otro modelo se encarga de convertir esa decisión en movimientos sobre el robot. Razonar sobre una tarea y controlar físicamente las articulaciones no son, por tanto, la misma capacidad.
La familia Gemini Robotics 2 no tiene una disponibilidad uniforme. Para experimentar ahora, el punto de entrada accesible para desarrolladores es Gemini Robotics ER 2, disponible en preview mediante Gemini API y Google AI Studio. El modelo Gemini Robotics 2 que genera las acciones físicas mantiene un acceso anticipado limitado a partners, mientras On-Device 2 continúa restringido a trusted testers.
Esta diferencia condiciona qué parte del sistema puede probarse hoy. Un equipo puede trabajar con percepción, razonamiento, planificación y uso de herramientas, pero no obtener mediante el mismo acceso el modelo de acción de cuerpo completo utilizado en las demostraciones de DeepMind. Separar estos niveles evita confundir el acceso a ER 2 con la disponibilidad de toda la arquitectura robótica.
| Modelo | Función principal | Disponibilidad |
|---|---|---|
| Gemini Robotics 2 | Generar acciones y coordinar el movimiento del cuerpo del robot | Early access para partners |
| Gemini Robotics ER 2 | Percepción, razonamiento, planificación y uso de herramientas | Preview mediante Gemini API y Google AI Studio |
| Gemini Robotics On-Device 2 | Ejecutar capacidades robóticas localmente | Acceso para trusted testers |
La consecuencia práctica es que la capa de razonamiento ya puede probarse con herramientas para desarrolladores, mientras el acceso al control físico directo y a la ejecución local sigue siendo más limitado.
Google documenta Gemini Robotics ER 2 en Gemini API mediante dos variantes en preview. gemini-robotics-er-2-preview está orientado a capacidades como razonamiento espacial y temporal, análisis de vídeo, planificación de varios pasos y coordinación con herramientas. gemini-robotics-er-2-streaming-preview utiliza Live API para escenarios que necesitan procesar audio y vídeo de forma continua y reducir la latencia de interacción.
En la práctica, ER 2 puede interpretar una escena, descomponer una tarea y decidir qué debería ocurrir a continuación, además de generar información que otro sistema robótico pueda utilizar. No sustituye al modelo de acción que controla directamente el cuerpo del robot: esa ejecución puede recaer en Gemini Robotics 2 u otro VLA integrado por el desarrollador.
Esto permite empezar a construir y evaluar la lógica de un agente físico sin disponer del sistema completo mostrado por DeepMind. Un equipo puede probar percepción, planificación, seguimiento de tareas o conexión con herramientas externas, pero el acceso público a ER 2 no incluye las capacidades de control corporal de Gemini Robotics 2. Google no ha anunciado una fecha de disponibilidad general para ese modelo de acción.
Las demostraciones publicadas por Google muestran que Gemini Robotics 2 puede combinar manipulación, desplazamiento y coordinación corporal dentro de una misma tarea, mientras ER 2 añade capacidades de seguimiento, razonamiento de varios pasos y planificación sobre lo que debería ocurrir a continuación. El avance está en integrar mejor esas funciones, no en demostrar que el sistema pueda reproducirlas con la misma fiabilidad en cualquier robot o entorno.
Esa diferencia es importante porque una demo o un benchmark confirma una capacidad bajo determinadas condiciones, pero no equivale a validar un despliegue prolongado en producción. El rendimiento depende de la tarea, el entorno, el hardware y la integración, por lo que los resultados publicados deben interpretarse dentro de las condiciones en las que fueron evaluados.
Entre los ejemplos mostrados por DeepMind aparecen tareas como enroscar una bombilla, hacer nudos, agacharse para alcanzar objetos o mantener el equilibrio durante una manipulación. También se presentan escenarios en los que varios robots participan en distintas partes de una misma tarea, con ER 2 apoyando la planificación y el seguimiento de lo que ocurre.
En las evaluaciones publicadas por Google, ER 2 alcanza un 57,4 % de precisión en clasificación de progreso y un 91,3 % en detección de momentos relevantes dentro de una tarea. Estas métricas permiten medir funciones concretas como identificar cuánto ha avanzado una ejecución o cuándo termina una acción, pero no describen por sí solas el comportamiento completo de un robot durante una operación prolongada.
El valor práctico está en que el sistema puede utilizar la percepción continua para decidir si una tarea avanza según lo previsto y adaptar la siguiente acción. Esto resulta útil para agentes físicos que necesitan ejecutar procesos de varios pasos, aunque el rendimiento final seguirá dependiendo también del modelo de acción, los sensores y la plataforma robótica utilizada.
La propia documentación de Gemini Robotics ER 2 advierte de limitaciones que deben tenerse en cuenta al diseñar sistemas reales. Como otros modelos generativos, puede producir respuestas incorrectas, y su comportamiento depende de factores como las instrucciones utilizadas, la información percibida y la configuración del sistema. En escenarios de streaming también existe un compromiso entre capacidad de procesamiento, contexto y latencia.
A esto se suma una diferencia fundamental respecto al software convencional: una decisión incorrecta puede convertirse en una acción física. Por eso, las capacidades del modelo no sustituyen mecanismos independientes de seguridad, límites de movimiento, sistemas de parada, validación del entorno o controles específicos del hardware.
Gemini Robotics 2 amplía las capacidades que Google ha demostrado en control corporal y manipulación, pero todavía queda por comprobar cómo se comportan de forma sostenida cuando aumentan la duración, la variabilidad y las exigencias operativas. Las pruebas actuales aportan evidencia sobre capacidades concretas, no una garantía de fiabilidad general en producción.
Gemini Robotics 2 amplía el alcance de la IA física de Google hacia el control coordinado de cuerpo completo, mientras ER 2 concentra percepción, razonamiento y planificación. La separación entre ambas capas permite construir sistemas robóticos más modulares, pero también obliga a distinguir entre decidir qué hacer y ejecutar físicamente esa decisión.
Lo disponible para desarrolladores sigue siendo parcial: ER 2 puede probarse en preview mediante Gemini API y Google AI Studio, mientras Gemini Robotics 2 mantiene un acceso anticipado limitado. El siguiente indicador relevante será comprobar cómo evolucionan ese acceso y la fiabilidad de estas capacidades cuando pasen de demostraciones y evaluaciones controladas a entornos productivos más variables.
También te puede interesar
Google ha presentado Gemini Spark, un agente personal de IA integrado en Gemini que promete ejecutar tareas digitales en segundo plano siguiendo...

Esta formación está diseñada para profesionales tecnológicos interesados en dominar Gemini IA. Se centrará en impartir estrategias efectivas...
