Internet

Google lanza una inteligencia artificial que permite a los robots pensar y actuar al mismo tiempo

Google lanza una inteligencia artificial que permite a los robots pensar y actuar al mismo tiempo

Google ha lanzado Gemini Robotics ER 2, su modelo de inteligencia artificial más avanzado para robótica. La nueva versión ayuda a que los robots puedan interactuar con humanos, coordinar tareas complejas y colaborar entre sí. La compañía confía en que su nuevo modelo servirá para liberar el verdadero potencial de la robótica y avanzar hacia la inteligencia artificial de propósito general.

De acuerdo con una publicación en su web, Gemini Robotics ER 2 funciona como un cerebro de alto nivel para los robots. La nueva actualización permite que las máquinas conversen con personas, entiendan su entorno físico y planifiquen secuencias de acciones de varios pasos. Para conseguirlo, DeepMind ha optimizado la forma como se procesan las acciones y se planean los siguientes pasos.

En lugar de ejecutar los movimientos directamente, Gemini Robotics ER 2 delega ese control a modelos de visión-lenguaje-acción (VLA) de bajo nivel. Esto le permite "pensar" en el siguiente paso mientras el robot ya está actuando. Además, el sistema puede llamar a herramientas externas como la Búsqueda de Google o funciones definidas por el desarrollador, las cuales le ayudarán a completar tareas que requieran información adicional.

Sumado a eso, otra mejora con respecto a su predecesor es cómo la IA procesa el vídeo de manera continua. Este ajuste ayuda a que el robot pueda seguir su propio progreso en una tarea, detectar errores sobre la marcha y saber con precisión cuándo ha terminado una fase antes de pasar a la siguiente. A diferencia de Gemini Robotics ER 1.6, esta versión del modelo ya no necesita reiniciar todo el flujo de trabajo si algo sale mal.

Gemini Robotics ER 2 ayuda a que varios robots colaboren entre sí

Otra novedad de Gemini Robotics ER 2 es la colaboración entre robots. El modelo permite que distintos tipos de máquinas trabajen juntos en espacios compartidos a través de una comprensión semántica común. Google mostró un ejemplo de esta interacción con el robot Franka F3 Duo que colocaba objetos en cajas mientras el Apollo 2 de Apptronik las acomodaba en un estante, una combinación que ninguno de los dos podría completar por separado.

Gemini Robotics ER 2 Gemini Robotics ER 2

Para reducir las pausas entre acciones, Gemini Robotics ER 2 se integra con la API de Gemini Live. Los ingenieros de DeepMind usan streaming bidireccional diseñado para reducir la latencia, lo cual elimina los cortes en donde el robot se detenía a pensar antes de ejecutar la siguiente acción.

Otro pilar del modelo es la clasificación continua del progreso y la capacidad de identificar cuándo se ha terminado una tarea. En la primera, Gemini Robotics ER 2 asigna a cada fotograma del vídeo un nivel de avance en cinco tramos, del 0 al 100%, con una precisión del 57,4%. Para localizar momentos clave e identificar el fotograma exacto en que ocurre algo crítico, el modelo alcanza un 91,3% de precisión con una distancia media de 0,96 segundos. Según Google, esto es cuatro veces más rápido que cualquier LLM, solo que a una fracción del coste computacional.

Gemini Robotics ER 2

La IA puede detectar humanos y detener al robot

Por último, Google señala que Gemini Robotics ER 2 es el modelo más avanzado en cuestión de seguridad. La nueva versión saca un buen tramo a su predecesor en los benchmarks de seguimiento de instrucciones de seguridad y detección de proximidad humana. En pruebas prácticas, el modelo puede detener automáticamente a un robot humanoide cuando detecta una persona cerca y lo reanuda de forma autónoma cuando la zona está despejada.

Gemini Robotics ER 2 ya está disponible para desarrolladores a través de la API de Gemini y Google AI Studio.

Seguir leyendo: Google lanza una inteligencia artificial que permite a los robots pensar y actuar al mismo tiempo

Información compartida por Technology Newz.

Artículos relacionados