Transparencia
Google DeepMind lanza Gemini Robotics ER 2 para que los robots entiendan vídeo en vivo
Afirmaciones verificadas
Cada fotograma se evalúa en cinco niveles de progreso: 0-20%, 20-40%, 40-60%, 60-80% y 80-100%.
Estado: Verificada (fuente primaria)
El modelo entiende una transmisión de vídeo en vivo, en lugar de apoyarse solo en fotogramas estáticos, para decidir si un paso está completado.
Estado: Verificada (fuente primaria)
El modelo ofrece una ejecución aproximadamente 4 veces superior y con menos cómputo que modelos mucho más grandes.
Estado: Declarada por la fuente · Requiere atribución
Error medio absoluto en detección de momentos: 0,96 segundos.
Estado: Verificada (fuente primaria)
Gemini Robotics ER 2 gestiona la planificación de alto nivel en robótica, mientras otro modelo se encarga del control/motores.
Estado: Verificada (fuente primaria)
Google DeepMind presenta Gemini Robotics ER 2, un modelo de embodied reasoning para entender vídeo en vivo, orquestar tareas y habilitar colaboración entre varios robots.
Estado: Verificada (fuente primaria)
Precisión de clasificación de progreso de tareas: 57,4%.
Estado: Verificada (fuente primaria)
Precisión en detección de momentos críticos: 91,3%.
Estado: Verificada (fuente primaria)