Microsoft Research presenta el modelo de Rho-Alpha Robotics para la manipulación de inteligencia artificial física en el mundo real

Rho-Alfa
Los robots han prosperado durante mucho tiempo en entornos estrictamente controlados, como las líneas de montaje de las fábricas, pero todavía tienen dificultades en los entornos desordenados y cambiantes donde la gente vive y trabaja. Microsoft Research está posicionando un nuevo enfoque que llama «IA física», la aplicación de inteligencia artificial de agentes a sistemas físicos, como el siguiente paso hacia robots que puedan percibir, razonar y actuar de manera más autónoma junto con los humanos en espacios menos estructurados.

En el centro de esto está Rho-alpha (ρα), el primer modelo robótico de Microsoft Research derivado de los modelos de lenguaje visual de Microsoft Phi. Según la organización, el modelo está diseñado para traducir instrucciones en lenguaje natural en señales de control para sistemas robóticos, centrándose inicialmente en tareas de manipulación bimanual que requieren acciones coordinadas con las dos manos, como interruptores, cables, perillas, controles deslizantes y conectores enchufables.

Microsoft Research describe Rho-alpha como un modelo “VLA+”, enfatizando que va más allá de los sistemas tradicionales de visión-lenguaje-acción al incorporar capacidades adicionales de detección y aprendizaje. En cuanto a la detección, el modelo añade detección táctil y el equipo dice que se está trabajando para aplicar otras modalidades, como la fuerza. En cuanto al aprendizaje, Microsoft Research dice que está trabajando para permitir que Rho-alpha continúe mejorando durante la implementación aprendiendo de los comentarios de los usuarios. Esta capacidad tiene como objetivo ayudar a los robots a adaptarse a situaciones dinámicas y preferencias humanas.

Para demostrar las capacidades del modelo, Microsoft Research destacó la interacción Rho-alpha con BusyBox, el punto de referencia de interacción física recientemente introducido por el laboratorio donde los robots realizan diversas acciones manipulativas guiadas por instrucciones en lenguaje natural. El equipo también describió experimentos adicionales que utilizaron una disposición de dos brazos equipada con un sensor táctil para realizar tareas como insertar un enchufe y envolver una caja de herramientas. En un ejemplo, el sistema tuvo dificultades para completar la inserción del enchufe y dependió de la guía humana en tiempo real para recuperarse y completar la tarea, lo que enfatiza la importancia de los métodos de corrección con intervención humana a medida que estos sistemas avanzan hacia un despliegue más amplio.

La disponibilidad de datos sigue siendo una limitación central en la robótica, particularmente en la escala requerida para entrenar modelos básicos que pueden generalizarse en tareas y entornos. Según Microsoft Research, la simulación juega un papel importante en su estrategia para abordar la falta de datos robóticos previos al entrenamiento, en particular conjuntos de datos que incluyen retroalimentación táctil y otras modalidades de detección menos comunes. El proceso de capacitación del equipo utiliza un proceso de aprendizaje por refuerzo de múltiples etapas utilizando Isaac Sim de NVIDIA, que combina trayectorias sintéticas con conjuntos de datos de demostración físicos comerciales y disponibles abiertamente. Según Microsoft Research, el comportamiento táctil de Rho-alpha se estableció mediante entrenamiento conjunto en pistas físicas y simuladas, así como datos visuales de respuesta a preguntas a escala web, y planea extender el mismo diseño a modalidades de detección adicionales y una gama más amplia de tareas del mundo real.

Según Microsoft Research, Rho-alpha está evaluando actualmente diseños de dos brazos y robots humanoides, y planea publicar una especificación técnica en los próximos meses. La organización también está abriendo una vía de acceso a partes interesadas externas, invitando a fabricantes, integradores y usuarios finales de robótica a expresar interés en el Programa de acceso temprano a la investigación Rho-alpha para evaluar el modelo para robots y escenarios específicos. Microsoft Research también dijo que Rho-alpha estará disponible a través de Microsoft Foundry en una fecha posterior, lo que indica un paso del acceso a la investigación a herramientas más amplias y flujos de trabajo de implementación.

CITAS CLAVE

«La aparición de modelos de visión-lenguaje-acción (VLA) en sistemas físicos permite a los sistemas percibir, razonar y actuar con creciente autonomía junto con los humanos en entornos mucho menos estructurados».

Ashley Llorens, vicepresidenta corporativa y directora general de Microsoft Research Accelerator

«Si bien la generación de datos de entrenamiento mediante sistemas robóticos teleoperados se ha convertido en una práctica común, hay muchos entornos donde la teleoperación no es práctica o imposible. Estamos trabajando con Microsoft Research para enriquecer los conjuntos de datos previos al entrenamiento recopilados de robots físicos con diversas presentaciones sintéticas utilizando una combinación de simulación y aprendizaje por refuerzo».

El profesor Abhishek Gupta es profesor asistente en la Universidad de Washington.

«Para entrenar modelos básicos que puedan razonar y actuar es necesario superar la escasez de datos diversos del mundo real. Al aprovechar Isaac Sim de NVIDIA en Azure para crear conjuntos de datos sintéticos físicamente precisos, Microsoft Research está acelerando el desarrollo de modelos versátiles como Rho-alpha que pueden dominar tareas de manipulación complejas».

Deepu Talla, vicepresidente de NVIDIA Robotics y Edge AI

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *