Nuevo marco une lenguaje natural y manipulación robótica – Cómo funciona

Nuevo marco une lenguaje natural y manipulación robótica – Cómo funciona

9 min de lectura•22 may 2026•
Maya Patel
Maya Patel

Un marco de trabajo recién desarrollado permite que los robots traduzcan instrucciones complejas en lenguaje natural a acciones tridimensionales precisas, resolviendo un cuello de botella de larga data en la IA física. Al mapear frases ambiguas como "pásame la taza azul pequeña de la izquierda" a primitivas de movimiento ejecutables, el sistema eleva las tasas de éxito de tareas de aproximadamente 62 % a más del 89 %, acercando a los cobots industriales a una operación verdaderamente sin programación.

¿Qué es este nuevo marco de lenguaje a acción?

El marco, desarrollado por investigadores de un laboratorio líder en robótica, actúa como una capa intermedia entre el comando en lenguaje natural de un usuario y el sistema de control de bajo nivel del robot. Primero analiza la instrucción en componentes semánticos (objeto, ubicación, atributo, acción), luego empareja esos componentes con una biblioteca de 27 primitivas de acción predefinidas (p. ej., "agarrar", "colocar sobre", "deslizar a la izquierda", "rotar 90°"). Cada primitiva incluye una plantilla espacial 3D que el robot completa con datos de sensores en tiempo real de sus cámaras y sensores de fuerza-torque. En pruebas de referencia en 142 tareas de manipulación de objetos únicas, el sistema completó el 89.3 % de los ensayos al primer intento, frente al 61.7 % usando un pipeline basado únicamente en LLM.

¿Cómo traduce comandos complejos en movimientos precisos?

Secuencia de tres imágenes que muestran un brazo robótico interpretando un comando: primero entrada de texto, luego detección de objetos, luego ejecución de agarre

El pipeline funciona en cuatro etapas. Primero, un modelo de lenguaje ajustado (7 mil millones de parámetros, destilado de un modelo fundacional más grande) extrae frases nominales, preposiciones espaciales y verbos de acción del comando del usuario. Segundo, un módulo de lenguaje-visión basado en un campo de radiación neuronal (NeRF) del espacio de trabajo resuelve ambigüedades — "la caja roja más a la izquierda en el estante" se convierte en coordenadas (x=0,23 m, y=0,87 m, z=0,42 m) relativas a la base del robot. Tercero, una etapa de planificación de movimiento convierte las coordenadas objetivo y la primitiva de acción en una trayectoria en el espacio articular, verificando colisiones con una cuadrícula de ocupación en tiempo real actualizada a 30 Hz. Finalmente, un bucle de control de fuerza ajusta la trayectoria cuando el gripper entra en contacto con el objeto, compensando variaciones de peso y fricción.

La innovación clave del marco es su modelo de anclaje aprendido que mapea lenguaje a 3D sin requerir un punto de vista fijo de la cámara. En lugar de depender de una sola cámara aérea, fusiona datos de dos cámaras RGB-D montadas en la muñeca y una cámara de profundidad estática, permitiendo que el robot maneje escenas desordenadas donde los objetos están parcialmente ocluidos. En pruebas con 8 objetos diferentes de cocina e industriales (tazas, llaves, conectores) en desorden aleatorio, el sistema identificó correctamente el objeto objetivo en el 94.2 % de los ensayos, incluso cuando el usuario lo describió con sinónimos o atributos vagos como "el brillante".

¿Cómo se compara con enfoques existentes?

CaracterísticaEste marcoRT‑2 (Google)SayCan (Google)RoboFlamingo (OpenAI)
Modalidad de entradaLenguaje natural + visiónTexto + imagenSolo lenguajeTexto + video
Anclaje 3DNeRF + multivistaCuadro delimitador 2DLimitado (premapeado)2D + estimación de profundidad
Biblioteca de primitivas27 de conjunto cerradoAprendidas por RL551 habilidades (fijas)12 habilidades (conjunto abierto)
Latencia media de planificación120 ms450 ms210 ms320 ms
Éxito en primer intento89.3 %68.1 %82.4 %74.6 %
¿Código abierto?Parcial (solo modelos)NoNoSí

La comparación muestra que el nuevo marco sacrifica la generalización de habilidades de conjunto abierto (fortaleza de RT‑2) por fiabilidad y velocidad, lo que se alinea mejor con el despliegue industrial donde la repetibilidad es primordial. Su latencia de planificación de 120 ms — aproximadamente 2.6 veces más rápida que RT‑2 — significa que el robot puede reaccionar a correcciones humanas a mitad de comando sin retraso perceptible.

Gráfico comparativo de tasas de éxito de tareas entre diferentes marcos, con el nuevo marco liderando con 89.3 %

¿Qué robots pueden usar este marco?

El marco está diseñado para ser agnóstico al robot. Expone una interfaz de acción ROS 2 que cualquier manipulador con un modelo URDF estándar y retroalimentación de estado articular puede consumir. Los investigadores lo han validado en:

  • Universal Robots UR5e (6‑GDL, 5 kg de carga útil)
  • FANUC LR Mate 200iD (integrado mediante adaptador Ethernet/IP)
  • Franka Emika Panda (7‑GDL, articulaciones con detección de par)
  • KUKA LBR iiwa 14 (7‑GDL, controlador de impedancia)

El despliegue requiere: una PC con NVIDIA RTX 3060 o superior (para la inferencia NeRF y LLM), al menos dos cámaras RGB-D (Intel RealSense D435 o similar) y la distribución ROS 2‑foxy. El módulo de percepción funciona a 15 FPS en el hardware recomendado. Para celdas robóticas existentes, los costos de modernización se estiman en $4,500–$6,000 por estación para las cámaras y el cómputo. Si está evaluando plataformas compatibles, explore cobots usados en venta en Robot Overflow.

Qué significa para la automatización de almacenes y la manufactura

Para la recogida en almacenes y el ensamblaje ligero, el marco aborda el punto débil operativo más grande: reprogramar robots cuando cambian las líneas de productos. Actualmente, cambiar una celda de recogida de contenedores para manejar una nueva pieza a menudo requiere de dos a ocho horas de reprogramación manual. Con esta capa de lenguaje a acción, un supervisor simplemente puede escribir "toma el nuevo soporte plateado del contenedor A y colócalo en la cinta transportadora B rotado 90 grados", y el robot se recalibra autónomamente en menos de 10 segundos.

Las implicaciones para la manufactura de lotes pequeños son significativas. Una encuesta a 87 fabricantes estadounidenses encontró que el 62 % cita la complejidad de programación como la principal barrera para desplegar robots colaborativos. Al reducir la barrera de programación al lenguaje natural, el marco podría expandir el mercado direccionable para cobots más allá de aplicaciones de alto volumen. Si está evaluando robots industriales usados para una línea de producción flexible, esta tecnología hace que los cobots más antiguos sean viables para operaciones de SKU mixto que antes no podían manejar.

Un trabajador de fábrica hablando a una tableta mientras un brazo robótico recoge piezas de un contenedor

Qué significa para los compradores

Para usuarios finales que evalúan cobots para entornos dinámicos, este marco cambia la ecuación del costo total de propiedad. En lugar de presupuestar un programador de robots a tiempo completo (salario anual de $70k–$100k), un operador de celda con habilidades básicas de lectura puede manejar las reconfiguraciones. El punto de equilibrio del ROI cae de aproximadamente 18 meses a 11 meses para una instalación típica de cobot de $40k.

Recomendaciones clave para compradores: - Busque brazos robóticos con articulaciones con detección de par — la adaptación del bucle de fuerza del marco funciona mejor cuando el robot puede sentir las fuerzas de contacto (el Franka Panda y el KUKA LBR iiwa son excelentes opciones). - Asegúrese de que su red de fábrica soporte latencia inferior a 50 ms entre el ordenador de políticas y el controlador del robot — la ventaja de planificación desaparece con alta fluctuación. - Si ya posee un UR5e o similar, la actualización cuesta aproximadamente $5,000 en hardware más cero tarifas de licencia (el marco es de código abierto para investigación y uso interno).

Preguntas frecuentes

¿Qué brazos robóticos son compatibles oficialmente? El marco se ha probado en Universal Robots UR5e, FANUC LR Mate 200iD, Franka Emika Panda y KUKA LBR iiwa 14. Cualquier robot de 6 o 7 GDL con una interfaz ROS 2 estándar y retroalimentación de estado articular debería funcionar con configuración menor.

¿Qué tan buena es la comprensión del lenguaje con instrucciones vagas? El modelo de anclaje resuelve ambigüedades en el 94.2 % de los ensayos con sinónimos y descripciones parciales. Por ejemplo, "la cosa metálica brillante" se mapea al objeto correcto cuando un cabezal de atención basado en reflectancia está habilitado, pero el rendimiento cae al 82 % sin fusión de cámara de profundidad.

¿Puede manejar instrucciones de múltiples pasos? Sí, el marco encadena hasta cinco primitivas secuenciales de una sola oración, p. ej., "toma el perno rojo de la bandeja 3, insértalo en el agujero B y aprieta a 5 Nm". La tasa de éxito para cadenas de tres pasos es 83.6 %, cayendo a 71.0 % para cadenas de cinco pasos.

¿Requiere conexión a internet? No se realiza ninguna inferencia en la nube. El modelo de lenguaje se ejecuta localmente (7 mil millones de parámetros, cuantizado a 4 bits), y el NeRF se calcula en la misma máquina. La operación fuera de línea es un requisito de diseño para la fiabilidad en la planta de fábrica.

¿Cuáles son los datos de entrenamiento para el modelo de lenguaje? Los investigadores ajustaron un LLM preentrenado en un conjunto de datos personalizado de 12,500 especificaciones de tareas que cubren 27 primitivas de acción en 142 objetos. También usaron datos sintéticos generados por un simulador basado en GPT-4 para cubrir casos extremos como negaciones ("no la taza roja") y adjetivos compuestos.

¿Cómo se comparan los costos con la programación tradicional? La programación tradicional con colgante de enseñanza para un cambio de tarea de 15 minutos requiere 1–2 horas por cambio. El marco reduce eso a menos de 10 segundos de entrada en lenguaje natural. En un período de 12 meses con 50 cambios de tarea, esto ahorra aproximadamente $6,500 en costos laborales por estación (a $50/hora de costo de programador).

Tribunal de Arizona anula pena por homicidio involuntario tras un video de IA

Un tribunal de apelaciones de Arizona dejó sin efecto la pena de 10.5 años impuesta a Gabriel Horcasitas, pero confirmó su condena por homicidio involuntario, según informó inicialmente Nytimes. El caso vuelve al Tribunal Superior del condado de Maricopa para que se dicte una nueva pena sin el video, después de que los jueces concluyeran que presentaba declaraciones guionizadas como si la propia víctima hablara ante el tribunal.

El panel de tres jueces afirmó que el video generaba una representación de la voz y la apariencia de Christopher Pelkey, pero no reflejaba hechos reales. Concluyó que permitir el video y basarse en él hacía que la sentencia fuera fundamentalmente injusta, y señaló que ningún caso anterior en Arizona había abordado la admisibilidad de una representación de ese tipo en una audiencia de sentencia.

Los jueces afirmaron que el derecho de una víctima a expresarse no puede prevalecer sobre el derecho del acusado a recibir una sentencia basada en información precisa y fiable. También señalaron que el video desdibujaba la diferencia entre lo que la familia creía que Pelkey habría dicho y la voz y las opiniones del propio Pelkey.

El fallo distingue entre los familiares que hablan sobre Pelkey y una representación generada que parecía hablar en su nombre.

La hermana de Pelkey, Stacey Wales, presentó el video durante la audiencia de sentencia de Horcasitas, junto con declaraciones sobre el impacto en las víctimas por parte de familiares y amigos. Wales escribió el guion y dijo que su esposo y el socio comercial de la pareja desde hacía muchos años ayudaron a crear el video usando la voz de Pelkey de un video de YouTube y su rostro y torso de un cartel del servicio funerario.

El juez Todd F. Lang elogió el video por considerarlo genuino y luego impuso la pena máxima de 10.5 años, más de los nueve años que habían solicitado los fiscales.

Wales dijo que nadie pretendía hacer creer al tribunal que Pelkey seguía vivo ni que hubiera grabado el video antes de morir. Afirmó que no estaba de acuerdo con el fallo y sostuvo que las familias usan presentaciones de diapositivas, collages, conversaciones hipotéticas y poesía para expresar su dolor.

Wales comparó el video de IA con la fotografía y señaló que hicieron falta 15 años de casos judiciales históricos, alrededor de la década de 1860, para que la fotografía fuera ampliamente aceptada en los tribunales.

El caso vuelve al Tribunal Superior del condado de Maricopa para una nueva audiencia de sentencia, sin el video generado por IA.