Razonamiento autónomo para un humanoide con modelos de lenguaje y grafos semánticos

Un modelo de lenguaje puede convertir «limpia la mesa» en una lista de pasos razonable, pero no sabe qué hay sobre la mesa ni qué puede hacer el robot. Este proyecto conecta ambas cosas. Un modelo de lenguaje propone objetivos, y dos grafos, uno con lo que el robot sabe que es posible y otro con lo que ve en ese momento, determinan qué acciones son factibles. En 140 ejecuciones con acciones realizables el sistema produjo un plan válido en el 81 % de los casos, y en ningún caso generó un plan con una acción prohibida.
Contexto
Hay dos enfoques habituales para que un robot ejecute instrucciones en lenguaje natural. Los planificadores simbólicos son verificables pero rígidos, y fallan cuando la instrucción no encaja en sus reglas. Los modelos entrenados de extremo a extremo son flexibles, pero su comportamiento es difícil de acotar. En un humanoide que opera cerca de personas, esa falta de garantías es un problema práctico.
El trabajo opta por una arquitectura intermedia en la que el modelo de lenguaje propone y la estructura simbólica decide.
Arquitectura
Flujo del sistema, de la cámara y la instrucción del usuario al plan de acciones
Percepción. Una cámara RGB-D, que es el sensor disponible en el humanoide Unitree G1 para el que se diseñó el sistema. Los objetos se detectan con un modelo de vocabulario abierto.
Grafo semántico. Contiene el conocimiento de largo plazo: qué objetos existen, qué acciones admite cada uno y cuáles están prohibidas. Las acciones del robot se definen en un archivo JSON con sus precondiciones y efectos, lo que permite trasladar el sistema a otra plataforma.
Grafo semántico: relaciones objeto-acción-objeto y restricciones
Grafo perceptual. Contiene el contexto del momento: los objetos detectados en el cuadro actual y sus relaciones espaciales.
Grafo perceptual de un cuadro: instancias detectadas y relaciones espaciales
Razonamiento. El modelo de lenguaje (Llama 3.1 de 8 mil millones de parámetros) interpreta la instrucción y propone objetivos. Los objetivos se priorizan, se contrastan con ambos grafos y se convierten en una secuencia de acciones. Si no hay plan, se activan mecanismos de respaldo que reformulan el objetivo, replanifican o terminan sin actuar.
Las restricciones éticas no son un filtro que se aplique al final. Están incorporadas en el grafo semántico, de modo que una acción insegura no forma parte del espacio de acciones factibles.
Evaluación
Se usaron 15 instrucciones, cada una repetida 10 veces, en un escritorio de oficina simulado en Gazebo y en uno real. Las instrucciones cubren manipulación directa, tareas de varios pasos, condicionales, órdenes abstractas («escríbeme un ensayo»), tareas sociales («saluda a mis invitados»), una orden deliberadamente prohibida y una en español.
Entorno de escritorio simulado en Gazebo
El desempeño se midió con tres indicadores: el éxito de la tarea, el número de pasos de razonamiento como medida de complejidad independiente del hardware, y el tipo de falla.
Resultados
- Éxito. 113 de 140 ejecuciones con acciones realizables, es decir, 81 %.
- Seguridad. El modelo de lenguaje propuso en ocasiones objetivos éticamente cuestionables. En todos los casos fueron descartados antes de la ejecución.
- Fallas. Se concentran en las órdenes abstractas o ambiguas y provienen sobre todo del modelo de lenguaje: objetivos mal formulados o inventados. Los errores de percepción, por detecciones inestables o ausentes, son la segunda causa.
Distribución de las fallas por categoría de tarea: percepción, planeación y modelo de lenguaje
Tasa de éxito frente al número promedio de pasos de razonamiento
Cuando el sistema falla, lo hace sin actuar. Varias fallas ocurrieron además después de completar parte de la tarea.
Lo que falta
El «éxito» mide que se genere un plan completo y válido, no que un robot físico lo ejecute. El alcance de la validación es el razonamiento, con percepción real y simulada, y no incluye manipulación con el humanoide. El robot se supone estacionario frente a su zona de trabajo. El rendimiento depende de la calidad con la que se describan las acciones y del modelo de lenguaje usado, que es pequeño; las órdenes en inglés funcionaron mejor que en español. La autonomía continua, en la que el robot genera sus propios objetivos de forma indefinida, queda planteada pero no resuelta.
Relación con Robiolab
Este proyecto abre en el laboratorio el nivel de decisión, que hasta ahora no se había abordado: los demás trabajos del grupo se ocupan del cuerpo del robot, de su control o de la decodificación de la intención humana. Comparte con ellos el interés por la interacción con personas, y su aporte más reutilizable es la forma de tratar la seguridad como una propiedad de la estructura y no como una verificación posterior.
