A Nvidia apresentou o GR00T, um modelo de fundação inovador que simula a cognição humana para capacitar robôs humanoides. Essa arquitetura divide a inteligência do robô em dois sistemas distintos, permitindo que máquinas executem tarefas complexas com planejamento e reflexos em tempo real. !Robô humanoide com representação de dois cérebros Cognição Dividida: Planejamento e Reação Inspirado na forma como os humanos processam informações, o GR00T opera com um "Sistema 2" para o planejamento deliberado e um "Sistema 1" para reações rápidas e instintivas. Essa abordagem resolve o desafio de equilibrar a necessidade de raciocínio complexo com a execução ágil de movimentos. O Sistema 2 atua como o centro de pensamento do robô. Ele utiliza um modelo de visão e linguagem para interpretar o ambiente através de câmeras e compreender instruções em linguagem natural. A partir disso, o sistema decompõe tarefas elaboradas em etapas menores, como identificar objetos e planejar a sequência de movimentos para alcançá-los. Este processo é intencionalmente lento, assemelhando-se ao pensamento humano que avalia o contexto e antecipa consequências antes de agir. Em contraste, o Sistema 1 é responsável pela execução em tempo real. Ele recebe o plano detalhado do Sistema 2 e o converte em comandos motores contínuos, ajustando os movimentos das juntas, dedos e pernas do robô a cada fração de segundo. Utilizando uma arquitetura de diffusion transformer, este sistema refina repetidamente os movimentos até alcançar uma trajetória suave e estável. Sua operação é quase automática, liberando o Sistema 2 para focar no planejamento dos próximos passos da tarefa, de forma similar aos reflexos humanos. Treinamento e Generalização da Inteligência Robótica O treinamento de um sistema tão sofisticado exige uma vasta quantidade de dados. A Nvidia emprega uma combinação de dados reais coletados de robôs em operação, simulações sintéticas geradas em sua plataforma Omniverse, e mais de 20 mil horas de vídeos em primeira pessoa de humanos realizando tarefas cotidianas. Essa última fonte é crucial para aprimorar a destreza dos robôs, permitindo que executem movimentos delicados com os dedos sem a necessidade de teleoperação intensiva. Um dos pilares do projeto GR00T é a capacidade de um único "cérebro" servir a múltiplos corpos robóticos, independentemente de suas proporções ou capacidades físicas. Isso é possível graças a camadas de codificação específicas para cada "corporificação", que traduzem as características físicas de cada robô para uma linguagem interna comum. A versão mais recente, OSMO, aprimora essa generalização, permitindo o controle integral do corpo – pernas, braços e mãos – a partir de uma única política de IA. Isso significa que um comando em linguagem natural pode coordenar simultaneamente um robô andando e manipulando um objeto, sem a necessidade de alternar entre diferentes sistemas de controle. Essa inovação representa um avanço significativo na autonomia e versatilidade dos robôs humanoides, abrindo caminho para aplicações mais complexas e adaptáveis em diversos ambientes.