Condicionamento latente discreto de premissas de movimento adversarial para locomoção quadrúpede baseada em física
animação de personagens baseada em física; _adversarial motion priors_; locomoção de quadrúpedes; representações latentes discretas; aprendizado por reforço
O controle de personagens baseado em física, quando treinado exclusivamente com recompensas de tarefas, produz uma locomoção fisicamente válida, porém perceptualmente pouco natural. _Adversarial Motion Priors_ (AMP) preenchem essa lacuna integrando dados de animação ou de captura de movimento ao ciclo de aprendizado por reforço por meio de um discriminador aprendido através de um treinamento adversarial. No entanto, em conjuntos de dados que englobam diversos tipos de marcha, o método AMP apresenta propensão ao colapso à moda e não oferece um canal explícito para requisitar uma habilidade específica em tempo de execução. Este trabalho propõe aprimorar o AMP com uma representação latente discreta utilizando um conjunto de dados reais de captura de movimento canino, redirecionados (retargeted) para um modelo simulado do robô Unitree Go2 no ambiente MuJoCo. Um _Vector-Quantized Variational Autoencoder_ (VQ-VAE) atua como modelo de estruturação latente dos dados de movimento, aprendendo um mapeamento (_codebook_) de protótipos de marcha cujos índices condicionam a política. Essa abordagem adiciona um canal de seleção de habilidades e, simultaneamente, preserva a mesclagem naturalista de marchas característica do AMP, bem como a flexibilidade de sua abordagem escalável, orientada a dados.