#Sim-to-Real
Fundamentos de Aprendizado por Reforço — MDPs, Equações de Bellman e Exploração para Robôs
O aprendizado por reforço é um processo de circuito fechado no qual um agente escolhe ações a partir de observações e maximiza recompensas futuras. Este guia explica os Processos de Decisão de Markov (MDPs), funções de valor, políticas, equações de Bellman, exploração versus explotação, design de recompensas e o caminho da simulação para um robô real.
Fundamentals · 7 min de leitura Aprendizado por reforço September 3, 2026Aprendizado por reforço baseado em modelos e simulação para realidade
Modelos mundiais, erro de previsão, MPC, randomização de domínio, identificação de sistemas e monitoramento de segurança para máquinas reais.
Fundamentals · 5 min de leituraGradientes de Política, PPO e SAC — Controle Contínuo Estável para Robôs
Os gradientes de política atualizam uma política diretamente, de modo que a direção, o impulso e o torque das juntas possam permanecer contínuos. Este artigo conecta os modelos Ator-Crítico, PPO e SAC, e aborda, em seguida, o recorte, a regularização de entropia, a avaliação e o limite de segurança para a transferência de simulação para realidade.
Fundamentals · 6 min de leitura