Contents — find the section you need

O aprendizado por reforço (RL) é uma maneira de um robô aprender qual ação compensa a longo prazo interagindo com o ambiente. Diferentemente da classificação de imagens, onde uma entrada e um rótulo chegam juntos, o robô observa o mundo, move um motor e recebe uma recompensa — geralmente vários segundos depois. O ciclo essencial é tentar, observar o resultado e atualizar a política.

Resumo de 30 segundos

  • A menor transição de RL é, no instante t, estado (ou observação) s_t, ação a_t, recompensa r_{t+1} e próximo estado s_{t+1}.

  • Um processo de decisão de Markov (MDP) modela como o estado e a ação atuais produzem um próximo estado e recompensa. O estado deve resumir o histórico suficientemente bem para a previsão.

  • Uma política \pi(a\mid s) escolhe as ações; Uma função de valor V^\pi(s) representa o retorno futuro esperado quando essa política é seguida.

  • O retorno desconta recompensas futuras com \gamma. Um horizonte muito longo pode desestabilizar o aprendizado, enquanto um horizonte muito curto produz um robô míope e inseguro.
  • A exploração tenta ações incertas; a exploração escolhe a ação que atualmente se acredita ser a melhor. No hardware, as restrições de segurança estão acima de ambas.

  • A exploração tenta ações incertas; a exploração escolhe a ação que se acredita ser a melhor no momento. No hardware, as restrições de segurança estão acima de ambas.

1. Veja o robô como um agente

Diagram 1 · Use the button to switch views
Observation, action, and reward loop in reinforcement learning An agent selects an action from an observation and the environment returns the next observation and a reward Agentcomputes π(a|s) Environmentphysics, simulator, or people action aₜ observation oₜ₊₁ and reward rₜ₊₁ state sₜ is an internal summary of the observation history

Figura 1 — Após uma ação do agente, o ambiente muda e retorna a próxima observação e recompensa. Um robô real adiciona atraso de comunicação, ruído do sensor e saturação do atuador a esse ciclo.

Para um robô com tração diferencial, o agente pode usar dados da câmera, LiDAR e encoder como seu estado e gerar as velocidades das rodas esquerda e direita como ações. O ambiente inclui a dinâmica do veículo, o atrito com o piso, obstáculos e o estado da bateria. Mover-se em direção a um objetivo pode gerar uma recompensa positiva, enquanto uma colisão ou uma mudança abrupta de direção pode ser penalizada. Um único sinal de “+1 no objetivo” geralmente é muito esparso; distância, velocidade, margem de parada e energia devem ser consideradas em conjunto.

2. MDP: dividir o problema em componentes

Um MDP é definido por um espaço de estados \mathcal{S} , um espaço de ações \mathcal{A} , uma probabilidade de transição P(s'\mid s,a) , uma função de recompensa R(s,a,s') e um fator de desconto \gamma :

\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma),\qquad 0\le\gamma<1

Quando o agente escolhe a ação a_t no estado s_t , o ambiente transita para um próximo estado s_{t+1} de acordo com P e retorna a recompensa r_{t+1}=R(s_t,a_t,s_{t+1}) .

“Markov” significa que, uma vez conhecido o estado atual, o passado não adiciona mais informações necessárias para prever o futuro. Um robô móvel cujo estado contém apenas a posição não consegue distinguir um robô parado de um que está deslizando pela mesma posição. Inclua velocidade, taxa angular e confiança do sensor, ou use um modelo recorrente que retenha o histórico.

Quando o estado completo s_t não pode ser observado diretamente, o problema é um MDP parcialmente observável (POMDP). Quase todos os robôs reais são um POMDP devido a oclusões e à falta de retornos do LiDAR. Um estimador de estado — um EKF, um grafo fatorial ou um modelo aprendido — transforma as observações o_t em um estado interno útil. O artigo sobre fusão de sensores explica esse limite, e o Guia Introdutório do ROS 2 mostra como torná-lo um componente de software reproduzível.

3. Funções de valor e retorno

A soma descontada das recompensas desde o instante t é o retorno G_t:

G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots

O valor do estado s sob a política \pi é

V^\pi(s)=\mathbb{E}_\pi[G_t\mid s_t=s]

e o valor estado-ação também especifica a primeira ação:

Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid s_t=s,a_t=a]

Selecionar o maior valor Q é um projeto baseado em valor. Atualizar diretamente os parâmetros \theta de uma política neural \pi_\theta(a\mid s) é baseado em política. Ângulos de direção contínuos e torques articulares geralmente favorecem métodos de gradiente de política ou Ator-Crítico, porque enumerar todas as ações possíveis é impossível.

4. A equação de Bellman divide um horizonte longo em uma única etapa

Em vez de avaliar todo o futuro de uma só vez, divida-o na recompensa imediata mais o valor uma etapa depois. A equação de expectativa de Bellman é:

V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^\pi(s')\right]

O valor ótimo V^*(s) obedece à equação de otimalidade de Bellman:

V^*(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^*(s')\right]

É por isso que um valor alvo pode ser gerado a partir de outras estimativas, em vez de um rótulo fornecido por um humano. A autorreferência também é uma fonte de instabilidade. Redes de alvos, repetição de experiência e normalização de recompensa separam estimativas antigas da atualização atual e reduzem correlações prejudiciais.

5. Equilibrando exploração e explotação

Selecionar sempre a ação com a estimativa mais alta atual pode prender o agente em uma solução local favorável. A exploração tenta ações desconhecidas, mas o movimento aleatório em uma máquina real pode causar uma colisão. As opções comuns são:

Método Intuição Força Consideração de hardware
ε-greedy escolha aleatoriamente com probabilidade ε simples mudanças abruptas são inseguras para torque contínuo
Boltzmann/softmax amostra proporcionalmente ao valor favorece opções promissoras a temperatura precisa de ajuste
UCB tente ações com alta incerteza justificativa explícita para a exploração precisa de estimativas de incerteza
Política ruidosa adicione ruído contínuo às ações ou pesos exploração mais suave ainda precisa de saturação e limites

No hardware, confine a exploração a um envelope operacional validado. Coloque limites de velocidade, limites suaves para as juntas, limites de força/corrente, um watchdog e uma parada de emergência fora do algoritmo de aprendizado para que cada saída da política possa ser interceptada. A aleatorização em um simulador é útil; não é uma permissão para aplicar comandos aleatórios a uma máquina.

6. Verifique a ideia em um mundo de grade pequena

Uma grade 5×5 torna a dinâmica de aprendizado visível. Considere uma célula como o estado, cima/baixo/esquerda/direita como as ações, a recompensa do objetivo como +1, uma parede como −0,1 e cada passo como −0,01. Inicialize Q com zero e repita a atualização da diferença temporal:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

O termo entre colchetes é o erro TD: a diferença entre a previsão e o alvo de um passo. Se \alpha for muito grande, novas experiências dominam; se for muito pequeno, a política não consegue acompanhar um ambiente em mudança. Registre a taxa de sucesso, a média de passos, a taxa de colisões e a fração de estados não visitados — não apenas uma única curva de recompensa.

7. Escreva a recompensa como uma especificação

O design da recompensa geralmente importa mais do que um detalhe algorítmico. Um robô de entrega pode usar

r=w_d\,\Delta d-w_c\,\mathbf{1}_{\mathrm{collision}}-w_u\,|u|^2-w_j\,\|\Delta u\|^2

para combinar progresso, colisões, energia de entrada e suavidade. Aumentar o peso w nem sempre melhora o comportamento. Se a penalidade por colisão for dominante, o robô pode aprender a política segura, porém inútil, de nunca se mover. Registre cada termo separadamente e verifique qual termo a política está realmente otimizando.

A manipulação de recompensas é outro modo de falha: um bug no detector de objetivos, um ponto cego do sensor ou uma regra de contato exclusiva do simulador podem gerar uma pontuação alta sem atingir a tarefa pretendida. Objetivos legíveis por humanos, restrições baseadas em física e um ambiente de avaliação independente facilitam a detecção desses atalhos.

8. Onde a pesquisa encontra o produto

Métodos baseados em valor são eficientes em termos de dados, mas geralmente assumem estados e ações discretos. Gradientes de política e métodos Ator-Crítico lidam com controle contínuo; o SAC adiciona um objetivo de entropia, enquanto o RL baseado em modelo planeja com um modelo de dinâmica aprendido ou analítico antes de mover o robô. Métodos baseados em modelo podem reduzir amostras do mundo real, mas devem tolerar erros de modelo.

Na produção, o RL não é necessariamente aplicado a todas as camadas, desde o monitoramento de segurança até a corrente do motor. Um PID ou MPC clássico pode fornecer a margem de segurança enquanto o aprendizado por reforço (RL) seleciona um ponto de contato, uma preferência de rota ou um ganho programado. A visão geral do VLA descreve um limite semelhante: um modelo de linguagem visual pode propor blocos de ação enquanto um controlador de baixo nível verificado limita o torque e a velocidade.

9. Antes de passar para o hardware

  • O estado inclui velocidade, atraso e confiança do sensor, ou a suposição de Markov foi quebrada silenciosamente?

  • Os termos de recompensa são registrados separadamente, com taxa de colisão, energia, suavidade de entrada e distância de parada, além da taxa de sucesso?

  • Os intervalos de ação, limites de taxa, mecanismos de vigilância e paradas de emergência são independentes do algoritmo de aprendizado?

  • O atrito, a massa, o atraso do sensor, a iluminação e a perda de pacotes foram randomizados na simulação, e a diferença de distribuição foi medida em registros reais?

  • Um conjunto de avaliação não visto é mantido separado dos dados de treinamento? As falhas são incluídas em vez de filtradas? - Um processo reiniciado entra em um estado seguro e evita a repetição de um comando antigo?

Resumo

O aprendizado por reforço não faz um robô memorizar um "movimento correto". Ele define estados, ações, transições e recompensas como um MDP (Processo de Decisão de Markov), e então estima o valor a longo prazo passo a passo com equações de Bellman. Exploração, manipulação de recompensas e segurança de hardware devem fazer parte do projeto do sistema antes que uma política aprendida possa sair da simulação. Os próximos artigos desta série compararão Q-learning/DQN, gradientes de política, PPO e SAC, aprendizado por imitação e Sim-to-Real sob a mesma estrutura.

Verifique seu entendimento
A ação com a maior recompensa imediata é sempre a melhor?

Recompensas e transições futuras podem mudar a resposta.

Distinguir recompensa imediata de retorno descontado.

Referências

What to read next

Continue the seriesAprendizado por Reforço Profundo e Q-Learning — De uma Tabela Q ao Aprendizado por Reforço ProfundoExplore another aspect of this fieldIntrodução à Aprendizagem por Reforço Multiagente — Otimizando em um Mundo Onde o Outro Lado Também Está AprendendoExplore another aspect of this fieldπ0 Explicado — Como a Correspondência de Fluxo Mudou a Geração de Ações VLA