Contents — find the section you need

Q-learning e DQN escolhem ações de um conjunto finito. A velocidade de uma roda, o empuxo de um drone ou o torque de um manipulador, no entanto, são contínuos. Os métodos de gradiente de política atualizam uma política \pi_\theta que gera uma distribuição sobre ações contínuas. O método Actor-Critic adiciona um Crítico que avalia essas ações; PPO e SAC adicionam estabilização prática amplamente utilizada em pesquisas com robôs.

Resumo de 30 segundos

  • Os gradientes de política aumentam o retorno esperado J(\theta) diretamente. Eles lidam com ações contínuas naturalmente, mas as estimativas de trajetória única têm alta variância.

  • O método Actor-Critic usa uma estimativa de valor como linha de base. A vantagem mede se uma ação foi melhor do que a ação média no mesmo estado.

  • O método PPO limita a razão de probabilidade entre as políticas antiga e nova, de modo que uma atualização não possa ir muito longe. É simples, mas os dados da política são difíceis de reutilizar.

  • O método SAC maximiza tanto a recompensa quanto a entropia da política. É um método fora da política padrão, utiliza repetição e é adequado para controle contínuo.

  • Nenhum dos métodos fornece limites de segurança. Mantenha os limites de ação, limites de taxa, PID/MPC de baixo nível e paradas de emergência fora do módulo de aprendizado.

1. Otimização direta de uma política

Diagram 1 · Use the button to switch views
Ator–Crítico: atualizar a política a partir da experiência

Figura 1 — O Ator propõe uma distribuição contínua e o Crítico avalia o retorno. No hardware, a ação passa por um controlador de nível inferior verificado, em vez de ir diretamente para o torque.

Para uma política estocástica \pi_\theta(a\mid s), o gradiente do retorno esperado J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] pode ser escrito usando o gradiente da probabilidade logarítmica:

\nabla_\theta J(\theta)=\mathbb{E}_{\pi_\theta}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,G_t\right]

Ações que produziram um alto retorno tornam-se mais prováveis. Como G_t é ruidoso e atrasado, subtrai-se uma linha de base dependente do estado. b(s_t) reduz a variância sem alterar o gradiente esperado:

\nabla_\theta J(\theta)=\mathbb{E}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,(G_t-b(s_t))\right]

2. Vantagem e Ator-Crítico

O Crítico aprende V_\phi(s) e estima se uma ação foi melhor que a média do estado com A_t=Q(s_t,a_t)-V(s_t). Uma aproximação TD de um passo é

\hat A_t=r_{t+1}+\gamma V_\phi(s_{t+1})-V_\phi(s_t)

A Estimativa de Vantagem Generalizada (GAE) combina vários passos com um hiperparâmetro de viés-variância \lambda. Conforme \lambda se aproxima de um, utiliza um horizonte mais longo e um viés menor, mas uma variância maior. Para um loop de atitude rápido, utilize o atraso e a escala de tempo reais da tarefa, em vez de copiar uma configuração de referência.

A perda do Ator é

L_\pi=-\mathbb{E}[\log\pi_\theta(a_t\mid s_t)\hat A_t]

e o Crítico minimiza o erro quadrático do valor

L_V=\mathbb{E}[(V_\phi(s_t)-\hat V_t)^2]

Quando um codificador de imagem é compartilhado, um gradiente altera ambas as estimativas. Taxas de aprendizado separadas, recorte de gradiente e um registro fixo de normalização de observação facilitam o diagnóstico de falhas.

3. PPO: não altere a política drasticamente de uma só vez

Os gradientes de política on-policy coletam um rollout com a política atual. Reutilizá-lo para muitas atualizações afasta a nova política da distribuição de dados. O PPO forma uma razão de probabilidade entre a política antiga \pi_{\theta_{old}} e a nova política,

r_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{old}}(a_t\mid s_t)}

e maximiza o objetivo recortado

L^{CLIP}=\mathbb{E}\left[\min\left(r_t\hat A_t,\operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t\right)\right]

Vantagens positivas não podem aumentar sua probabilidade indefinidamente, e vantagens negativas não podem diminuí-la indefinidamente. Um \epsilon pequeno é conservador; um grande permite atualizações mais ousadas. O recorte não é uma restrição de segurança, portanto, os limites de junta, velocidade e força permanecem separados.

Uma implementação Coleta um rollout fixo, normaliza a Vantagem e treina várias épocas de mini-lotes. Salva probabilidades de log antigas, distingue um timeout de um estado terminal verdadeiro e congela as estatísticas de normalização na avaliação. Caso contrário, duas execuções com os mesmos pesos podem se comportar de maneira diferente.

4. SAC: recompensa mais entropia

O Soft Actor-Critic (SAC) adiciona entropia de política \mathcal{H}(\pi) à recompensa futura como um objetivo:

J(\pi)=\mathbb{E}\left[\sum_t\gamma^t\left(r_t+\alpha\mathcal{H}(\pi(\cdot\mid s_t))\right)\right]

O termo de entropia impede que ações igualmente boas se reduzam a uma só muito cedo, atuando como uma temperatura \alpha que mantém a exploração ativa. O SAC é off-policy e usa um buffer de replay, de modo que cada transição do mundo real pode ser reutilizada. Isso melhora a eficiência da amostra, mas dados desatualizados, escala de recompensa e ajuste de temperatura são importantes.

Para uma ação contínua, o Ator gera a média \mu_\theta(s) e o desvio padrão. \sigma_\theta(s) de uma Gaussiana e, em seguida, mapeá-la para limites com tanh ou outra transformação. A probabilidade logarítmica precisa da correção Jacobiana dessa transformação. Redes Twin Q e a estimativa Q menor reduzem a superestimação. Decida se a implantação usa a média determinística ou retém o ruído de exploração.

5. Escolhendo PPO ou SAC

Aspecto PPO SAC
Dados implementações on-policy replay off-policy
Exploração distribuição de política e bônus de entropia a entropia faz parte do objetivo
Eficiência de amostragem baixa a média geralmente maior
Principais bugs probabilidade logarítmica, flags terminais, clipping superestimação Q, escala de recompensa, correção tanh
Ajuste típico muitos simuladores paralelos torque contínuo e dados de hardware escassos

O PPO geralmente é estável quando muitos ambientes simulados podem ser executados em paralelo. O SAC pode ser atraente quando cada transição real é cara. Nenhum dos métodos modela sensores. atraso, zonas mortas do motor ou saturação do atuador automaticamente.

6. Simulação para Realidade é um limite, não um interruptor

A diferença entre simulação e realidade surge da massa e do atrito, folga, exposição e ruído do sensor, atraso da rede, queda de tensão da bateria, material do piso e iluminação. A Randomização de Domínio amostra esses parâmetros para que a política não se ajuste excessivamente a um valor ideal. O intervalo deve ser medido a partir do hardware; randomizar mundos impossíveis apenas torna o treinamento mais difícil.

Uma transferência em etapas é mais segura: (1) simulação pura, (2) reprodução de registros reais do sensor sem movimento, (3) testes de baixa potência com as rodas levantadas, (4) velocidade e força limitadas em um piso livre e (5) a própria tarefa. Registre a ação solicitada separadamente da ação que o limitador de segurança realmente aprovou. Simulação para Realidade é um ciclo iterativo de identificação e avaliação, não um botão de implantação único.

7. Segurança e avaliação

O recorte PPO e a entropia SAC não impedem colisões. Monitores independentes devem verificar a velocidade, Aceleração, ângulo articular, força de contato, pressão hidráulica, corrente e temperatura. Em caso de observação inválida, NaN, timestamp expirado ou perda de comunicação, o monitor deve comandar uma parada segura. Coloque-o em um processo separado ou MCU quando o risco justificar.

Além da recompensa, meça o sucesso, a taxa de colisão, o desvio máximo, a distância de parada, a energia, a suavidade da ação, a latência de inferência e a taxa de intervenção do limitador de segurança. Uma alta taxa de sucesso com intervenção frequente significa que a política depende do limitador. Repita as execuções com várias sementes aleatórias e relate a variância e os piores casos, não apenas a média.

Lista de verificação de implementação

  1. Teste as unidades de ação, os limites, a ordenação tanh/clip e as correções de log-probabilidade.

  2. Para PPO, salve as probabilidades de log antigas, a vantagem e os indicadores de terminal versus tempo limite.

  3. Para SAC, monitore a distribuição de replay, os valores Q gêmeos, a temperatura \alpha e a escala de recompensa.

  4. Fixe o pré-processamento, a normalização, as sementes, os pesos e os parâmetros de ambiente por ID do experimento.

  5. Mantenha o PID/MPC de baixo nível, os limites de taxa, o watchdog e a parada de emergência independentes do aprendiz.

  6. Defina as condições de parada para logs passivos, baixo consumo de energia e operação normal antes de cada transição.

  7. Registre sucesso, colisão, intervenção do limitador, latência, energia e desvio máximo em conjunto.

Resumo

Os gradientes de política otimizam diretamente uma distribuição contínua de ações. O Actor-Critic usa Vantagem para reduzir a variância; o PPO limita a atualização; o SAC usa entropia e replay para melhorar a exploração e a eficiência dos dados. Nenhum deles resolve a incerteza ou a segurança do hardware por si só. Um controlador de baixo nível verificado, um monitor independente, transferência em etapas e avaliação do pior caso fazem parte do algoritmo quando uma política aprendida sai da simulação.

Verifique seu entendimento
O recorte do PPO garante um comportamento seguro?

Ele modera o objetivo de otimização, não as restrições de segurança física. Avalie a estabilidade do treinamento e segurança de ação separadamente.

Referências

What to read next

Review the backgroundAprendizado por Reforço Profundo e Q-Learning — De uma Tabela Q ao Aprendizado por Reforço ProfundoContinue the seriesGuia Básico de Design de Recompensas — Por que "O que Maximizar" é a Parte Mais Difícil do Aprendizado por RecompensaExplore another aspect of this fieldIntrodução à Aprendizagem por Reforço Multiagente — Otimizando em um Mundo Onde o Outro Lado Também Está Aprendendo