Contents — find the section you need
Q-learning e DQN escolhem ações de um conjunto finito. A velocidade de uma roda, o empuxo de um drone ou o torque de um manipulador, no entanto, são contínuos. Os métodos de gradiente de política atualizam uma política \pi_\theta que gera uma distribuição sobre ações contínuas. O método Actor-Critic adiciona um Crítico que avalia essas ações; PPO e SAC adicionam estabilização prática amplamente utilizada em pesquisas com robôs.
Resumo de 30 segundos
-
Os gradientes de política aumentam o retorno esperado J(\theta) diretamente. Eles lidam com ações contínuas naturalmente, mas as estimativas de trajetória única têm alta variância.
-
O método Actor-Critic usa uma estimativa de valor como linha de base. A vantagem mede se uma ação foi melhor do que a ação média no mesmo estado.
-
O método PPO limita a razão de probabilidade entre as políticas antiga e nova, de modo que uma atualização não possa ir muito longe. É simples, mas os dados da política são difíceis de reutilizar.
-
O método SAC maximiza tanto a recompensa quanto a entropia da política. É um método fora da política padrão, utiliza repetição e é adequado para controle contínuo.
- Nenhum dos métodos fornece limites de segurança. Mantenha os limites de ação, limites de taxa, PID/MPC de baixo nível e paradas de emergência fora do módulo de aprendizado.
1. Otimização direta de uma política
Figura 1 — O Ator propõe uma distribuição contínua e o Crítico avalia o retorno. No hardware, a ação passa por um controlador de nível inferior verificado, em vez de ir diretamente para o torque.
Para uma política estocástica \pi_\theta(a\mid s), o gradiente do retorno esperado J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] pode ser escrito usando o gradiente da probabilidade logarítmica:
Ações que produziram um alto retorno tornam-se mais prováveis. Como G_t é ruidoso e atrasado, subtrai-se uma linha de base dependente do estado. b(s_t) reduz a variância sem alterar o gradiente esperado:
2. Vantagem e Ator-Crítico
O Crítico aprende V_\phi(s) e estima se uma ação foi melhor que a média do estado com A_t=Q(s_t,a_t)-V(s_t). Uma aproximação TD de um passo é
A Estimativa de Vantagem Generalizada (GAE) combina vários passos com um hiperparâmetro de viés-variância \lambda. Conforme \lambda se aproxima de um, utiliza um horizonte mais longo e um viés menor, mas uma variância maior. Para um loop de atitude rápido, utilize o atraso e a escala de tempo reais da tarefa, em vez de copiar uma configuração de referência.
A perda do Ator é
e o Crítico minimiza o erro quadrático do valor
Quando um codificador de imagem é compartilhado, um gradiente altera ambas as estimativas. Taxas de aprendizado separadas, recorte de gradiente e um registro fixo de normalização de observação facilitam o diagnóstico de falhas.
3. PPO: não altere a política drasticamente de uma só vez
Os gradientes de política on-policy coletam um rollout com a política atual. Reutilizá-lo para muitas atualizações afasta a nova política da distribuição de dados. O PPO forma uma razão de probabilidade entre a política antiga \pi_{\theta_{old}} e a nova política,
e maximiza o objetivo recortado
Vantagens positivas não podem aumentar sua probabilidade indefinidamente, e vantagens negativas não podem diminuí-la indefinidamente. Um \epsilon pequeno é conservador; um grande permite atualizações mais ousadas. O recorte não é uma restrição de segurança, portanto, os limites de junta, velocidade e força permanecem separados.
Uma implementação Coleta um rollout fixo, normaliza a Vantagem e treina várias épocas de mini-lotes. Salva probabilidades de log antigas, distingue um timeout de um estado terminal verdadeiro e congela as estatísticas de normalização na avaliação. Caso contrário, duas execuções com os mesmos pesos podem se comportar de maneira diferente.
4. SAC: recompensa mais entropia
O Soft Actor-Critic (SAC) adiciona entropia de política \mathcal{H}(\pi) à recompensa futura como um objetivo:
O termo de entropia impede que ações igualmente boas se reduzam a uma só muito cedo, atuando como uma temperatura \alpha que mantém a exploração ativa. O SAC é off-policy e usa um buffer de replay, de modo que cada transição do mundo real pode ser reutilizada. Isso melhora a eficiência da amostra, mas dados desatualizados, escala de recompensa e ajuste de temperatura são importantes.
Para uma ação contínua, o Ator gera a média \mu_\theta(s) e o desvio padrão. \sigma_\theta(s) de uma Gaussiana e, em seguida, mapeá-la para limites com tanh ou outra transformação. A probabilidade logarítmica precisa da correção Jacobiana dessa transformação. Redes Twin Q e a estimativa Q menor reduzem a superestimação. Decida se a implantação usa a média determinística ou retém o ruído de exploração.
5. Escolhendo PPO ou SAC
| Aspecto | PPO | SAC |
|---|---|---|
| Dados | implementações on-policy | replay off-policy |
| Exploração | distribuição de política e bônus de entropia | a entropia faz parte do objetivo |
| Eficiência de amostragem | baixa a média | geralmente maior |
| Principais bugs | probabilidade logarítmica, flags terminais, clipping | superestimação Q, escala de recompensa, correção tanh |
| Ajuste típico | muitos simuladores paralelos | torque contínuo e dados de hardware escassos |
O PPO geralmente é estável quando muitos ambientes simulados podem ser executados em paralelo. O SAC pode ser atraente quando cada transição real é cara. Nenhum dos métodos modela sensores. atraso, zonas mortas do motor ou saturação do atuador automaticamente.
6. Simulação para Realidade é um limite, não um interruptor
A diferença entre simulação e realidade surge da massa e do atrito, folga, exposição e ruído do sensor, atraso da rede, queda de tensão da bateria, material do piso e iluminação. A Randomização de Domínio amostra esses parâmetros para que a política não se ajuste excessivamente a um valor ideal. O intervalo deve ser medido a partir do hardware; randomizar mundos impossíveis apenas torna o treinamento mais difícil.
Uma transferência em etapas é mais segura: (1) simulação pura, (2) reprodução de registros reais do sensor sem movimento, (3) testes de baixa potência com as rodas levantadas, (4) velocidade e força limitadas em um piso livre e (5) a própria tarefa. Registre a ação solicitada separadamente da ação que o limitador de segurança realmente aprovou. Simulação para Realidade é um ciclo iterativo de identificação e avaliação, não um botão de implantação único.
7. Segurança e avaliação
O recorte PPO e a entropia SAC não impedem colisões. Monitores independentes devem verificar a velocidade, Aceleração, ângulo articular, força de contato, pressão hidráulica, corrente e temperatura. Em caso de observação inválida, NaN, timestamp expirado ou perda de comunicação, o monitor deve comandar uma parada segura. Coloque-o em um processo separado ou MCU quando o risco justificar.
Além da recompensa, meça o sucesso, a taxa de colisão, o desvio máximo, a distância de parada, a energia, a suavidade da ação, a latência de inferência e a taxa de intervenção do limitador de segurança. Uma alta taxa de sucesso com intervenção frequente significa que a política depende do limitador. Repita as execuções com várias sementes aleatórias e relate a variância e os piores casos, não apenas a média.
Lista de verificação de implementação
-
Teste as unidades de ação, os limites, a ordenação tanh/clip e as correções de log-probabilidade.
-
Para PPO, salve as probabilidades de log antigas, a vantagem e os indicadores de terminal versus tempo limite.
-
Para SAC, monitore a distribuição de replay, os valores Q gêmeos, a temperatura \alpha e a escala de recompensa.
-
Fixe o pré-processamento, a normalização, as sementes, os pesos e os parâmetros de ambiente por ID do experimento.
-
Mantenha o PID/MPC de baixo nível, os limites de taxa, o watchdog e a parada de emergência independentes do aprendiz.
-
Defina as condições de parada para logs passivos, baixo consumo de energia e operação normal antes de cada transição.
-
Registre sucesso, colisão, intervenção do limitador, latência, energia e desvio máximo em conjunto.
Resumo
Os gradientes de política otimizam diretamente uma distribuição contínua de ações. O Actor-Critic usa Vantagem para reduzir a variância; o PPO limita a atualização; o SAC usa entropia e replay para melhorar a exploração e a eficiência dos dados. Nenhum deles resolve a incerteza ou a segurança do hardware por si só. Um controlador de baixo nível verificado, um monitor independente, transferência em etapas e avaliação do pior caso fazem parte do algoritmo quando uma política aprendida sai da simulação.
O recorte do PPO garante um comportamento seguro?
Ele modera o objetivo de otimização, não as restrições de segurança física. Avalie a estabilidade do treinamento e segurança de ação separadamente.
Comentários
Entre na sua conta para continuar.
Ainda não há dados.