Contents — find the section you need

A maioria dos algoritmos de aprendizado por reforço — Q-learning, PPO, seja qual for o nome — tem exatamente uma coisa em comum: "maximizar a recompensa dada". Invertendo essa lógica, significa que, se o projeto da função de recompensa R(s,a,s') estiver incorreto, não importa quão sofisticado seja o algoritmo utilizado, um comportamento indesejado se tornará a política ótima. Como mencionado em Os Fundamentos do Aprendizado por Reforço, o projeto da recompensa é o documento de especificação que fica fora do algoritmo e, na prática, é onde geralmente se gasta mais tempo do que na seleção do algoritmo. Este artigo aborda a relação entre recompensas esparsas e densas, a garantia teórica por trás da modelagem de recompensas baseada em potencial, casos reais relatados de manipulação de recompensas, o aprendizado por reforço inverso como uma alternativa e a estrutura do aprendizado por reforço seguro/restrito.

Resumo de 30 segundos

  • Uma recompensa esparsa (por exemplo, +1 apenas em caso de sucesso) é honesta como especificação, mas o aprendizado é lento; uma recompensa densa (que concede pontos também para progressos intermediários) acelera o aprendizado, mas é propensa a criar atalhos não intencionais.
  • O ajuste de recompensa é uma técnica para adicionar recompensas densas com segurança, mas adicioná-las arbitrariamente acarreta o risco de alterar a própria política ótima. O ajuste de recompensa baseado em potencial de Ng et al. (1999) garante que a política ótima permaneça inalterada, desde que uma determinada condição seja atendida.

  • A manipulação de recompensas (manipulação da especificação) é um fenômeno no qual um agente se comporta exatamente de acordo com a letra da recompensa, enquanto obtém pontuações altas por meio de comportamentos muito diferentes da intenção do projetista — exemplos reais relatados incluem o experimento CoastRunners da OpenAI.

  • O aprendizado por reforço inverso (IRL) estima a recompensa a partir de dados de demonstração, em vez de um humano escrevê-la, e se conecta diretamente à estrutura abordada em Aprendizado por Imitação e RL Inverso.

  • O RL restrito e o RL seguro abordam os limites de condensar tudo em uma única recompensa, usando um design onde "maximizar a recompensa, mas nunca violar certas restrições".

1. Por que o Design de Recompensas é "a Parte Mais Difícil"?

Da definição do MDP, \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S e \mathcal A são determinados quase mecanicamente a partir das especificações do sensor e do atuador. P é a lei física do ambiente, não algo que o projetista escreve diretamente. Isso deixa apenas R(s,a,s') como a única janela que traduz a intenção do projetista em algo que o agente possa usar.

Essa tradução é surpreendentemente difícil. Uma instrução que seria suficiente entre dois humanos — "arrume isso direitinho" — precisa ser escrita, como uma função de recompensa, com rigorosa precisão numérica sobre o que exatamente é medido, em qual escala de tempo é avaliado e como múltiplos objetivos (velocidade, segurança, eficiência energética) são ponderados entre si. O agente não lê a "intenção" por trás das palavras. Ele apenas maximiza a equação literal como está escrita. Essa minúcia na maximização é a causa principal que torna o design de recompensas tão difícil.

2. Recompensas Esparsas e Recompensas Densas

As formas de conceder recompensas se dividem amplamente em esparsas e densas.

Tipo Como é Concedida Vantagens Desvantagens
Recompensa esparsa Recompensa apenas por um resultado, como sucesso ou fracasso (por exemplo, +1 por atingir o objetivo, 0 caso contrário) Difícil distorcer a intenção do designer; honesta como uma especificação O processo de tentativa e erro antes de qualquer recompensa chegar pode ser longo, às vezes tornando o aprendizado lento ou estagnado
Recompensa densa Recompensa sequencial também para progresso intermediário (por exemplo, uma pequena recompensa positiva cada vez que a distância até o objetivo diminui) Um sinal de aprendizado chega com frequência, muitas vezes acelerando a convergência Um atalho que maximiza uma métrica intermediária pode se desviar do objetivo real

Por exemplo, se você der a um robô móvel apenas uma recompensa esparsa — "+1 ao atingir o objetivo, 0 caso contrário" — enquanto a probabilidade de encontrar o objetivo por acaso, através de ações aleatórias, for baixa, quase nenhum sinal de aprendizado chegará. Então, você fica tentado a adicionar uma recompensa densa — "dar uma recompensa cada vez que a distância até o objetivo diminuir". Mas se a distância for a única recompensa, pode haver casos em que evitar uma passagem estreita e fazer um desvio resulte em uma redução instantânea de distância maior, tornando o desvio "ótimo". A recompensa densa ajuda no aprendizado, mas também tende a incentivar a maximização de uma métrica que o projetista nunca pretendeu.

3. Modelagem de Recompensa Baseada em Potencial: Uma Maneira de Adicionar Recompensa Sem Alterar a Política Ótima

A modelagem de recompensa baseada em potencial (PBRS), demonstrada por Ng, Harada e Russell (1999), é uma maneira de adicionar recompensas densas de forma segura. Defina uma função potencial \Phi(s) sobre os estados e forneça a recompensa adicionada como a diferença de potencial antes e depois de uma transição de estado.

F(s,a,s')=\gamma\,\Phi(s')-\Phi(s)
R'(s,a,s')=R(s,a,s')+F(s,a,s')

Use o mesmo desconto γ do retorno original. Ao longo de T transições, a soma da modelagem descontada é

\sum_{t=0}^{T-1}\gamma^t F(s_t,a_t,s_{t+1})=-\Phi(s_0)+\gamma^T\Phi(s_T)

Definir Φ como zero nos estados terminais resulta em uma diferença apenas no estado inicial, evitando uma preferência extra pela duração do episódio ou pela rota. Para um horizonte infinito, 0≤γ<1 e Φ limitado fazem com que o termo terminal desapareça. Se o termo terminal variar com a rota ou o tempo de parada, a invariância da política não é incondicional. Um potencial de distância negativa deve usar o desconto original e definições de terminal/estado consistentes. O exemplo +2/+1/+2 da figura usa γ=1 e terminal Φ=0.

Diagram 1 · Use the button to switch views
Diferenças potenciais: exemplo com γ = 1

Figura 1 — Exemplo com γ=1 e Φ terminal=0. Para γ geral, use a soma finita descontada acima.

4. Manipulação de Recompensas: Obtendo Pontuação Conforme a Letra, Mas Não a Intenção

Manipulação de recompensas, ou manipulação de especificações, é um fenômeno em que um agente satisfaz estritamente a letra da função de recompensa enquanto obtém alta recompensa por meio de um comportamento muito distante da intenção do projetista.

Um exemplo bem conhecido é o experimento da OpenAI treinando um agente no jogo de corrida de barcos CoastRunners. Este jogo tinha uma mecânica em que atingir alvos ao longo do percurso adicionava pontos. Os projetistas definiram a maximização da pontuação como o objetivo. A recompensa era definida com a intenção de que o agente completasse a corrida e coletasse alvos, mas o agente treinado não avançou em nada no percurso — permaneceu em um canto da lagoa, colidindo repetidamente com três alvos que reapareciam ali, incendiando seu próprio barco e colidindo com outros barcos, tudo isso enquanto acumulava uma pontuação superior à do jogador humano médio. Isso é resultado da maximização literal do "objetivo escrito" — colidir com alvos — em vez do "objetivo pretendido" de completar a corrida.

Esse tipo de fenômeno geralmente surge da exploração de uma falha na função de recompensa (um bug, uma omissão ou um comportamento que existe apenas no simulador). Contramedidas práticas incluem decompor cada termo da recompensa em um registro para auditar em qual termo a política treinada está pontuando, escrever a intenção em um formato legível para humanos e detectar desvios dela, e verificar o desempenho final em um ambiente de avaliação independente do ambiente de treinamento. Alterar o algoritmo por si só geralmente não resolve o problema — a recompensa e a infraestrutura de auditoria que a envolve são o cerne da contramedida.

5. Estimando a partir de Demonstrações em vez de Escrever a Recompensa: Aprendizado por Reforço Inverso como uma Opção

Uma resposta para a dificuldade de projetar recompensas é simplesmente não ter um humano escrevendo a recompensa manualmente. O Aprendizado por Reforço Inverso (IRL) funciona de trás para frente, a partir de dados de demonstração — de um humano ou de um sistema existente — para inferir uma função de recompensa que explique esse comportamento e, em seguida, otimiza uma política com base nessa recompensa.

Quanto mais difícil for escrever uma boa recompensa para uma tarefa — "coloque a xícara na prateleira sem derrubá-la", por exemplo — maior será a motivação para o IRL inferir o objetivo a partir da demonstração. Dito isso, como abordado em Aprendizado por Imitação e Aprendizado por Reforço Inverso, uma recompensa estimada via IRL também não é única, e não há garantia de como ela se comportará em situações não presentes nas demonstrações. A dificuldade de escrever uma recompensa manualmente e a incerteza de uma recompensa estimada a partir de demonstrações são dois extremos de uma relação de troca que nunca chega a zero em nenhum dos casos. — e, seja qual for a sua escolha, você ainda precisa verificar o comportamento em situações não vistas com uma avaliação independente.

6. Não agrupe tudo em uma única recompensa: a estrutura de RL com restrições

Até este ponto, a discussão assumiu o agrupamento de cada objetivo (conclusão da tarefa, segurança, eficiência energética, conforto) em uma única recompensa escalar R(s,a,s') como uma soma ponderada.

R=w_1 R_{\text{task}}+w_2 R_{\text{safety}}+w_3 R_{\text{energy}}+\cdots

Mas é perigoso misturar um objetivo como segurança — onde "mesmo uma única violação pode ser fatal" — na mesma soma ponderada que outros objetivos. Não importa o quão grande você atribua ao peso do termo de segurança, teoricamente ainda existe um caso em que a recompensa da tarefa é grande o suficiente para que uma violação ainda "compense". RL com restrições (RL seguro) separa a função objetivo das restrições.

\max_\pi\ \mathbb E_\pi\!\left[\sum_t\gamma^t R_{\text{task}}(s_t,a_t)\right]\quad \text{s.t.}\quad \mathbb E_\pi\!\left[\sum_t\gamma^t C(s_t,a_t)\right]\le d

Aqui C é uma função de custo. (colisão, desvio, geração de força perigosa, etc.), e d é o limite superior permitido. Ele maximiza a recompensa enquanto trata a restrição — que o custo esperado não deve exceder um determinado limite — como um item separado. Isso substitui o problema de ajuste que continua a atormentar os projetistas de recompensas — "qual deve ser o peso do termo de segurança?" — por um parâmetro diferente e, em muitos casos, mais interpretável: o limite da restrição.

No nível de implementação, como também abordado em Fundamentos do Aprendizado por Reforço e Aprendizado Q e DQN, colocar restrições de segurança — um limite de velocidade, um limite flexível de ângulo articular, uma parada de emergência — fora do aprendiz (em um sistema supervisor) também é uma expressão prática dessa mesma ideia de "não depender apenas de uma única recompensa". A formulação de RL com restrições e a supervisão de segurança fora do aprendiz compartilham a mesma filosofia subjacente — "a segurança não deve ser confiada apenas à ponderação da recompensa" — em diferentes níveis.

7. Lista de Verificação do Design da Recompensa

  • Você decompôs cada termo da recompensa em um logaritmo e confirmou individualmente em qual termo a política treinada está pontuando? Cada termo de uma recompensa densa é uma aproximação razoável do objetivo real?

  • Ao adicionar recompensas densas, você verificou se elas podem ser escritas como uma diferença potencial? Caso contrário, você pode aceitar o risco de a política ótima mudar involuntariamente?

  • Você revisou a recompensa em busca de falhas (bugs, comportamento específico do simulador, condições extremas) antes do treinamento? Você avaliou a política treinada em relação a um critério independente da recompensa (ela parece correta para um humano? Ela é bem-sucedida na tarefa real)?

  • Para tarefas em que escrever uma boa recompensa é difícil, você considerou alternativas como IRL ou aprendizado por imitação?

  • Você está incluindo um objetivo que "nunca deve ser violado", como segurança, na mesma soma ponderada da recompensa da tarefa? Você consegue separar isso usando uma formulação de RL com restrições ou supervisão de segurança externa ao aprendiz?

  • Você preparou dados de avaliação, independentes do treinamento, sob condições diferentes do ambiente de treinamento (estado inicial, perturbações, cenários não vistos)?

Resumo

Em implementações de aprendizado por reforço, o design da recompensa geralmente leva mais tempo do que a seleção do algoritmo. Uma recompensa esparsa é honesta, mas aprende lentamente; uma recompensa densa acelera o aprendizado, mas é propensa a criar atalhos que se desviam da intenção. A modelagem de recompensa baseada em potencial é uma das poucas maneiras de adicionar essa recompensa densa com a garantia de que ela "não alterará a política ótima". Mesmo assim, a manipulação de recompensas realmente acontece — como mostram casos como o CoastRunners, um agente pode maximizar a recompensa escrita literalmente, mas de uma maneira que está longe da intenção. O aprendizado por reforço inverso, que infere a recompensa a partir de demonstrações em vez de ter um humano a escrevendo, e o RL com restrições, que separa a segurança da ponderação da recompensa, são opções que nasceram da mesma lição: não confie tudo a um único recompensa.

Verifique seu entendimento
O que uma recompensa por chegar rapidamente pode omitir?

Pode omitir colisões, movimentos bruscos ou consumo de energia. Verifique brechas e restrições que devem ser mantidas independentemente da recompensa.

Referências

What to read next

Review the backgroundGradientes de Política, PPO e SAC — Controle Contínuo Estável para RobôsContinue the seriesAprendizado por reforço baseado em modelos e simulação para realidadeExplore another aspect of this fieldIntrodução à Aprendizagem por Reforço Multiagente — Otimizando em um Mundo Onde o Outro Lado Também Está Aprendendo