Contents — find the section you need

Em resumo

O aprendizado por reforço baseado em modelo (MBRL) aprende um modelo do mundo real \hat f, que mapeia o estado e a ação para um próximo estado previsto, testa sequências de ações dentro desse modelo e aplica apenas uma ação supervisionada ao hardware. Métodos sem modelo aprendem uma política diretamente a partir da recompensa; o MBRL pode ser mais eficiente em termos de dados e pode expressar restrições, mas erros no modelo podem gerar sucesso apenas no simulador. Veja Fundamentos de RL, Q-learning, PPO/SAC e MPC.

Modelos e planejamento mundiais

Diagram 1 · Use the button to switch views
observationsworld modelMPC/policysafety monitor

Figura 1 — SVG conceitual criado pelo Duskcoil, não são dados medidos do sistema.

Aprenda \hat s_{t+1}=\hat f_\theta(s_t,a_t) e otimize um objetivo de horizonte deslizante:

a_{t:t+H}^*=\arg\max\sum_{k=0}^{H-1}\gamma^k\hat r(\hat s_{t+k},a_{t+k})-\lambda C(\hat s,a)
Apenas a primeira ação é executada e, em seguida, o sistema é observado novamente. As restrições C podem representar limites de colisão, junta, temperatura, velocidade ou corrente. Aqui, s é o estado e a a ação; o modelo prevê o próximo estado e \pi(a|s) pode propor ações. A recompensa aprendida \hat r_\theta(s_t,a_t) é avaliada no instante t ao longo do horizonte H. Um carrinho com massa 1\,\mathrm{kg} e entrada u é usado no exemplo numérico abaixo.

Simulação para Realidade, identificação e segurança

Erros de um passo se acumulam em longos períodos de simulação. Conjuntos podem estimar a incerteza; planejadores podem evitar regiões de alta variância e usar horizontes curtos. A randomização de domínio varia massa, atrito, atraso, ruído do sensor, iluminação e pose da câmera. A identificação do sistema mede inércia, atrito, constantes do motor e latência, de modo que esses intervalos sejam defensáveis em vez de arbitrários.

Passe do registro de dados para o controle de sombra em baixa velocidade e, em seguida, para ensaios supervisionados limitados. Mantenha a parada de emergência, monitores independentes de velocidade/força/temperatura, parada por perda de comunicação e separação humana fora da política aprendida. Falhas comuns incluem: Simulações de atrito fixo causando deslizamento das rodas, sobreajuste de iluminação, manipulação de recompensas que gera vibração e atraso não modelado causando instabilidade. Relatar contagem de violações, distância de parada, abstenção desencadeada por incerteza e comportamento no pior caso — não apenas a recompensa média.

Funções de aprendizado por reforço sem modelo e baseado em modelo

O aprendizado por reforço sem modelo atualiza uma política ou valor diretamente da experiência. É expressivo quando a dinâmica de contato é difícil de modelar, mas cada melhoria pode consumir tentativas reais. O aprendizado por reforço baseado em modelo reutiliza cada transição para treinar um preditor e avalia muitas sequências candidatas nesse preditor. Se o preditor tiver um viés sistemático, o planejador otimiza um atalho exclusivo do simulador.

Aspecto Sem modelo Baseado em modelo
Dados de hardware eficiência baixa a média média a alta dentro do intervalo do modelo
Tempo de execução geralmente inferência de política leve implementações e otimização a cada ciclo
Restrições geralmente uma camada indireta de recompensa/segurança natural para colocar no problema de planejamento
Principal falha ruim Extrapolação a partir de dados esparsos Erro do modelo de longo horizonte
Ajuste típico Políticas complexas de contato e visuais Planejamento de movimento, energia e térmico de curto horizonte

Pilhas híbridas são comuns: uma política aprendida propõe candidatos, um modelo aprendido prevê um horizonte curto e o MPC impõe restrições de velocidade, força e corrente. Use o artigo PPO/SAC e o artigo MPC para atribuir responsabilidades de temporização e segurança, em vez de tratar os algoritmos como substitutos.

Não reduza a incerteza a um único número

A incerteza epistêmica vem da falta de dados de treinamento; a incerteza aleatória vem da variação irredutível do sensor e do ambiente. A variância do conjunto é um sinal útil para a primeira, mas um conjunto ainda pode compartilhar o mesmo viés. Quando a variância preditiva exceder um limite, reduza o horizonte, diminua a velocidade, mude para um controlador clássico ou colete Outra observação antes do planejamento. Esta política de abstenção deve ser especificada antes da implantação.

Para o resíduo de um passo e_t=s_{t+1}-\hat s_{t+1}, quantis logarítmicos e piores casos, além do erro quadrático médio. Um erro médio baixo pode ocultar um erro grande pouco antes do contato. Nunca interprete um intervalo de previsão probabilístico como um certificado de segurança; mantenha monitores independentes de colisão, força, temperatura e corrente.

Projetar experimentos de identificação

A identificação de sistemas é um problema de projeto experimental, não uma simples calibração. Para um motor, meça o atrito estático, a inércia em várias velocidades, o torque dependente da carga e o atraso de ida e volta da comunicação separadamente. Para um atuador hidráulico, registre a pressão, a vazão, a velocidade do cilindro, a temperatura do óleo e o comando da válvula em um único relógio. Divida os dados por dia, andar, carga útil, iluminação e temperatura — não por quadros vizinhos aleatórios — para que o conjunto final seja genuinamente inédito.

Uma pequena intuição numérica

Considere um carrinho de 1 kg cuja velocidade muda em 0.1u a cada T_s=0.1\,\mathrm{s} . Um modelo sem atrito prevê um aumento de velocidade de 0.5\,\mathrm{m/s} para u=1 ao longo de cinco etapas. Se o carrinho real perder 0.02\,\mathrm{m/s} por etapa devido ao atrito, o erro de cinco etapas atinge 0.1\,\mathrm{m/s} . Um horizonte mais curto, identificação online, margem na restrição de velocidade e replanejamento a partir da medição mantêm este modelo simples útil.

Evidências para publicação

Junto com as equações, mantenha o período de treinamento, a taxa do sensor, o atraso, a semente aleatória, os parâmetros do ambiente, o prazo do solucionador e a política de fallback. Plote os resíduos da previsão, as violações de restrição, a distância de parada e a abstenção desencadeada pela incerteza, usando o mesmo ID do experimento que a recompensa. Se os registros brutos não puderem ser compartilhados, publique estatísticas anonimizadas, configurações da simulação, unidades e uma data de referência para que o escopo da alegação permaneça verificável.

Verifique seu
Um modelo aprendido garante implantações longas confiáveis?

Pequenos erros do modelo se acumulam nas previsões. Verifique a duração da implantação, estados desconhecidos e a validação no ambiente real.

Referências

Tipos de modelos de mundo e planejadores

Modelos físicos são interpretáveis, mas podem apresentar dificuldades com contato; modelos latentes e de conjunto podem ser eficientes, mas exigem validação em relação à segurança no espaço real. As ações candidatas podem usar disparo, CEM ou MPC diferenciável, com um fallback de prazo.

Higiene do conjunto de dados

Marque sensores saturados, erros de tempo, intervenções de limitadores, valores interpolados, e causas terminais. Mantenha o conjunto de avaliação imutável para que uma atualização do modelo não possa ocultar uma regressão.

Limites de evidência

A precisão da previsão, a recompensa e o comportamento seguro do hardware são reivindicações separadas. Publique a métrica, a condição de teste e a camada de segurança responsável por cada uma delas.

What to read next

Review the backgroundGuia Básico de Design de Recompensas — Por que "O que Maximizar" é a Parte Mais Difícil do Aprendizado por RecompensaContinue the seriesIntrodução à aprendizagem por reforço: aprendizagem por imitação e aprendizagem por reforço inversa.Explore another aspect of this fieldIntrodução à Aprendizagem por Reforço Multiagente — Otimizando em um Mundo Onde o Outro Lado Também Está Aprendendo