Contents — find the section you need
Em resumo
O aprendizado por reforço baseado em modelo (MBRL) aprende um modelo do mundo real \hat f, que mapeia o estado e a ação para um próximo estado previsto, testa sequências de ações dentro desse modelo e aplica apenas uma ação supervisionada ao hardware. Métodos sem modelo aprendem uma política diretamente a partir da recompensa; o MBRL pode ser mais eficiente em termos de dados e pode expressar restrições, mas erros no modelo podem gerar sucesso apenas no simulador. Veja Fundamentos de RL, Q-learning, PPO/SAC e MPC.
Modelos e planejamento mundiais
Figura 1 — SVG conceitual criado pelo Duskcoil, não são dados medidos do sistema.
Aprenda \hat s_{t+1}=\hat f_\theta(s_t,a_t) e otimize um objetivo de horizonte deslizante:
Simulação para Realidade, identificação e segurança
Erros de um passo se acumulam em longos períodos de simulação. Conjuntos podem estimar a incerteza; planejadores podem evitar regiões de alta variância e usar horizontes curtos. A randomização de domínio varia massa, atrito, atraso, ruído do sensor, iluminação e pose da câmera. A identificação do sistema mede inércia, atrito, constantes do motor e latência, de modo que esses intervalos sejam defensáveis em vez de arbitrários.
Passe do registro de dados para o controle de sombra em baixa velocidade e, em seguida, para ensaios supervisionados limitados. Mantenha a parada de emergência, monitores independentes de velocidade/força/temperatura, parada por perda de comunicação e separação humana fora da política aprendida. Falhas comuns incluem: Simulações de atrito fixo causando deslizamento das rodas, sobreajuste de iluminação, manipulação de recompensas que gera vibração e atraso não modelado causando instabilidade. Relatar contagem de violações, distância de parada, abstenção desencadeada por incerteza e comportamento no pior caso — não apenas a recompensa média.
Funções de aprendizado por reforço sem modelo e baseado em modelo
O aprendizado por reforço sem modelo atualiza uma política ou valor diretamente da experiência. É expressivo quando a dinâmica de contato é difícil de modelar, mas cada melhoria pode consumir tentativas reais. O aprendizado por reforço baseado em modelo reutiliza cada transição para treinar um preditor e avalia muitas sequências candidatas nesse preditor. Se o preditor tiver um viés sistemático, o planejador otimiza um atalho exclusivo do simulador.
| Aspecto | Sem modelo | Baseado em modelo |
|---|---|---|
| Dados de hardware | eficiência baixa a média | média a alta dentro do intervalo do modelo |
| Tempo de execução | geralmente inferência de política leve | implementações e otimização a cada ciclo |
| Restrições | geralmente uma camada indireta de recompensa/segurança | natural para colocar no problema de planejamento |
| Principal falha | ruim Extrapolação a partir de dados esparsos | Erro do modelo de longo horizonte |
| Ajuste típico | Políticas complexas de contato e visuais | Planejamento de movimento, energia e térmico de curto horizonte |
Pilhas híbridas são comuns: uma política aprendida propõe candidatos, um modelo aprendido prevê um horizonte curto e o MPC impõe restrições de velocidade, força e corrente. Use o artigo PPO/SAC e o artigo MPC para atribuir responsabilidades de temporização e segurança, em vez de tratar os algoritmos como substitutos.
Não reduza a incerteza a um único número
A incerteza epistêmica vem da falta de dados de treinamento; a incerteza aleatória vem da variação irredutível do sensor e do ambiente. A variância do conjunto é um sinal útil para a primeira, mas um conjunto ainda pode compartilhar o mesmo viés. Quando a variância preditiva exceder um limite, reduza o horizonte, diminua a velocidade, mude para um controlador clássico ou colete Outra observação antes do planejamento. Esta política de abstenção deve ser especificada antes da implantação.
Para o resíduo de um passo e_t=s_{t+1}-\hat s_{t+1}, quantis logarítmicos e piores casos, além do erro quadrático médio. Um erro médio baixo pode ocultar um erro grande pouco antes do contato. Nunca interprete um intervalo de previsão probabilístico como um certificado de segurança; mantenha monitores independentes de colisão, força, temperatura e corrente.
Projetar experimentos de identificação
A identificação de sistemas é um problema de projeto experimental, não uma simples calibração. Para um motor, meça o atrito estático, a inércia em várias velocidades, o torque dependente da carga e o atraso de ida e volta da comunicação separadamente. Para um atuador hidráulico, registre a pressão, a vazão, a velocidade do cilindro, a temperatura do óleo e o comando da válvula em um único relógio. Divida os dados por dia, andar, carga útil, iluminação e temperatura — não por quadros vizinhos aleatórios — para que o conjunto final seja genuinamente inédito.
Uma pequena intuição numérica
Considere um carrinho de 1 kg cuja velocidade muda em 0.1u a cada T_s=0.1\,\mathrm{s} . Um modelo sem atrito prevê um aumento de velocidade de 0.5\,\mathrm{m/s} para u=1 ao longo de cinco etapas. Se o carrinho real perder 0.02\,\mathrm{m/s} por etapa devido ao atrito, o erro de cinco etapas atinge 0.1\,\mathrm{m/s} . Um horizonte mais curto, identificação online, margem na restrição de velocidade e replanejamento a partir da medição mantêm este modelo simples útil.
Evidências para publicação
Junto com as equações, mantenha o período de treinamento, a taxa do sensor, o atraso, a semente aleatória, os parâmetros do ambiente, o prazo do solucionador e a política de fallback. Plote os resíduos da previsão, as violações de restrição, a distância de parada e a abstenção desencadeada pela incerteza, usando o mesmo ID do experimento que a recompensa. Se os registros brutos não puderem ser compartilhados, publique estatísticas anonimizadas, configurações da simulação, unidades e uma data de referência para que o escopo da alegação permaneça verificável.
Pequenos erros do modelo se acumulam nas previsões. Verifique a duração da implantação, estados desconhecidos e a validação no ambiente real.
Referências
Tipos de modelos de mundo e planejadores
Modelos físicos são interpretáveis, mas podem apresentar dificuldades com contato; modelos latentes e de conjunto podem ser eficientes, mas exigem validação em relação à segurança no espaço real. As ações candidatas podem usar disparo, CEM ou MPC diferenciável, com um fallback de prazo.
Higiene do conjunto de dados
Marque sensores saturados, erros de tempo, intervenções de limitadores, valores interpolados, e causas terminais. Mantenha o conjunto de avaliação imutável para que uma atualização do modelo não possa ocultar uma regressão.
Limites de evidência
A precisão da previsão, a recompensa e o comportamento seguro do hardware são reivindicações separadas. Publique a métrica, a condição de teste e a camada de segurança responsável por cada uma delas.
Comentários
Entre na sua conta para continuar.
Ainda não há dados.