Contents — find the section you need
A Regulação Quadrática Linear (LQR) atribui um custo ao desvio de estado e ao uso de um atuador, derivando então a lei de realimentação de estado que minimiza esse custo para um modelo linear. Ao contrário do PID, que reage diretamente ao erro presente, seu histórico e sua taxa, a LQR pode usar posição, velocidade, ângulo, taxa angular, corrente e eixos acoplados como um único estado. Isso é especialmente útil para a estabilização local de um pêndulo invertido, atitude de aeronaves, robôs de equilíbrio ou braços robóticos.
A LQR não é uma solução mágica para otimização. Se o estado necessário não for medido, um observador é necessário; se a planta sair do intervalo de um modelo linear local, o ganho perde sua eficácia; e se as restrições de entrada ou estado forem cruciais, o MPC (Controle Preditivo por Modelo) geralmente é a melhor opção. Para obter informações sobre os limites de execução do ROS 2, consulte ROS 2 Primer. Para as hipóteses de estimação, consulte Introdução à Fusão de Sensores.
Conclusão prática
-
A partir de \dot{x}=Ax+Bu e pesos Q,R, o LQR de horizonte infinito produz u=-Kx. Q expressa a intensidade com que o erro de estado é penalizado; R expressa o custo do comando.
-
O ganho K vem de uma equação de Riccati e sua solução P: K=R^{-1}B^TP. Ele leva em conta o acoplamento modelado em vez de ajustar manualmente um ganho por estado.
-
A estabilizabilidade de (A,B) e a detectabilidade/observabilidade de (A,C) são pré-requisitos. Ter um sensor não é o mesmo que ser capaz de reconstruir o estado necessário.
- O próprio LQR não impõe limites de atuador, folga de colisão ou parada de emergência. Esses pertencem a limites e funções de segurança fora do ganho.
Espaço de estados e fluxo de sinal
Um estado x é o menor conjunto de variáveis que, juntamente com a entrada e a perturbação, determina o comportamento futuro. Um carrinho precisa de posição e velocidade; um corpo giratório precisa de ângulo e velocidade angular; um acionamento eletromecânico pode adicionar corrente. Um modelo linear invariante no tempo é
onde u é o comando, w perturbação não modelada, y medição e v ruído do sensor. A descreve a evolução do estado, B o caminho de entrada e C o que os sensores revelam.
No diagrama, a junção de soma forma e=\hat{x}-x_r (estado estimado menos referência), e as saídas LQR u=-Ke. Para uma referência zero, isso se reduz ao usual u=-K\hat{x}.
Diagrama: Duskcoil, conceitual em vez de medido. Uma implementação real também possui calibração, carimbos de data/hora, atraso de transporte e atuador laços internos.
Em torno de um equilíbrio (x_e,u_e), defina os desvios \tilde{x}=x-x_e e \tilde{u}=u-u_e, e então projete em \dot{\tilde{x}}=A\tilde{x}+B\tilde{u}. Esta é uma afirmação local. Um ganho que estabiliza um pêndulo vertical próximo ao ângulo zero não é necessariamente um controlador de recuperação para um pêndulo que caiu muito ou para um sistema cujo atuador está saturado.
Equação de Riccati e custo
O LQR contínuo de horizonte infinito minimiza
com Q\succeq0 e R\succ0. Um Q maior torna o erro de estado dispendioso; um R maior torna o esforço dispendioso. Não adicione metros, radianos, metros por segundo e amperes sem Escalonamento. Um ponto de partida útil são os pesos diagonais baseados em valores permitidos x_{max} e u_{max}, como 1/x_{max}^2 e 1/u_{max}^2.
A equação algébrica contínua de Riccati é
e sua solução estabilizadora P fornece
Isso fornece o ganho de realimentação K usado pelo controlador.
Sistemas amostrados precisam de um modelo discretizado e uma equação de Riccati discreta. Problemas contínuos de horizonte finito usam uma equação diferencial de Riccati; problemas discretos de horizonte finito usam uma equação de diferenças; problemas discretos de horizonte infinito usam a equação de Riccati diferencial (DARE). As matrizes do modelo contínuo são A,B e o modelo discreto é x_{k+1}=A_dx_k+B_du_k. Aplicar um ganho contínuo como se fosse um controlador discreto, misturar graus com radianos ou ignorar a latência pode transformar um cálculo correto em um dispositivo instável.
Controlabilidade e observabilidade: verifique as condições antes do ganho
A matriz de controlabilidade é
Para um sistema de n estados, a condição de posto completo é \operatorname{rank}\mathcal{C}=n.
Posto completo significa que todos os modos são controláveis; o LQR exige que (A,B) seja estabilizável e (Q^{1/2},A) seja detectável para a solução estabilizadora padrão. Isso é diferente da observabilidade do par de sensores (C,A). A matriz de observabilidade é
Exemplo numérico: estabilizando um integrador duplo
Para um integrador duplo normalizado com x=[p\ v]^T e comando de aceleração u,
Usar Q=\operatorname{diag}(q_p,q_v) resulta em u=-k_pp-k_vv. Ele se assemelha ao PD, mas ambos os ganhos são selecionados conjuntamente a partir do modelo e de Q,R. Tornar q_p grande enquanto q_v é pequeno resulta em aceleração e frenagem bruscas; tornar R muito pequeno resulta em aceleração e frenagem bruscas. O uso do atuador é praticamente gratuito. O ganho resultante é K=[k_p\ k_v], com k_p,k_v selecionados em conjunto. Os limites físicos |u|\le u_{max} e |\Delta u|\le r_{max} ainda são necessários. Se o recorte for frequente, a modelagem de referência, o redesenho ou o MPC restrito são mais adequados do que chamar o resultado recortado de LQR irrestrito.
Para o integrador duplo contínuo com Q=I e R=1, a mesma derivação fornece K=[1\ \sqrt{3}]\simeq[1\ 1.732]. Este é um exemplo normalizado, não um ganho para copiar para o hardware: recalcule-o com o modelo amostrado, a massa, os limites do atuador e o atraso do sistema real.
Escolhendo entre PID, LQR e MPC
| Método | Ajuste forte | Entradas | Tratamento de restrições | Principal precaução |
|---|---|---|---|---|
| PID | regulação rápida de malha única | erro/histórico/taxa | limitador externo | saturação e ruído |
| LQR | estabilização linear local multiestado | estado estimado | não explícito por si só | faixa do modelo e saturação |
| MPC | predição multivariável com limites | estado, modelo, referência | restrições de otimização explícitas | prazo e viabilidade |
Projetos aninhados são comuns: malhas PID de corrente/velocidade, estabilização local de atitude ou posição LQR e MPC para trajetória ou restrições. Para rastreamento em vez de regulação fixa, use uma referência variável no tempo, feedforward, ganho programado ou LTV-LQR.
Implementação e segurança do robô
Encoders, IMUs, câmeras e LiDAR publicam em taxas e atrasos diferentes. Não passe mensagens ordenadas por chegada diretamente como um estado. Passe uma estimativa alinhada ao timestamp, confiança/covariância e status de validade. O ciclo de vida e as interfaces de hardware do ROS 2 são descritos em ROS 2 Primer são limites de projeto, não apenas organização de software.
IMU/INS representativaImagem: Xsens MTi-G (Kallap85, CC BY-SA 4.0), Wikimedia Commons. É uma imagem representativa do sensor, não um sistema LQR medido ou recomendação de produto.
Monitore o crescimento da covariância do estimador, o tempo limite do sensor, a inconsistência entre o encoder e a IMU, a saturação sustentada e as ultrapassagens do prazo. Se o estado não for mais confiável, não continue emitindo -K\hat{x}. Selecione uma transição específica do sistema — redução gradual da velocidade para zero, desativação do torque, freio mecânico ou parada de emergência — com base na inércia, gravidade e proximidade humana. As afirmações de estabilidade do LQR pressupõem um modelo correto, estado correto e entrada não saturada; proteções independentes devem cobrir as suposições fora dessa comprovação.
Lista de verificação de implementação
-
Corrija o equilíbrio, as unidades, os sinais, os referenciais e o período discreto.
-
Meça os resíduos do modelo próximos ao ponto de linearização e defina um envelope operacional.
-
Verifique numericamente a controlabilidade e a observabilidade/detectabilidade.
-
Normalize Q,R a partir do estado e comando permitidos; registre cada alteração.
-
Monitore a saturação, os limites de taxa, estime a frescura e a parada independente fora do LQR.
-
Teste o atraso, o atrito, a mudança de carga útil e a perda do sensor em baixa saída antes de expandir o envelope.
Referências
O que uma penalidade de entrada maior incentiva?
Incentiva a conservação do esforço de controle. Verifique a compensação da resposta e dimensione as variáveis de estado com unidades diferentes adequadamente.
Comentários
Entre na sua conta para continuar.
Ainda não há dados.