Contents — find the section you need

A Regulação Quadrática Linear (LQR) atribui um custo ao desvio de estado e ao uso de um atuador, derivando então a lei de realimentação de estado que minimiza esse custo para um modelo linear. Ao contrário do PID, que reage diretamente ao erro presente, seu histórico e sua taxa, a LQR pode usar posição, velocidade, ângulo, taxa angular, corrente e eixos acoplados como um único estado. Isso é especialmente útil para a estabilização local de um pêndulo invertido, atitude de aeronaves, robôs de equilíbrio ou braços robóticos.

A LQR não é uma solução mágica para otimização. Se o estado necessário não for medido, um observador é necessário; se a planta sair do intervalo de um modelo linear local, o ganho perde sua eficácia; e se as restrições de entrada ou estado forem cruciais, o MPC (Controle Preditivo por Modelo) geralmente é a melhor opção. Para obter informações sobre os limites de execução do ROS 2, consulte ROS 2 Primer. Para as hipóteses de estimação, consulte Introdução à Fusão de Sensores.

Conclusão prática

  • A partir de \dot{x}=Ax+Bu e pesos Q,R, o LQR de horizonte infinito produz u=-Kx. Q expressa a intensidade com que o erro de estado é penalizado; R expressa o custo do comando.

  • O ganho K vem de uma equação de Riccati e sua solução P: K=R^{-1}B^TP. Ele leva em conta o acoplamento modelado em vez de ajustar manualmente um ganho por estado.

  • A estabilizabilidade de (A,B) e a detectabilidade/observabilidade de (A,C) são pré-requisitos. Ter um sensor não é o mesmo que ser capaz de reconstruir o estado necessário.

  • O próprio LQR não impõe limites de atuador, folga de colisão ou parada de emergência. Esses pertencem a limites e funções de segurança fora do ganho.

Espaço de estados e fluxo de sinal

Um estado x é o menor conjunto de variáveis que, juntamente com a entrada e a perturbação, determina o comportamento futuro. Um carrinho precisa de posição e velocidade; um corpo giratório precisa de ângulo e velocidade angular; um acionamento eletromecânico pode adicionar corrente. Um modelo linear invariante no tempo é

\dot{x}=Ax+Bu+Ew,\qquad y=Cx+Du+v

onde u é o comando, w perturbação não modelada, y medição e v ruído do sensor. A descreve a evolução do estado, B o caminho de entrada e C o que os sensores revelam.

No diagrama, a junção de soma forma e=\hat{x}-x_r (estado estimado menos referência), e as saídas LQR u=-Ke. Para uma referência zero, isso se reduz ao usual u=-K\hat{x}.

Diagram 1 · Use the button to switch views
LQR state-feedback structureA reference state and estimated state are compared, an LQR gain makes a command, the plant and sensor feed a state estimator.reference xᵣequilibrium / pathΣLQR −Kweights Q, Rplant A, Bactuatorsensor Cy + noisestate estimatorx̂, validity, time

Diagrama: Duskcoil, conceitual em vez de medido. Uma implementação real também possui calibração, carimbos de data/hora, atraso de transporte e atuador laços internos.

Em torno de um equilíbrio (x_e,u_e), defina os desvios \tilde{x}=x-x_e e \tilde{u}=u-u_e, e então projete em \dot{\tilde{x}}=A\tilde{x}+B\tilde{u}. Esta é uma afirmação local. Um ganho que estabiliza um pêndulo vertical próximo ao ângulo zero não é necessariamente um controlador de recuperação para um pêndulo que caiu muito ou para um sistema cujo atuador está saturado.

Equação de Riccati e custo

O LQR contínuo de horizonte infinito minimiza

J=\int_0^\infty\left(x^TQx+u^TRu\right)dt

com Q\succeq0 e R\succ0. Um Q maior torna o erro de estado dispendioso; um R maior torna o esforço dispendioso. Não adicione metros, radianos, metros por segundo e amperes sem Escalonamento. Um ponto de partida útil são os pesos diagonais baseados em valores permitidos x_{max} e u_{max}, como 1/x_{max}^2 e 1/u_{max}^2.

A equação algébrica contínua de Riccati é

A^TP+PA-PBR^{-1}B^TP+Q=0

e sua solução estabilizadora P fornece

K=R^{-1}B^TP,\qquad u=-Kx

Isso fornece o ganho de realimentação K usado pelo controlador.

Sistemas amostrados precisam de um modelo discretizado e uma equação de Riccati discreta. Problemas contínuos de horizonte finito usam uma equação diferencial de Riccati; problemas discretos de horizonte finito usam uma equação de diferenças; problemas discretos de horizonte infinito usam a equação de Riccati diferencial (DARE). As matrizes do modelo contínuo são A,B e o modelo discreto é x_{k+1}=A_dx_k+B_du_k. Aplicar um ganho contínuo como se fosse um controlador discreto, misturar graus com radianos ou ignorar a latência pode transformar um cálculo correto em um dispositivo instável.

Controlabilidade e observabilidade: verifique as condições antes do ganho

A matriz de controlabilidade é

\mathcal{C}=[B\ AB\ A^2B\ \cdots\ A^{n-1}B]

Para um sistema de n estados, a condição de posto completo é \operatorname{rank}\mathcal{C}=n.

Posto completo significa que todos os modos são controláveis; o LQR exige que (A,B) seja estabilizável e (Q^{1/2},A) seja detectável para a solução estabilizadora padrão. Isso é diferente da observabilidade do par de sensores (C,A). A matriz de observabilidade é

\mathcal{O}=\begin{bmatrix}C\\CA\\\vdots\\CA^{n-1}\end{bmatrix}
A classificação completa significa que o estado pode ser reconstruído a partir do histórico de saída. Consulte Kalman Filter Primer para obter informações sobre o estimador que normalmente é usado em conjunto com o LQR.

Exemplo numérico: estabilizando um integrador duplo

Para um integrador duplo normalizado com x=[p\ v]^T e comando de aceleração u,

A=\begin{bmatrix}0&1\\0&0\end{bmatrix},\quad B=\begin{bmatrix}0\\1\end{bmatrix}

Usar Q=\operatorname{diag}(q_p,q_v) resulta em u=-k_pp-k_vv. Ele se assemelha ao PD, mas ambos os ganhos são selecionados conjuntamente a partir do modelo e de Q,R. Tornar q_p grande enquanto q_v é pequeno resulta em aceleração e frenagem bruscas; tornar R muito pequeno resulta em aceleração e frenagem bruscas. O uso do atuador é praticamente gratuito. O ganho resultante é K=[k_p\ k_v], com k_p,k_v selecionados em conjunto. Os limites físicos |u|\le u_{max} e |\Delta u|\le r_{max} ainda são necessários. Se o recorte for frequente, a modelagem de referência, o redesenho ou o MPC restrito são mais adequados do que chamar o resultado recortado de LQR irrestrito.

Para o integrador duplo contínuo com Q=I e R=1, a mesma derivação fornece K=[1\ \sqrt{3}]\simeq[1\ 1.732]. Este é um exemplo normalizado, não um ganho para copiar para o hardware: recalcule-o com o modelo amostrado, a massa, os limites do atuador e o atraso do sistema real.

Escolhendo entre PID, LQR e MPC

Método Ajuste forte Entradas Tratamento de restrições Principal precaução
PID regulação rápida de malha única erro/histórico/taxa limitador externo saturação e ruído
LQR estabilização linear local multiestado estado estimado não explícito por si só faixa do modelo e saturação
MPC predição multivariável com limites estado, modelo, referência restrições de otimização explícitas prazo e viabilidade

Projetos aninhados são comuns: malhas PID de corrente/velocidade, estabilização local de atitude ou posição LQR e MPC para trajetória ou restrições. Para rastreamento em vez de regulação fixa, use uma referência variável no tempo, feedforward, ganho programado ou LTV-LQR.

Implementação e segurança do robô

Encoders, IMUs, câmeras e LiDAR publicam em taxas e atrasos diferentes. Não passe mensagens ordenadas por chegada diretamente como um estado. Passe uma estimativa alinhada ao timestamp, confiança/covariância e status de validade. O ciclo de vida e as interfaces de hardware do ROS 2 são descritos em ROS 2 Primer são limites de projeto, não apenas organização de software.

IMU integrada GNSS representativaIMU/INS representativa

Imagem: Xsens MTi-G (Kallap85, CC BY-SA 4.0), Wikimedia Commons. É uma imagem representativa do sensor, não um sistema LQR medido ou recomendação de produto.

Monitore o crescimento da covariância do estimador, o tempo limite do sensor, a inconsistência entre o encoder e a IMU, a saturação sustentada e as ultrapassagens do prazo. Se o estado não for mais confiável, não continue emitindo -K\hat{x}. Selecione uma transição específica do sistema — redução gradual da velocidade para zero, desativação do torque, freio mecânico ou parada de emergência — com base na inércia, gravidade e proximidade humana. As afirmações de estabilidade do LQR pressupõem um modelo correto, estado correto e entrada não saturada; proteções independentes devem cobrir as suposições fora dessa comprovação.

Lista de verificação de implementação

  1. Corrija o equilíbrio, as unidades, os sinais, os referenciais e o período discreto.

  2. Meça os resíduos do modelo próximos ao ponto de linearização e defina um envelope operacional.

  3. Verifique numericamente a controlabilidade e a observabilidade/detectabilidade.

  4. Normalize Q,R a partir do estado e comando permitidos; registre cada alteração.

  5. Monitore a saturação, os limites de taxa, estime a frescura e a parada independente fora do LQR.

  6. Teste o atraso, o atrito, a mudança de carga útil e a perda do sensor em baixa saída antes de expandir o envelope.

Referências

Verifique seu entendimento
O que uma penalidade de entrada maior incentiva?

Incentiva a conservação do esforço de controle. Verifique a compensação da resposta e dimensione as variáveis de estado com unidades diferentes adequadamente.

Related reading

Explore another aspect of this fieldLaboratório MPC — resolva novamente uma sequência de curvatura dentro de um horizonte e dos limites de direçãoExplore another aspect of this fieldLaboratório de comparação de rastreamento de trajetória — execute PP, APP, RPP, Stanley e MPC sob as mesmas condiçõesExplore another aspect of this fieldLaboratório Pure Pursuit — compare o rastreamento de trajetória com antecipação fixa