Contents — find the section you need

La regulación lineal cuadrática (LQR) asigna un coste a la desviación del estado y al uso de un actuador, y luego deriva la ley de retroalimentación de estado que minimiza dicho coste para un modelo lineal. A diferencia del PID, que reacciona directamente al error actual, su historial y su tasa, la LQR puede utilizar la posición, la velocidad, el ángulo, la velocidad angular, la corriente y los ejes acoplados como un único estado. Esto resulta especialmente útil para la estabilización local de un péndulo invertido, la actitud de una aeronave, un robot de equilibrio o un brazo robótico.

La LQR no es una solución mágica para la optimización. Si el estado requerido no se puede medir, se necesita un observador; si el sistema se sale del rango de un modelo lineal local, la ganancia pierde su valor; y si las restricciones de entrada o de estado son cruciales, el MPC suele ser la mejor opción. Para conocer los límites de ejecución de ROS 2, consulte ROS 2 Primer. Para conocer las suposiciones de estimación, consulte Introducción a la fusión de sensores.

Conclusión práctica

  • A partir de \dot{x}=Ax+Bu y los pesos Q,R, el LQR de horizonte infinito produce u=-Kx. Q expresa la intensidad con la que se penaliza el error de estado; R expresa el coste del comando.

  • La ganancia K proviene de una ecuación de Riccati y su solución P: K=R^{-1}B^TP. Considera el acoplamiento modelado en lugar de ajustar manualmente una ganancia por estado.

  • La estabilizabilidad de (A,B) y la detectabilidad/observabilidad de (A,C) son requisitos previos. Tener un sensor no es lo mismo que poder reconstruir el estado requerido.

  • El LQR en sí mismo no impone límites a los actuadores, la holgura de colisión ni la parada de emergencia. Estas funciones pertenecen a los límites y las funciones de seguridad, que están fuera de la ganancia.

Espacio de estados y flujo de señales

Un estado x es el conjunto más pequeño de variables que, junto con la entrada y la perturbación, determina el comportamiento futuro. Un carro necesita posición y velocidad; un cuerpo giratorio necesita ángulo y velocidad angular; un accionamiento electromecánico puede añadir corriente. Un modelo lineal invariante en el tiempo es:

\dot{x}=Ax+Bu+Ew,\qquad y=Cx+Du+v

donde u es el comando, w la perturbación no modelada, y la medición y v el ruido del sensor. A describe la evolución del estado, B la trayectoria de entrada y C la información que revelan los sensores.

En el diagrama, la unión sumadora forma e=\hat{x}-x_r (estado estimado menos referencia), y la salida LQR genera u=-Ke. Para una referencia cero, esto se reduce a la salida habitual u=-K\hat{x}.

Diagram 1 · Use the button to switch views
LQR state-feedback structureA reference state and estimated state are compared, an LQR gain makes a command, the plant and sensor feed a state estimator.reference xᵣequilibrium / pathΣLQR −Kweights Q, Rplant A, Bactuatorsensor Cy + noisestate estimatorx̂, validity, time

Alrededor de un equilibrio (x_e,u_e), defina las desviaciones \tilde{x}=x-x_e y \tilde{u}=u-u_e, y luego diseñe en \dot{\tilde{x}}=A\tilde{x}+B\tilde{u}. Esta es una instrucción local. Una ganancia que estabiliza un péndulo vertical cerca del ángulo cero no es necesariamente un controlador de recuperación para un péndulo que ha caído lejos o un sistema cuyo actuador está saturado.

Ecuación de Riccati y costo

El LQR continuo de horizonte infinito minimiza

J=\int_0^\infty\left(x^TQx+u^TRu\right)dt

con Q\succeq0 y R\succ0. Un Q mayor hace que el error de estado sea costoso; un R mayor hace que el esfuerzo sea costoso. No agregue metros, radianes, metros por segundo ni amperios sin escalar. Un buen punto de partida son los pesos diagonales basados en los valores permitidos x_{max} y u_{max}, como 1/x_{max}^2 y 1/u_{max}^2.

La ecuación algebraica continua de Riccati es:

A^TP+PA-PBR^{-1}B^TP+Q=0

y su solución estabilizadora P da:

K=R^{-1}B^TP,\qquad u=-Kx

Esto proporciona la ganancia de retroalimentación K utilizada por el controlador.

Los sistemas muestreados requieren un modelo discretizado y una ecuación discreta de Riccati. Los problemas continuos de horizonte finito utilizan una ecuación diferencial de Riccati; los problemas discretos de horizonte finito utilizan una ecuación de diferencias; los problemas discretos de horizonte infinito utilizan la ecuación diferencial de Riccati (DARE). Las matrices del modelo continuo son A,B, y el modelo discreto es x_{k+1}=A_dx_k+B_du_k. Aplicar una ganancia continua como si fuera un controlador discreto, mezclar grados con radianes o ignorar La latencia puede convertir un cálculo correcto en un dispositivo inestable.

Controlabilidad y observabilidad: verificar las condiciones antes de la ganancia

La matriz de controlabilidad es:

\mathcal{C}=[B\ AB\ A^2B\ \cdots\ A^{n-1}B]

Para un sistema de estados n, la condición de rango completo es \operatorname{rank}\mathcal{C}=n.

El rango completo significa que todos los modos son controlables; LQR requiere que (A,B) sea estabilizable y (Q^{1/2},A) detectable para la solución de estabilización estándar. Esto es distinto de la observabilidad del par de sensores (C,A). La matriz de observabilidad es:

\mathcal{O}=\begin{bmatrix}C\\CA\\\vdots\\CA^{n-1}\end{bmatrix}

El rango completo significa que el estado se puede reconstruir a partir del historial de salida. Consulte Introducción al filtro de Kalman para el estimador que normalmente se usa con LQR.

Ejemplo numérico: estabilización de un integrador doble

Para un integrador doble normalizado con x=[p\ v]^T y comando de aceleración u,

A=\begin{bmatrix}0&1\\0&0\end{bmatrix},\quad B=\begin{bmatrix}0\\1\end{bmatrix}

Usando Q=\operatorname{diag}(q_p,q_v) se obtiene u=-k_pp-k_vv. Se asemeja a PD, pero ambas ganancias se seleccionan conjuntamente del modelo y Q,R. Si q_p es grande y q_v es pequeño, se produce una aceleración y frenado bruscos; si R es demasiado pequeño, el uso del actuador es prácticamente nulo. La ganancia resultante es K=[k_p\ k_v], con k_p,k_v seleccionada conjuntamente. Los límites físicos |u|\le u_{max} y |\Delta u|\le r_{max} siguen siendo necesarios. Si el recorte es frecuente, se recomienda la conformación de referencia, el rediseño o el MPC restringido. Es más honesto que llamar al resultado recortado LQR sin restricciones.

Para el integrador doble continuo con Q=I y R=1, la misma derivación da K=[1\ \sqrt{3}]\simeq[1\ 1.732]. Este es un ejemplo normalizado, no una ganancia para copiar en hardware: recalcule con el modelo muestreado, la masa, los límites del actuador y el retardo del sistema real.

Elección entre PID, LQR y MPC

Método Ajuste fuerte Entradas Manejo de restricciones Precaución principal
PID Regulación rápida de un solo bucle Error/Historial/Tasa Limitador externo Saturación y ruido
LQR Estabilización lineal multiestado local Estado estimado No es explícito por sí mismo Rango y saturación del modelo
MPC Predicción multivariable con límites Estado, modelo, referencia Restricciones de optimización explícitas Plazo y viabilidad

Anidado Los diseños comunes incluyen: bucles PID de corriente/velocidad, estabilización de actitud o posición local LQR y MPC para trayectoria o restricciones. Para el seguimiento en lugar de la regulación fija, utilice una referencia variable en el tiempo, anticipación, programación de ganancia o LTV-LQR.

Implementación y seguridad del robot

Los codificadores, las IMU, las cámaras y el LiDAR publican a diferentes velocidades y con distintos retardos. No transmita los mensajes ordenados por llegada directamente como estado. Transmita una estimación alineada con la marca de tiempo, la confianza/covarianza y el estado de validez. El ciclo de vida de ROS 2 y las interfaces de hardware descritas en ROS 2 Primer son límites de diseño, no solo organización del software.

IMU integrada GNSS representativaIMU/INS representativo

Imagen: Xsens MTi-G (Kallap85, CC BY-SA 4.0), Wikimedia Commons. Es una imagen representativa del sensor, no una medición del sistema LQR ni una recomendación de producto.

Supervise el crecimiento de la covarianza del estimador, el tiempo de espera del sensor, la inconsistencia entre el codificador y la IMU, la saturación sostenida y los retrasos. Si el estado ya no es fiable, no siga emitiendo -K\hat{x}. Seleccione una transición específica del sistema (velocidad gradual a cero, desactivación del par, freno mecánico o parada de emergencia) en función de la inercia, la gravedad y la proximidad humana. Las afirmaciones de estabilidad de LQR presuponen un modelo correcto, un estado correcto y una entrada no saturada; las protecciones independientes deben cubrir las suposiciones que no se demuestren.

Lista de verificación de implementación

  1. Fijar el equilibrio, las unidades, los signos, los marcos y el período discreto.

  2. Medir los residuos del modelo cerca del punto de linealización y definir una envolvente de operación.

  3. Verificar numéricamente la controlabilidad y la observabilidad/detectabilidad.

  4. Normalizar Q,R a partir del estado y comando permitidos; registrar cada cambio.

  5. Monitorear la saturación, los límites de velocidad, estimar la frescura y la parada independiente fuera del LQR.

  6. Probar el retardo, la fricción, el cambio de carga útil y la pérdida del sensor a baja salida antes de ampliar la envolvente.

Referencias

Comprueba tu comprensión
¿Qué fomenta una mayor penalización de entrada?

Fomenta la conservación del esfuerzo de control. Comprueba la relación de compromiso de la respuesta y ajusta las variables de estado con diferentes unidades según corresponda.

Related reading

Explore another aspect of this fieldLab de MPC: volver a resolver una secuencia de curvatura dentro del horizonte y los límites de direcciónExplore another aspect of this fieldLab de comparación de seguimiento de trayectoria: ejecute PP, APP, RPP, Stanley y MPC en las mismas condicionesExplore another aspect of this fieldLab de Pure Pursuit: comparar el seguimiento de trayectoria con lookahead fijo