Contents — find the section you need
La régulation linéaire quadratique (LQR) attribue un coût à l'écart d'état et à l'utilisation d'un actionneur, puis détermine la loi de retour d'état qui minimise ce coût pour un modèle linéaire. Contrairement au PID, qui réagit directement à l'erreur actuelle, à son historique et à sa vitesse, le LQR peut utiliser la position, la vitesse, l'angle, la vitesse angulaire, le courant et les axes couplés comme un seul état. Il est particulièrement adapté à la stabilisation locale d'un pendule inversé, au contrôle d'attitude d'un aéronef, à l'équilibrage d'un robot ou à la stabilisation d'un bras robotisé.
Le LQR n'est pas une solution miracle. Si l'état requis n'est pas mesuré, un observateur est nécessaire ; si le système sort du domaine de définition d'un modèle linéaire local, le gain perd de son intérêt ; et si les contraintes d'entrée ou d'état sont essentielles, le MPC est souvent la couche la plus appropriée. Pour plus d'informations sur les limites d'exécution de ROS 2, consultez ROS 2 Primer. Pour les hypothèses d'estimation, voir Introduction à la fusion de capteurs.
Conclusion pratique
-
À partir de \dot{x}=Ax+Bu et des poids Q,R, l'algorithme LQR à horizon infini produit u=-Kx. Q exprime la pénalité appliquée à l'erreur d'état ; R exprime le coût de la commande.
-
Le gain K provient d'une équation de Riccati et de sa solution P : K=R^{-1}B^TP. Il prend en compte le couplage modélisé au lieu d'ajuster manuellement un gain par état.
-
La stabilisabilité de (A,B) et la détectabilité/observabilité de (A,C) sont des prérequis. Disposer d'un capteur ne signifie pas nécessairement pouvoir reconstruire l'état requis. Le LQR lui-même n'impose pas les limites des actionneurs, le dégagement anti-collision ni l'arrêt d'urgence. Ces fonctions relèvent de limites et de sécurité externes au gain.
Espace d'état et flux de signaux
Un état x est le plus petit ensemble de variables qui, combiné à l'entrée et aux perturbations, détermine le comportement futur. Un chariot nécessite sa position et sa vitesse ; un corps en rotation nécessite son angle et sa vitesse angulaire ; un entraînement électromécanique peut être alimenté en courant. Un modèle linéaire invariant dans le temps est :
où u est la commande, w la perturbation non modélisée, y la mesure et v le bruit du capteur. A décrit l'évolution de l'état, B le chemin d'entrée et C les informations fournies par les capteurs.
Sur le schéma, la jonction de sommation forme e=\hat{x}-x_r (état estimé moins référence), et le LQR fournit les sorties u=-Ke. Pour une référence nulle, cela se réduit à la sortie habituelle u=-K\hat{x}.
Schéma : Bobine crépusculaire, conceptuel plutôt que mesuré. Une implémentation réelle comprend également l’étalonnage, l’horodatage, le délai de transport et les boucles internes des actionneurs.
Autour d’un équilibre (x_e,u_e) , définissez les écarts \tilde{x}=x-x_e et \tilde{u}=u-u_e , puis dimensionnez le système sur \dot{\tilde{x}}=A\tilde{x}+B\tilde{u} . Il s'agit d'une instruction locale. Un gain stabilisant un pendule vertical proche de zéro angle ne constitue pas nécessairement un contrôleur de récupération pour un pendule ayant subi une chute importante ou pour un système dont l'actionneur est saturé.
Équation de Riccati et coût
Un contrôleur LQR continu à horizon infini minimise
avec Q\succeq0 et R\succ0 . Une valeur élevée de Q augmente le coût de l'erreur d'état ; une valeur élevée de R augmente le coût de l'effort. N'additionnez pas les mètres, les radians, les mètres par seconde et les ampères sans mise à l'échelle. Un point de départ utile consiste à utiliser des pondérations diagonales basées sur les valeurs admissibles x_{max} et u_{max} , comme 1/x_{max}^2 et 1/u_{max}^2 .
L'équation de Riccati algébrique continue est :
et sa solution stabilisante P donne :
Ceci donne le gain de rétroaction K utilisé par le contrôleur.
Les systèmes échantillonnés nécessitent un modèle discrétisé et une équation de Riccati discrète. Les problèmes continus à horizon fini utilisent une équation de Riccati différentielle ; les problèmes discrets à horizon fini utilisent une équation aux différences finies ; les problèmes discrets à horizon infini utilisent l'équation DARE. Les matrices du modèle continu sont A,B , et le modèle discret est x_{k+1}=A_dx_k+B_du_k . Appliquer un gain continu comme s'il s'agissait d'un contrôleur discret, mélanger les degrés et les radians, ou ignorer la latence peut transformer un calcul par ailleurs correct en une erreur. Dispositif instable.
Contrôlabilité et observabilité : conditions de vérification avant le gain
La matrice de contrôlabilité est :
Pour un système à n états, la condition de rang maximal est : \operatorname{rank}\mathcal{C}=n.
Le rang maximal signifie que chaque mode est contrôlable ; la méthode LQR exige que (A,B) soit stabilisable et (Q^{1/2},A) soit détectable pour la solution de stabilisation standard. Ceci est différent de l’observabilité de la paire de capteurs (C,A). La matrice d’observabilité est :
Le rang maximal signifie que l’état peut être reconstruit à partir de l’historique de sortie. Voir Introduction au filtre de Kalman pour l’estimateur généralement associé à la méthode LQR.
Exemple numérique : stabilisation d’un système à double entrée Intégrateur
Pour un double intégrateur normalisé avec x=[p\ v]^T et la commande d'accélération u,
L'utilisation de Q=\operatorname{diag}(q_p,q_v) donne u=-k_pp-k_vv. Ce résultat ressemble à celui d'un PD, mais les deux gains sont sélectionnés conjointement à partir du modèle et de Q,R. Augmenter q_p tout en minimisant q_v induit des accélérations et des freinages brusques ; réduire R à une valeur trop faible signifie que l'utilisation de l'actionneur est quasi gratuite. Le gain résultant est K=[k_p\ k_v], avec k_p,k_v sélectionné conjointement. Les limites physiques |u|\le u_{max} et |\Delta u|\le r_{max} restent nécessaires. En cas d'écrêtage fréquent, il est plus judicieux d'utiliser une mise en forme de référence, une reconception ou un MPC contraint plutôt que de considérer le résultat comme écrêté. LQR sans contrainte.
Pour le double intégrateur continu avec Q=I et R=1, la même dérivation donne K=[1\ \sqrt{3}]\simeq[1\ 1.732]. Il s'agit d'un exemple normalisé, non exploitable pour une implémentation matérielle : recalculez-le avec le modèle échantillonné, la masse, les limites des actionneurs et le délai du système réel.
Choix entre PID, LQR et MPC
| Méthode | Ajustement précis | Entrées | Gestion des contraintes | Principale mise en garde |
|---|---|---|---|---|
| PID | régulation rapide en boucle unique | erreur/historique/taux | limiteur externe | saturation et bruit |
| LQR | stabilisation multi-états linéaire locale | état estimé | non explicite en soi | plage de modèle et saturation |
| MPC | prédiction multivariable avec limites | état, modèle, référence | contraintes d'optimisation explicites | délai et faisabilité |
Les conceptions imbriquées sont courantes : boucles courant/vitesse PID, Stabilisation locale d'attitude ou de position par LQR, et MPC pour la trajectoire ou les contraintes. Pour le suivi plutôt que la régulation fixe, utilisez une référence variable dans le temps, une commande prédictive, une planification de gain ou LTV-LQR.
Implémentation et sécurité du robot
Les encodeurs, les centrales inertielles (IMU), les caméras et le LiDAR publient à des fréquences et avec des délais différents. Ne transmettez pas directement les messages ordonnés par ordre d'arrivée comme état. Transmettez une estimation horodatée, la confiance/covariance et l'état de validité. Le cycle de vie de ROS 2 et les interfaces matérielles décrits dans ROS 2 Primer constituent des limites de conception, et non une simple organisation logicielle.
Représentative IMU/INSImage : Xsens MTi-G (Kallap85, CC BY-SA 4.0), Wikimedia Commons. Il s'agit d'une image représentative du capteur, et non d'un système LQR mesuré ou d'une recommandation de produit.
Surveillez la croissance de la covariance de l'estimateur, le délai d'expiration du capteur, l'incohérence entre l'encodeur et l'IMU, la saturation persistante et les dépassements de délai. Si l'état n'est plus fiable, cessez d'émettre -K\hat{x}. Sélectionnez une transition spécifique au système (vitesse réduite à zéro, désactivation du couple, frein mécanique ou arrêt d'urgence) en fonction de l'inertie, de la gravité et de la proximité humaine. Les affirmations de stabilité LQR supposent un modèle correct, un état correct et une entrée non saturée ; des protections indépendantes doivent couvrir les hypothèses non couvertes par cette preuve.
Liste de contrôle de l'implémentation
-
Fixez l'équilibre, les unités, les signes, les repères et la période discrète.
-
Mesurez le modèle Déterminer les résidus au voisinage du point de linéarisation et définir une enveloppe de fonctionnement.
-
Vérifier numériquement la contrôlabilité et l'observabilité/détectabilité.
-
Normaliser Q,R à partir de l'état et de la commande autorisés ; enregistrer chaque modification.
-
Surveiller la saturation, les limites de débit, estimer la fraîcheur et l'arrêt indépendant hors LQR.
-
Tester le délai, le frottement, la variation de charge utile et la perte de capteurs à faible puissance de sortie avant d'étendre l'enveloppe.
Références
Qu'encourage une pénalité d'entrée plus importante ?
Elle encourage à économiser l'effort de contrôle. Vérifiez le compromis de réponse et mettez à l'échelle les variables d'état avec des unités différentes de manière appropriée.
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.