Contents — find the section you need

Die lineare quadratische Regelung (LQR) ordnet Zustandsabweichungen und dem Einsatz eines Aktuators Kosten zu und leitet daraus das Zustandsrückkopplungsgesetz ab, das diese Kosten für ein lineares Modell minimiert. Im Gegensatz zur PID-Regelung, die direkt auf den aktuellen Fehler, seine Vorgeschichte und seine Änderungsrate reagiert, kann LQR Position, Geschwindigkeit, Winkel, Winkelgeschwindigkeit, Strom und gekoppelte Achsen als einen einzigen Zustand verwenden. Dies ist besonders deutlich bei der lokalen Stabilisierung eines invertierten Pendels, der Fluglage eines Flugzeugs, eines balancierenden Roboters oder eines Roboterarms.

LQR ist jedoch kein Allheilmittel für optimale Ergebnisse. Ist der erforderliche Zustand nicht messbar, wird ein Beobachter benötigt; verlässt das System den Bereich eines lokalen linearen Modells, verliert die Verstärkung ihre Wirkung; und sind Eingangs- oder Zustandsbeschränkungen zentral, ist MPC oft die bessere Wahl. Informationen zur Ausführungsgrenze von ROS 2 finden Sie in ROS 2 Primer. Zu den Annahmen für die Schätzung siehe Sensor Fusion Primer.

Praktische Schlussfolgerung

  • Aus \dot{x}=Ax+Bu und den Gewichten Q,R ergibt die LQR-Methode mit unendlichem Horizont u=-Kx. Q beschreibt, wie stark Zustandsfehler bestraft werden; R beschreibt die Befehlskosten.

  • Die Verstärkung K ergibt sich aus einer Riccati-Gleichung und ihrer Lösung P : K=R^{-1}B^TP. Sie berücksichtigt die modellierte Kopplung, anstatt für jeden Zustand eine Verstärkung manuell anzupassen.

  • Die Stabilisierbarkeit von (A,B) und die Detektierbarkeit/Beobachtbarkeit von (A,C) sind Voraussetzungen. Ein Sensor allein reicht nicht aus, um den benötigten Zustand rekonstruieren zu können.

LQR selbst erzwingt keine Aktuatorbegrenzungen, Kollisionsabstände oder Notstopps. Diese gehören zu den Begrenzungs- und Sicherheitsfunktionen außerhalb der Verstärkung.

Zustandsraum und Signalfluss

Ein Zustand x ist die kleinste Menge an Variablen, die zusammen mit Eingangssignal und Störung das zukünftige Verhalten bestimmt. Ein Wagen benötigt Position und Geschwindigkeit; ein rotierender Körper benötigt Winkel und Winkelgeschwindigkeit; ein elektromechanischer Antrieb kann Strom hinzufügen. Ein lineares, zeitinvariantes Modell ist

\dot{x}=Ax+Bu+Ew,\qquad y=Cx+Du+v

wobei u das Sollsignal, w die nicht modellierte Störung, y die Messung und v das Sensorauschen ist. A beschreibt die Zustandsentwicklung, B den Eingangspfad und C die Sensordaten.

Im Diagramm bildet die Summierstelle e=\hat{x}-x_r (geschätzter Zustand minus Referenzwert), und der LQR-Ausgang liefert u=-Ke. Bei einem Nullreferenzwert reduziert sich dies auf das übliche u=-K\hat{x}.

Diagram 1 · Use the button to switch views
LQR state-feedback structureA reference state and estimated state are compared, an LQR gain makes a command, the plant and sensor feed a state estimator.reference xᵣequilibrium / pathΣLQR −Kweights Q, Rplant A, Bactuatorsensor Cy + noisestate estimatorx̂, validity, time

Diagramm: Duskcoil, konzeptionell, nicht gemessen. Eine reale Implementierung verfügt auch über Kalibrierung, Zeitstempel, Transportverzögerung, und Aktuator-Innenschleifen.

Um eine Gleichgewichtslage (x_e,u_e) werden die Abweichungen \tilde{x}=x-x_e und \tilde{u}=u-u_e definiert und anschließend auf \dot{\tilde{x}}=A\tilde{x}+B\tilde{u} ausgelegt. Dies ist eine lokale Anweisung. Eine Verstärkung, die ein aufrechtes Pendel nahe dem Nullwinkel stabilisiert, ist nicht notwendigerweise ein Regler zur Wiederherstellung eines Pendels, das weit aus der Gleichgewicht geraten ist, oder eines Systems, dessen Aktuator gesättigt ist.

Riccati-Gleichung und Kosten

Der kontinuierliche LQR-Regler mit unendlichem Horizont minimiert

J=\int_0^\infty\left(x^TQx+u^TRu\right)dt

mit Q\succeq0 und R\succ0. Ein größerer Wert von Q macht den Zustandsfehler teuer; ein größerer Wert von R macht den Rechenaufwand teuer. Meter, Radiant, Meter pro Sekunde und Ampere dürfen nicht ohne Skalierung addiert werden. Ein sinnvoller Ausgangspunkt sind diagonale Gewichte basierend auf zulässigen Werten. x_{max} und u_{max}, wie z. B. 1/x_{max}^2 und 1/u_{max}^2.

Die kontinuierliche algebraische Riccati-Gleichung lautet:

A^TP+PA-PBR^{-1}B^TP+Q=0

und ihre stabilisierende Lösung P ergibt:

K=R^{-1}B^TP,\qquad u=-Kx

Dies liefert die Rückkopplungsverstärkung K, die vom Regler verwendet wird.

Abgetastete Systeme benötigen ein diskretisiertes Modell und eine diskrete Riccati-Gleichung. Kontinuierliche Probleme mit endlichem Horizont verwenden eine differentielle Riccati-Gleichung; diskrete Probleme mit endlichem Horizont verwenden eine Differenzengleichung; diskrete Probleme mit unendlichem Horizont verwenden die DARE. Die Matrizen des kontinuierlichen Modells sind A,B, und das diskrete Modell ist x_{k+1}=A_dx_k+B_du_k. Die Anwendung einer kontinuierlichen Verstärkung wie bei einem diskreten Regler, Mischen Die Verwendung von Grad in Radiant oder das Ignorieren von Latenz kann eine ansonsten korrekte Berechnung in ein instabiles Gerät verwandeln.

Steuerbarkeit und Beobachtbarkeit: Bedingungen vor der Verstärkung prüfen

Die Steuerbarkeitsmatrix ist:

\mathcal{C}=[B\ AB\ A^2B\ \cdots\ A^{n-1}B]

Für ein n -Zustands-System ist die Vollrangbedingung \operatorname{rank}\mathcal{C}=n.

Voller Rang bedeutet, dass jeder Modus steuerbar ist; LQR erfordert für die Standard-Stabilisierungslösung, dass (A,B) stabilisierbar und (Q^{1/2},A) detektierbar ist. Dies ist zu unterscheiden von der Beobachtbarkeit des Sensorpaares (C,A). Die Beobachtbarkeitsmatrix ist:

\mathcal{O}=\begin{bmatrix}C\\CA\\\vdots\\CA^{n-1}\end{bmatrix}

Voller Rang bedeutet, dass der Zustand aus der Ausgabehistorie rekonstruiert werden kann. Siehe Kalman Filter Primer für den Schätzer, der normalerweise verwendet wird. In Kombination mit LQR.

Numerisches Beispiel: Stabilisierung eines Doppelintegrators

Für einen normierten Doppelintegrator mit x=[p\ v]^T und Beschleunigungsbefehl u gilt:

A=\begin{bmatrix}0&1\\0&0\end{bmatrix},\quad B=\begin{bmatrix}0\\1\end{bmatrix}

Die Verwendung von Q=\operatorname{diag}(q_p,q_v) ergibt u=-k_pp-k_vv. Dies ähnelt der PD-Regelung, jedoch werden beide Verstärkungen gemeinsam aus dem Modell und Q,R ausgewählt. Ein großer Wert für q_p bei gleichzeitig kleinem Wert für q_v führt zu starken Beschleunigungen und Bremsvorgängen; ein zu kleiner Wert für R bedeutet, dass der Aktor nahezu unbegrenzt genutzt wird. Die resultierende Verstärkung ist K=[k_p\ k_v], wobei k_p,k_v gemeinsam ausgewählt wird. Die physikalischen Grenzen |u|\le u_{max} und |\Delta u|\le r_{max} sind weiterhin erforderlich. Bei häufigem Clipping siehe Referenz. Die Verwendung von Formung, Redesign oder eingeschränkter MPC ist aussagekräftiger als die Bezeichnung des abgeschnittenen Ergebnisses als uneingeschränkte LQR.

Für den kontinuierlichen Doppelintegrator mit Q=I und R=1 ergibt dieselbe Herleitung K=[1\ \sqrt{3}]\simeq[1\ 1.732]. Dies ist ein normiertes Beispiel und kein Wert, der in Hardware übernommen werden kann: Berechnen Sie ihn mit dem abgetasteten Modell, der Masse, den Aktuatorgrenzen und der Verzögerung des realen Systems neu.

Auswahl zwischen PID, LQR und MPC

| Methode | Starke Anpassung | Eingänge | Umgang mit Nebenbedingungen | Wichtigste Vorsichtsmaßnahme |

--- | --- | --- | --- | --- |

PID | Schnelle Regelung im Einzelschleifenbetrieb | Fehler/Verlauf/Änderungsrate | Externer Begrenzer | Windup und Rauschen |

LQR | Lokale lineare Mehrzustandsstabilisierung | Geschätzter Zustand | Nicht explizit | Modellbereich und Sättigung |

MPC | Mehrgrößenprädiktion mit Grenzen | Zustand, Modell, Referenz | Explizite Optimierungsbeschränkungen | Frist und Machbarkeit |

Verschachtelte Designs sind üblich: PID-Strom-/Geschwindigkeitsregler, LQR-basierte lokale Lage- oder Positionsstabilisierung und MPC für Trajektorien oder Beschränkungen. Für die Nachführung anstelle einer festen Regelung verwenden Sie eine zeitvariable Referenz, Vorsteuerung, Gain-Scheduling oder LTV-LQR.

Roboterimplementierung und Sicherheit

Encoder, IMUs, Kameras und LiDAR senden Daten mit unterschiedlichen Raten und Verzögerungen. Senden Sie keine eingangsreihenfolge-Nachrichten direkt als Zustand. Übergeben Sie stattdessen eine zeitstempelbasierte Schätzung, Konfidenz/Kovarianz und den Gültigkeitsstatus. Der in ROS 2 Primer beschriebene ROS-2-Lebenszyklus und die Hardware-Schnittstellen stellen Designgrenzen dar, nicht nur die Softwareorganisation.

Repräsentative GNSS-integrierte IMURepräsentatives IMU/INS

Bild: Xsens MTi-G (Kallap85, CC BY-SA 4.0), Wikimedia Commons. Es handelt sich um ein repräsentatives Sensorbild, nicht um ein gemessenes LQR-System oder eine Produktempfehlung.

Überwachen Sie das Wachstum der Schätzerkovarianz, Sensor-Timeouts, Inkonsistenzen zwischen Encoder und IMU, anhaltende Sättigung und Überschreitungen von Fristen. Wenn der Zustand nicht mehr vertrauenswürdig ist, geben Sie -K\hat{x} nicht weiter aus. Wählen Sie einen systemspezifischen Übergang – Geschwindigkeitsrampe auf Null, Drehmomentabschaltung, mechanische Bremse oder Not-Aus – basierend auf Trägheit, Schwerkraft und Personennähe. Die Stabilitätsaussagen für LQR setzen ein korrektes Modell, einen korrekten Zustand und einen nicht gesättigten Eingang voraus; unabhängige Schutzmechanismen müssen die Annahmen außerhalb dieses Nachweises abdecken.

Checkliste für die Implementierung

  1. Beheben Gleichgewicht, Einheiten, Vorzeichen, Bezugssysteme und diskrete Periode.

  2. Modellresiduen in der Nähe des Linearisierungspunktes messen und einen Betriebsbereich definieren.

  3. Steuerbarkeit und Beobachtbarkeit/Erkennbarkeit numerisch prüfen.

  4. Q,R anhand des zulässigen Zustands und der Befehle normalisieren; jede Änderung protokollieren.

  5. Sättigung, Ratenbegrenzungen, Frischeabschätzung und unabhängiges Anhalten außerhalb des LQR-Bereichs überwachen.

  6. Verzögerung, Reibung, Nutzlaständerung und Sensorverlust bei geringer Leistung testen, bevor der Betriebsbereich erweitert wird.

Referenzen

Überprüfen Sie Ihr Verständnis
Was bewirkt eine höhere Eingabestrafe?

Sie fördert die Reduzierung des Kontrollaufwands. Überprüfen Sie den Zielkonflikt und skalieren Sie die Zustandsvariablen entsprechend mit unterschiedlichen Einheiten.

Sie fördert die Reduzierung des Kontrollaufwands.

Related reading

Explore another aspect of this fieldMPC-Labor – Krümmungsfolge im Horizont und innerhalb der Lenkgrenzen neu lösenExplore another aspect of this fieldPfadverfolgungs-Vergleichs-Labor – PP, APP, RPP, Stanley und MPC unter denselben Bedingungen laufen lassenExplore another aspect of this fieldPure-Pursuit-Labor – Vergleich der Pfadverfolgung mit fester Vorausschau