Contents — find the section you need
“Pare no sinal vermelho, siga o veículo da frente mais lento e mude de faixa quando o espaço ao lado for seguro” soa como um programa curto. Uma estrada real apresenta os três problemas com incerteza: o sinal está parcialmente obstruído, o veículo da frente pode virar ou estacionar, e um motorista ao lado parece ceder a passagem, mas ainda não reduziu a velocidade. Um veículo autônomo deve selecionar um modo de comportamento defensável a partir de observações incompletas e, em seguida, revisá-lo continuamente conforme a cena reage.
O planejamento de comportamento é a camada de decisão entre a percepção/previsão e o controle contínuo de movimento. Suas entradas incluem o estado do veículo, a topologia da estrada, os sinais, os objetos rastreados, os futuros previstos, a intenção da rota e o domínio de projeto operacional (ODD). Suas saídas são intenções discretas — seguir, parar, ceder a passagem, entrar na faixa, mudar de faixa ou entrar em uma condição de risco mínimo — além de restrições de faixa, velocidade, tempo e espaço livre. Ele não deve inventar diretamente um ângulo de direção. Ele informa às camadas subsequentes de caminho, trajetória e controle o que deve ser alcançado e o que nunca deve ser violado.
O planejamento de comportamento não deve inventar diretamente um ângulo de direção. Ele informa às camadas subsequentes de caminho, trajetória e controle o que deve ser alcançado e o que nunca deve ser violado.
Exemplo de um veículo de produção com assistência ao condutorImagem: Subaru WRX S4 2.0GT-S EyeSight (Tokumeigakarinoaoshima, CC BY-SA 4.0), Wikimedia Commons. Esta fotografia externa não revela a máquina de estados interna ou a implementação de qualquer produto aqui discutido.
Conclusão prática
- O planejamento de comportamento seleciona uma manobra, como parar, seguir, entrar na faixa, mudar de faixa ou recuar; o planejamento de caminho e trajetória determina o movimento contínuo que a realiza.
- Uma máquina de estados finitos é rastreável e eficaz para funções limitadas, mas exceções podem causar uma explosão de transições de estado. Uma árvore de comportamento expressa prioridades e subárvores reutilizáveis, mas o estado compartilhado e as ações concorrentes podem ocultar a complexidade.
- Um POMDP representa a oclusão e a intenção latente como distribuições de probabilidade, ao custo de atualizações de crença dispendiosas e busca futura. Sistemas de produção geralmente combinam regras, máquinas de estado, otimização e componentes aprendidos em vez de escolher um método universal.
- Um rótulo de classe de percepção não deve se tornar um comando. O planejamento de comportamento precisa de carimbos de data/hora, covariância, probabilidade de existência, histórico de trajetória e múltiplas hipóteses de previsão.
- O planejamento de caminho resolve a alcançabilidade geométrica; o MPC resolve o controle contínuo com restrições. O planejamento de comportamento fornece seus objetivos, restrições, prioridades, critérios de aborto e prazos — e deve reagir quando relatam inviabilidade.
- A evidência de segurança precisa de requisitos rastreáveis, cobertura de cenários, varreduras de limites, injeção de falhas, análise contrafactual, reprodução de percurso fechado e um monitor de segurança independente, não apenas milhas acumuladas sem incidentes.
1. Um comportamento Máquina de estados torna as decisões inspecionáveis
A seguinte máquina de estados finitos (MEF) simplifica a assistência em rodovias. O sistema mantém velocidade constante, segue um veículo líder mais lento, prepara uma mudança de faixa após verificar a necessidade da rota e uma distância segura, executa a mudança e retorna à velocidade constante. Falhas nos sensores, saídas inesperadas ou inviabilidade de planejamento podem levar de qualquer estado ativo à degradação ou a uma manobra de risco mínimo.
Figura 1 — Máquina de estados de comportamento conceitual Duskcoil. As transições são deliberadamente simplificadas para fins didáticos; O diagrama não representa a implementação ou a especificação de segurança do Subaru EyeSight ou de qualquer outro produto mencionado.
Uma Máquina de Estados Finitos (MEF) possui um conjunto de estados S, um conjunto de eventos ou entradas E e uma função de transição
Sua principal vantagem é a rastreabilidade. Um registro pode indicar que "a preparação para mudança de faixa foi abortada porque o TTC (Controle de Tração Temporário) de espaço traseiro cruzou sua guarda". As tabelas de transição mapeiam naturalmente os requisitos e testes. Isso torna as MEFs valiosas para funções delimitadas, como controle de cruzeiro adaptativo, assistência de faixa, engajamento e modos de degradação.
A desvantagem reside na combinatória. Mudanças de faixa para a direita e para a esquerda, zonas de obras, veículos de emergência, praças de pedágio, degradação de sensores e intervenção do motorista criam um produto de estados e transições. MEFs hierárquicas, propriedade explícita de estados, transições priorizadas, guardas sem efeitos colaterais e tempos limite previnem parte dessa explosão. Um guarda de mudança de faixa pode ser
Este booleano é útil para o fluxo de controle, mas os engenheiros devem manter a distância relativa, a velocidade, a covariância, os pesos de previsão e a atualização por trás de GapSafe; caso contrário, uma decisão alterada não poderá ser explicada.
2. Árvores de comportamento expressam prioridade e reutilização
Uma árvore de comportamento (BT) avalia uma árvore de nós de controle e nós folha. Uma Sequência só é bem-sucedida depois que seus filhos forem bem-sucedidos em ordem. Um Recurso Alternativo/Seletor tenta os filhos até que um seja bem-sucedido ou permaneça em execução. Os nós Condição e Ação verificam uma lacuna, solicitam uma trajetória ou comandam um recurso alternativo.
A estrutura em árvore torna visível a “resposta de emergência antes do gerenciamento da interseção antes da condução normal” e permite que as equipes reutilizem subárvores para parada segura, conversão protegida ou estacionamento. Geralmente é mais fácil de estender do que um grafo de transição de todos para todos.
No entanto, uma árvore não é automaticamente segura. Uma árvore reativa, iniciada a partir da raiz, pode alternar comportamentos quando uma condição ruidosa ultrapassa seu limite. Histerese, tempo mínimo de permanência e critérios explícitos de conclusão são necessários. Um quadro negro compartilhado pode se tornar um estado global oculto. Se uma ação em execução for interrompida, a árvore deve cancelar sua trajetória subsequente e verificar se comandos obsoletos não podem sobreviver. Nós paralelos também precisam de uma política de recursos definida: duas ações não podem, independentemente, possuir controle longitudinal.
3. POMDPs representam intenção oculta
A intenção de um motorista que está entrando na via — ceder a passagem ou entrar primeiro — não é diretamente observável. O mesmo ocorre com um pedestre atrás de um caminhão que oclui a passagem. Um processo de decisão de Markov parcialmente observável usa o estado s , a ação a , a observação o , o modelo de transição T(s'|s,a) , o modelo de observação O(o|s') e a recompensa R(s,a) . Para estados que não são diretamente visíveis, o planejador mantém uma distribuição de crenças b_t(s)=P(s_t=s\mid o_{1:t},a_{1:t-1}). Após uma observação o_{t+1} chegar após uma ação, a atualização conceitual é
onde \eta normaliza a probabilidade. Busca-se uma política como
Busca-se a política \pi que maximize isso. Colisões podem receber uma penalidade muito grande, com penalidades menores para violação de regras, desconforto e atraso. A vantagem é que a incerteza é explícita; uma ação de "avançar para ver ao redor da obstrução" pode melhorar a informação. O custo é computacional e de modelagem. O estado contínuo do tráfego, muitos atores e um longo horizonte tornam soluções exatas impraticáveis. Recompensas baixas podem produzir comportamento agressivo ou um veículo que nunca se move. Sistemas práticos restringem candidatos com regras e usam aproximações como busca online, busca em árvore Monte Carlo, funções de valor aprendidas ou modelos de intenção compactos.
4. Projetos híbridos dividem responsabilidades
| Método | Pontos Fortes | Pontos Fracos | Papel apropriado |
|---|---|---|---|
| Máquina de Estados Finitos (MEF) / MEF hierárquica | determinística e rastreável | explosão de transições | modos, ODD, degradação, ADAS limitado |
| Árvore de comportamento | prioridade, reutilização, recuperação | semântica de quadro-negro e tick | composição de tarefas e tratamento de exceções |
| Regras / livros de regras | prioridade legal e de segurança explícita | não é possível enumerar o mundo | restrições rígidas e classificação de candidatos |
| Processo de Decisão de Markov (MDP) / Processo de Decisão de Markov de Ordem Múltipla (POMDP) | interação futura sob incerteza | custo de modelagem e computação | fusão, interseções, negociação |
| Aprendizado por imitação / reforço | aproxima interação complexa | mudança de distribuição e garantia | previsão ou geração de candidatos em um ODD limitado |
Um híbrido plausível utiliza uma Máquina de Estados Finitos (FSM) para modos de sistema e de falha, uma Rede de Bits (BT) para prioridades comportamentais, um Modelo de Decisão de Ordem Progressiva (POMDP) ou um modelo aprendido para pontuar opções de fusão e um envelope de segurança verificável para rejeitar saídas inseguras. Um componente aprendido propõe; uma camada de restrição revisada separadamente autoriza. O limite exato depende do caso de ODD (Dispositivo de Ocorrência Diferencial) e do caso de segurança.
5. Conectar percepção e predição com distribuições
“Carro na posição x,y” não é uma interface suficiente. O planejamento de comportamento precisa de tempo de medição, quadro, ID da trajetória, dimensões, velocidade, aceleração, probabilidade de existência, probabilidades de classe, covariância, oclusão e integridade do sensor. O movimento proveniente de Rastreamento de Características ou Fluxo Óptico não é automaticamente a velocidade de um objeto 3D.
Em vez de atribuir a trajetória futura do objeto i a uma única estimativa, a previsão pode reter múltiplos modos de hipótese
para o modo m — em frente, curva, mudança de faixa ou parada. O planejador deve considerar conflitos de baixa probabilidade, mas de alta gravidade, e não apenas o caminho mais provável. Ele deve expandir a margem quando a covariância aumenta e reduzir a velocidade quando os dados se tornam obsoletos. Uma troca de ID de trajetória não deve transferir a intenção inferida de um motorista para outro veículo.
6. Conectar comportamento, caminho, trajetória e MPC bidirecionalmente
“Mudar para a faixa da esquerda” não prova que existe uma trajetória dinamicamente viável e livre de colisões. O Planejamento de Caminho pesquisa o espaço geométrico livre. A Geração de Trajetória adiciona tempo, velocidade e aceleração. O Controle Preditivo por Modelo otimiza o controle contínuo sob restrições do veículo e do atuador.
Um objetivo típico do MPC é:
O planejamento de comportamento fornece a faixa alvo, o envelope de velocidade, a linha de parada, o espaço proibido, a meta de conforto e o prazo de conclusão — não apenas x^{ref}. Se a otimização de trajetória indicar inviabilidade, o planejamento de comportamento deve selecionar outra opção em vez de forçar um comando. O ciclo completo é:
-
A percepção e a predição atualizam um modelo probabilístico do mundo.
-
O planejamento de comportamento gera e prioriza candidatos a manobras.
-
O planejamento de caminho e trajetória testa a viabilidade geométrica e dinâmica.
-
O MPC calcula a direção, a propulsão e a frenagem, retornando os limites de rastreamento.
-
A supervisão independente de segurança verifica prazos, atualidade, folga e desvios.
Um loop de comportamento de 10 Hz não é considerado atualizado se seus rastreamentos de objetos já tiverem 300 ms de idade. Transmita os registros de data e hora de aquisição e expiração por todo o pipeline. Transformações com incompatibilidade de tempo, respostas de uma solicitação anterior e uma trajetória antiga não cancelada são falhas comuns de integração.
7. O que os exemplos atuais de ADAS e direção automatizada realmente mostram
A Subaru descreve o EyeSight como uma tecnologia de assistência ao motorista centrada na percepção por câmera estéreo, que oferece suporte a funções como assistência para evitar colisões e seguimento. As descrições públicas dos recursos não revelam se uma implementação interna usa uma Máquina de Estados Finitos (FSM), uma Rede Bluetooth (BT) ou componentes de decisão aprendidos. O manual do proprietário — e não um apelido do produto — define as obrigações do motorista em relação a clima, visibilidade, velocidade, estrada e condições da via.
A assistência rodoviária de nível 2 da SAE pode controlar a direção e a velocidade simultaneamente enquanto o motorista monitora continuamente a estrada. A NHTSA distingue explicitamente o ADAS de Nível 2, que auxilia um condutor humano atento, dos ADS de Níveis 3 a 5. Em uma função limitada de Nível 3, como o Mercedes-Benz DRIVE PILOT, o sistema executa a tarefa de condução enquanto o condutor está atento e pode solicitar a retomada do controle ao atingir o limite da sua capacidade. A Mercedes-Benz anunciou a homologação na Alemanha para velocidades de até 95 km/h sob condições específicas para a sua atualização de 2025; essa afirmação não deve ser generalizada para todas as estradas, condições climáticas, veículos ou jurisdições.
Um serviço de condução autônoma com abrangência geográfica limitada, como o Waymo, combina planejamento de comportamento com sensores redundantes, mapas, operações de frota, assistência remota, gerenciamento de ODD (Outros Veículos) e uma análise de segurança. O Waymo publica comparações de taxas de acidentes e dados para download, mas esses resultados não comprovam um desempenho universal. Os leitores devem verificar as cidades onde o serviço opera, a exposição às estradas, os critérios de relatório, a construção do benchmark, a quilometragem e os intervalos de confiança.
8. Segurança significa restringir a inteligência
Mesmo uma ação candidata a com alta utilidade deve ser rejeitada quando viola uma restrição de segurança C_j:
Se A_{safe} estiver vazio, o sistema deve expor a falha de planejamento e entrar em uma estratégia de risco mínimo. As restrições podem abranger margem de colisão, espaço de parada garantido, saída da estrada, estabilidade do veículo, sinais, direito de passagem e limites do atuador. Os manuais de regras ajudam a definir a prioridade quando o progresso, a cortesia, a lei e a segurança não podem ser otimizados como um único escalar opaco.
A ISO 26262 aborda os riscos causados por mau funcionamento elétrico/eletrônico. A ISO 21448, SOTIF, aborda o risco irrazoável decorrente de insuficiência funcional ou de especificação, mesmo sem uma falha de componente — por exemplo, uma limitação de percepção em neblina ou um gesto mal interpretado de um operário da construção civil. A cibersegurança é uma dimensão adicional: um mapa falsificado ou uma entrada V2X enganosa pode levar um planejador sem falhas ao perigo. Como explica o Guia Introdutório V2X, uma assinatura válida autentica a origem e a integridade, não a veracidade física de uma mensagem.
Um supervisor de segurança independente deve evitar compartilhar todas as suposições e modos de falha com o planejador principal. Ele pode monitorar o tempo até a colisão, o espaço disponível, a velocidade, o erro de rastreamento, o prazo de computação e a integridade dos sensores, e então substituir o comportamento normal. Rotas de contingência e de emergência exigem revalidação sempre que o planejador normal for alterado.
9. A avaliação precisa de mais do que uma taxa de sucesso
-
Segurança: colisões, tempo mínimo até a colisão (TTC), tempo de reação, margem de parada, evasões graves.
-
Regras e interação social: sinais, linhas de parada, prioridade, ceder a passagem, agressividade e cautela excessiva.
-
Conforto: aceleração, aceleração lateral, taxa de guinada e solavanco j=da/dt.
- Progresso: taxa de chegada, tempo de viagem, impasses, paradas desnecessárias e replanejamentos.
-
Robustez: degradação sob chuva, ofuscamento, oclusão, mudança de mapa, latência e perda de sensor.
-
Rastreabilidade: ação selecionada reproduzível, alternativas rejeitadas, idade da entrada, versão da regra/modelo e margem de segurança.
Não oculte eventos raros em uma média. Mesmo uma estimativa simples de limite superior que trate a probabilidade de falha p como ensaios de Bernoulli independentes não permite que zero falhas observadas concluam p=0. Defina o nível de confiança e a exposição necessários com antecedência e ajuste a dificuldade do cenário à distribuição real de direção. Quilômetros em vias públicas fornecem exposição realista, mas amostram combinações raras e perigosas de forma ineficiente; portanto, combine-os com simulação, percursos fechados e reprodução de registros.
10. Um fluxo de trabalho experimental
-
Definir ODD e responsabilidade. Registre a classe da via, velocidade, clima, iluminação, mapeamento, conectividade, função do motorista e o limite de responsabilidade dos níveis 0 a 5. Aloque DDT, detecção e resposta de objetos e eventos e fallback usando o Guia Introdutório dos Níveis de Automação da SAE.
-
Definir o vocabulário de comportamento. Forneça condições explícitas de entrada, conclusão, aborto e tempo limite para parar, seguir, ceder a passagem, entrar na faixa, mudar de faixa e encostar.
-
Congelar as interfaces. Quadros de versão, carimbos de data/hora, covariância, modos de previsão, IDs de trajetória, confirmações de cancelamento e prazos de computação.
-
Inspecionar a estrutura de decisão. Encontre estados inalcançáveis, ciclos, inversões de prioridade, guardas simultaneamente verdadeiras e caminhos que não podem atingir uma condição de risco mínimo.
- Testar invariantes. Teste afirmações de propriedades, como "não cruzar uma linha vermelha de parada alcançável" e "não acelerar a partir de uma percepção expirada".
- Reproduzir registros. Mantenha a saída de percepção constante e compare as versões do planejador. A condução humana é uma evidência útil, mas não a única verdade absoluta.
- Explorar os limites do cenário. Varie a velocidade relativa, a oclusão, o atrito, a iluminação e a latência em ambos os lados dos limites de transição; use testes metamórficos para expor inversões irracionais.
- Injetar falhas. Remova câmeras, troque IDs de trilha, ignore o GNSS, desloque mapas, falsifique dados V2X, expire o MPC e limite os atuadores; verifique a degradação.
- Implantação em etapas. Passe da simulação para hardware-in-the-loop, percurso fechado, operação com motorista de segurança e serviço limitado com critérios de parada explícitos.
- Comparar simulação contrafactual e física. Quando a simulação estima o que aconteceria sem uma intervenção, exponha o erro do modelo e reproduza casos representativos em um percurso fechado.
- Rastrear mudanças. Uma atualização do modelo de percepção altera a distribuição do comportamento. Vincule requisitos, projeto, código, teste e alegação de segurança e, em seguida, escolha o escopo da regressão a partir do gráfico de dependência real.
O registro final deve dizer mais do que "mudança de faixa selecionada". Conecte os objetos com registro de data e hora, modos de crença ou previsão, ações candidatas, custos, margens de segurança, motivos de rejeição, comportamento selecionado, viabilidade a jusante, comando real e erro de rastreamento sob um único ID de rastreamento. Caso contrário, uma decisão isolada em campo não poderá ser reconstruída.
Um paradoxo útil: dirigir com segurança às vezes exige progresso
Um planejador ingênuo pode evitar uma colisão em uma captura de tela esperando indefinidamente em um cruzamento. No trânsito, hesitação excessiva bloqueia outros veículos, viola expectativas e pode provocar ultrapassagens inseguras. O erro oposto é tratar a leve desaceleração de outro veículo como uma promessa vinculativa de ceder a passagem.
O planejamento de comportamento é difícil porque outros usuários da via preveem e reagem ao veículo em questão. Avançar gradualmente altera a previsão deles; a resposta deles altera a crença do veículo em questão. Esse feedback explica a progressão da pesquisa, desde declarações condicionais até POMDPs (Probabilidades de Decisão de Ordem Máxima), teoria dos jogos e políticas aprendidas. Um sistema de produção ainda precisa traduzir essa sofisticação de volta em declarações testáveis: por que prosseguiu, qual observação o faria parar e qual margem restou?
Fontes primárias e relacionadas
- NHTSA: Tecnologias de Assistência ao Condutor
- NHTSA: Ordem Geral Permanente sobre Relatórios de Acidentes com ADS / ADAS Nível 2
- SAE J3016: Taxonomia e Definições para Termos Relacionados a Sistemas de Automação de Condução
- ISO 21448:2022 — Veículos rodoviários, Segurança da funcionalidade pretendida
- Subaru: Tecnologia de Assistência ao Condutor EyeSight
- Mercedes-Benz: DRIVE PILOT Nível 3 até 95 km/h
- Waymo Safety Impact Data Hub
- Colledanchise e Ögren: Árvores de Comportamento em Robótica e IA
- Kaelbling, Littman e Cassandra: Planejamento e Ação em Domínios Estocásticos Parcialmente Observáveis
- Shalev-Shwartz, Shammah e Shashua: Sobre um Modelo Formal de Carros Autônomos Seguros e Escaláveis
- Planejamento de Trajetória, Geração de Trajetória e MPC
Optar por ultrapassar é o mesmo que planejar uma curva?
O comportamento seleciona a manobra; o planejamento de caminho e trajetória a torna executável. Uma manobra permitida ainda precisa de uma trajetória viável.
Comentários
Entre na sua conta para continuar.
Ainda não há dados.