Contents — find the section you need
A família YOLO continua sendo uma das abordagens mais utilizadas para detecção prática de objetos, e seu desenvolvimento prossegue desde o YOLOv8 em 2023. Lançado pela Ultralytics em 10 de setembro de 2024, o YOLO11 mantém a mesma estrutura de “coluna vertebral → pescoço → cabeça” do YOLOv8, ao mesmo tempo que redesenha os blocos internos. Este artigo verifica o que o YOLO11 mudou e o que foi mantido, utilizando informações primárias da documentação oficial e dos arquivos YAML de definição do modelo, com equações e diagramas.
Este artigo é baseado na documentação oficial da Ultralytics (docs.ultralytics.com), nos arquivos de configuração do repositório oficial do GitHub e no preprint “YOLOv11 Demystified” (arXiv:2604.03349).
0. O que você aprenderá
- O que o YOLO11 mudou especificamente em relação ao YOLOv8, incluindo C3k2 e C2PSA
- Como o cabeçalho de detecção sem âncora prevê coordenadas, incluindo DFL
- As funções de perda e os métodos de aumento de dados usados para o treinamento
- Como a precisão, a contagem de parâmetros e a velocidade variam entre os cinco tamanhos n/s/m/l/x, usando medições oficiais
- Quando escolher o YOLO11 e quando considerar outra opção
1. O que é o YOLO11?
O YOLO11 é uma geração de modelos de detecção de objetos em tempo real desenvolvida e lançada pela Ultralytics. A nova arquitetura mantém o design de três estágios do YOLOv8, com sua estrutura de "coluna vertebral, pescoço e cabeça", substitui seus blocos de extração de características pelo recém-projetado C3k2 e adiciona o bloco de atenção espacial C2PSA ao final da coluna vertebral. A mesma arquitetura geral abrange detecção, segmentação, estimativa de pose, classificação, caixas delimitadoras orientadas (OBB) e rastreamento em uma única estrutura.
2. Por que essa reformulação foi necessária?
Na época, o YOLOv8 era amplamente utilizado como um detector de estágio único com um forte equilíbrio entre precisão e velocidade, mas duas áreas ainda apresentavam espaço para melhorias. A primeira era a eficiência de parâmetros. Se a mesma precisão pudesse ser alcançada com menos parâmetros e operações de ponto flutuante (FLOPs), a implementação em dispositivos de borda e robôs alimentados por bateria se tornaria mais prática. A segunda era a falta de um mecanismo explícito para aprender onde focar em um mapa de características. A coluna vertebral do YOLOv8 constrói características com convoluções, mas não possui um mecanismo dedicado para separar regiões importantes do fundo. C3k2 e C2PSA abordam essas duas questões, respectivamente.
3. Qual é a entrada?
Assim como muitos outros detectores YOLO, o YOLO11 recebe uma imagem RGB redimensionada e preenchida de tamanho fixo (640 × 640 pixels por padrão). Tanto durante o treinamento quanto na inferência, a entrada é tratada como um tensor [B, 3, H, W] em lote. Nenhum pré-processamento especial, como normalização proprietária ou divisão de patches, é necessário: as imagens após aumentos padrão, como Mosaic, são passadas diretamente para a estrutura de base.
4. O que ele prevê?
Para cada objeto na imagem, a saída contém uma classe, as coordenadas da caixa delimitadora e uma pontuação de confiança. O YOLO11 usa uma cabeça desacoplada que separa os ramos de classificação e regressão de caixa. Ele também é livre de âncoras, portanto, realiza a regressão direta das coordenadas sem caixas de ancoragem predefinidas. A ideia de prever a distância de cada ponto da grade até o limite do objeto conecta o YOLO11 à família FCOS de detectores sem âncora. A remoção de caixas predefinidas para diversas proporções e escalas reduz o ajuste de hiperparâmetros e pode melhorar a generalização para objetos com proporções extremas.
5. Arquitetura básica
Assim como o YOLOv8, o YOLO11 segue a estrutura de três estágios “coluna vertebral → pescoço → cabeça”. A mudança está no conteúdo desses estágios.
Figura 1 — Estrutura principal, pescoço e cabeça do YOLO11. As caixas azuis destacadas são as partes alteradas em relação ao YOLOv8. O C3k2 substitui o bloco básico tanto na estrutura principal quanto no pescoço, enquanto o C2PSA é adicionado ao final da estrutura principal, imediatamente após o SPPF.
A estrutura principal gera mapas de características em três resoluções: P3, P4 e P5. O pescoço (PAN-FPN: Rede de Agregação de Caminhos + Rede de Pirâmide de Características) funde características de alta e baixa resolução em ambas as direções, permitindo que a mesma rede detecte objetos pequenos e grandes. Esse esqueleto de fusão multiescala permanece inalterado em relação ao YOLOv8. A mudança foi a substituição do C2f pelo C3k2 como bloco básico, e a inserção do C2PSA na saída da rede principal.
6. Detalhes técnicos dos componentes
C3k2 — uma generalização do C2f
O YOLOv8 utilizava o bloco C2f, que possui uma estrutura CSP (Cross Stage Partial), como unidade básica. O C2f divide os canais de entrada em dois caminhos, envia um deles através de vários blocos Bottleneck, deixa o outro como um atalho e, em seguida, concatena ambas as saídas e as saídas intermediárias de cada Bottleneck antes de mesclá-las com uma convolução 1 × 1.
O YOLO11 mantém a ideia de repetir blocos internos, mas torna o tipo de bloco interno configurável. Na definição oficial do modelo (YAML), cada bloco dentro de C3k2 pode ser um dos seguintes, dependendo das flags do construtor:
- Um bloco
Bottlenecknormal (usado pelo modelo n pequeno) - Um bloco
C3k(uma estrutura C3 com tamanho de kernel configurável, usado comc3k=Truenos modelos m/l/x médio e grande) - Um par
Bottleneck + PSABlock(usado dentro do C2PSA no final da estrutura principal)
Em outras palavras, C3k2 é um bloco generalizado: ele mantém a ideia do C2f, permitindo que seus gargalos internos variem de blocos leves a blocos equipados com atenção, de acordo com o tamanho e o posicionamento do modelo. Um detalhe de implementação é que uma configuração YAML abrange todos os cinco tamanhos, n/s/m/l/x, alternando esses componentes internos.
C2PSA — adicionando atenção espacial à estrutura principal
C2PSA (Cross Stage Partial with Spatial Attention) é um novo bloco do YOLO11 inserido imediatamente após o SPPF (Spatial Pyramid Pooling - Fast, um módulo que expande o campo receptivo com múltiplos tamanhos de pooling). O C2PSA também segue uma estrutura CSP: um caminho passa por vários PSABlocks. Cada PSABlock combina autoatenção multi-cabeças (MHSA) e uma rede feedforward de duas camadas (FFN), conectada por caminhos residuais.
Aqui, x é a característica de entrada, \text{MHSA} é a autoatenção multi-cabeças e \text{FFN} é a rede feedforward de duas camadas. Em comparação com a arquitetura convolucional do YOLOv8, o C2PSA utiliza autoatenção para aprender diretamente as relações entre posições distantes em um mapa de características. Ele complementa o campo receptivo local da convolução e ajuda a concentrar o peso em regiões importantes da imagem.
Cabeçalho de detecção sem âncoras e DFL
O cabeçalho de detecção do YOLO11 separa a classificação e a regressão de caixa em ramos independentes. Ele não utiliza caixas de ancoragem predefinidas; em vez disso, cada ponto da grade no mapa de características prevê diretamente a distância até a borda do objeto. Para cada uma das quatro direções, o ramo de regressão de caixa gera uma distribuição de probabilidade sobre \text{reg\_max}=16 compartimentos discretos e utiliza seu valor esperado como a distância contínua. Essa é a ideia por trás da Perda Focal de Distribuição (DFL), herdada do YOLOv8 e proposta por Li et al. em “Perda Focal Generalizada” (NeurIPS 2020).
Em vez de regredir diretamente um único valor real para a distância até um limite, o modelo aprende uma distribuição discreta sobre intervalos prováveis. Isso torna o treinamento mais estável, permitindo que a distribuição expresse a incerteza para objetos com contornos ambíguos ou ocluídos. O YOLO11 também altera o ramo de classificação para usar convolução separável em profundidade, reduzindo a contagem de parâmetros e a computação em comparação com a convolução comum.
Funções de perda e receita de treinamento
A perda de treinamento do YOLO11 é uma soma ponderada da perda CIoU (IoU completo) para regressão de caixa, da perda DFL para a distribuição de coordenadas e da perda BCE (entropia cruzada binária) para classificação.
A perda CIoU avalia não apenas o IoU (taxa de sobreposição), mas também a distância entre os centros das caixas e o quão próximas suas proporções são.
\rho(b, b^{gt}) é a distância euclidiana entre os centros das caixas previstas e reais, c é o comprimento da diagonal do menor retângulo que engloba ambas as caixas, v representa a discrepância na proporção, e \alpha é um coeficiente que dá mais peso a v à medida que IoU aumenta. A otimização do IoU isoladamente praticamente não fornece gradiente quando as caixas não se sobrepõem; os termos de distância entre os centros e proporção mitigam esse problema.
O treinamento utiliza técnicas de aumento de dados, incluindo Mosaico, que une várias imagens; MixUp, que mescla duas imagens; Copiar e Colar, que cola uma região de um objeto em outra imagem; Aumento Aleatório, que seleciona automaticamente transformações aleatórias; e Apagamento, que remove uma região retangular aleatória. Esses detalhes seguem a descrição em “YOLOv11 Desmistificado” (arXiv:2604.03349).
7. Comparando variantes do modelo
O YOLO11 está disponível em cinco tamanhos com diferentes contagens de parâmetros e requisitos computacionais: n (nano), s (pequeno), m (médio), l (grande) e x (extragrande). Os valores de referência a seguir são relatados na documentação oficial da Ultralytics para o COCO val2017 com uma entrada de 640 px.
| Modelo | mAP50-95 | Parâmetros | FLOPs | Inferência ONNX da CPU | Inferência TensorRT T4 |
|---|---|---|---|---|---|
| YOLO11n | 39,5 | 2,6M | 6,5B | 56,1 ± 0,8 ms | 1,5 ± 0,0 ms |
| YOLO11s | 47,0 | 9,4M | 21,6B | 90,0 ± 1,2 ms | 2,5 ± 0,0 ms |
| YOLO11m | 51,5 | 20,1M | 68,1B | 183,2 ± 2,0 ms | 4,7 ± 0,1 ms |
| YOLO11l | 53,4 | 25,3M | 87,2B | 238,6 ± 1,4 ms | 6,2 ± 0,1 ms |
| YOLO11x | 54,7 | 56,9M | 195,3B | 462,8 ± 6,7 ms | 11,3 ± 0,2 ms |
Fonte: Documentação oficial do Ultralytics YOLO11. A inferência ONNX na CPU utiliza o ONNX Runtime; a inferência TensorRT T4 é FP16 em uma GPU NVIDIA T4.
Dois pontos práticos se destacam. Primeiro, a contagem de parâmetros aumenta cerca de 22 vezes de n para x, enquanto o mAP50-95 aumenta apenas cerca de 15 pontos, de 39,5 para 54,7: a acurácia e o tamanho do modelo não estão linearmente relacionados. Segundo, considere a diferença entre m e l. Os parâmetros aumentam apenas de 20,1 milhões para 25,3 milhões, enquanto o mAP aumenta de 51,5 para 53,4 e o tempo de inferência na GPU de 4,7 ms para 6,2 ms. O retorno ao passar de m para l é, portanto, um pouco menor do que nas etapas n → s → m. Esses números suportam n/s para implantação na borda e l/x para sistemas fixos onde a precisão é prioritária.
Comparação quantitativa com YOLOv8
Colocar os valores do YOLOv8 relatados na mesma documentação da Ultralytics ao lado dos valores do YOLOv11 torna a mudança geracional mais concreta.
| Modelo | mAP50-95 (v8 → v11) | Parâmetros (v8 → v11) | FLOPs (v8 → v11) | Inferência ONNX da CPU (v8 → v11) |
|---|---|---|---|---|
| n | 37,3 → 39,5 | 3,2M → 2,6M | 8,7B → 6,5B | 80,4ms → 56,1ms |
| s | 44,9 → 47,0 | 11,2 milhões → 9,4 milhões | 28,6B → 21,6B | 128,4 ms → 90,0 ms |
| m | 50,2 → 51,5 | 25,9 milhões → 20,1 milhões | 78,9B → 68,1B | 234,7 ms → 183,2 ms |
| eu | 52,9 → 53,4 | 43,7 milhões → 25,3 milhões | 165,1B → 87,2B | 375,2 ms → 238,6 ms |
| x | 53,9 → 54,7 | 68,2M → 56,9M | 257,8B → 195,3B | 479,1ms → 462,8ms |
Fonte: Documentação oficial do YOLOv8 e Documentação oficial do YOLO11 (COCO val2017, 640 px, inferência ONNX na CPU para ambos).
Para o tamanho l, a contagem de parâmetros cai de 43,7M para 25,3M, quase pela metade, enquanto o mAP melhora ligeiramente. É aqui que o efeito de eficiência de parâmetros do C3k2 e do C2PSA é mais visível. Para x, os parâmetros e as operações de ponto flutuante (FLOPs) caem substancialmente, mas o tempo de inferência na CPU melhora apenas ligeiramente, sugerindo que o cálculo de autoatenção no C2PSA pode se tornar um gargalo para modelos grandes.
Em resumo, o YOLO11 busca atingir um mAP pelo menos comparável com menos parâmetros e operações de ponto flutuante (FLOPs) do que o YOLOv8. Isso não significa que ele sempre supere o YOLOv8: dependendo da tarefa e do conjunto de dados, a geração anterior ainda pode apresentar uma acurácia absoluta maior. O artigo sobre tendências em detecção de objetos também aborda esse ponto.
Expandindo o YOLO11 além da detecção
O YOLO11 não se limita à detecção de objetos. Ao substituir apenas a cabeça, mantendo a mesma coluna vertebral e pescoço, a estrutura abrange segmentação de instâncias (YOLO11-seg), estimativa de pose (YOLO11-pose, que realiza regressão das coordenadas dos pontos-chave), classificação (YOLO11-cls), detecção de caixas delimitadoras orientadas (YOLO11-obb, que também realiza regressão da orientação de objetos inclinados) e rastreamento em múltiplos quadros. Como o C3k2 e o C2PSA aprimoram a estrutura, seus benefícios são compartilhados entre essas tarefas. Isso também demonstra que o YOLO11 foi projetado como uma base comum para reconhecimento visual, e não apenas como um modelo de detecção.
8. Suas dificuldades
O YOLO11 mantém as fraquezas comuns à família YOLO. Objetos pequenos e distantes continuam sendo um desafio. Como a arquitetura de backbone reduz gradualmente a resolução, um objeto com apenas alguns pixels de largura pode perder quase todas as suas características distintivas ao atingir camadas mais profundas. O C2PSA atenua parcialmente esse problema, mas não o resolve fundamentalmente.
Cenas densas com muitos objetos semelhantes também representam um desafio. O DFL e o CIoU melhoram a regressão de limites, mas objetos vizinhos cujos limites se sobrepõem, como uma multidão ou frutas densamente agrupadas em um pomar, ainda podem produzir detecções falsas e falhas de detecção.
Sensibilidade à mudança de domínio é um problema geral para detectores baseados em CNN. A precisão pode cair drasticamente sob condições de iluminação, clima ou ângulos de câmera que diferem substancialmente dos dados de treinamento. O C2PSA não oferece um campo receptivo tão amplo quanto a família DETR baseada em Transformers, portanto, o YOLO11 pode ser menos robusto nesse aspecto.
O YOLO11 também é distribuído sob a licença AGPL-3.0. Se uma implementação comercial exigir a manutenção do código-fonte privado, a Licença Empresarial da Ultralytics é necessária. Isso não é uma deficiência técnica, mas sim uma limitação prática que pode ser facilmente ignorada.
9. Como escolher na prática
Para dispositivos de borda e robôs alimentados por bateria, a velocidade de inferência e a quantidade de parâmetros geralmente são limitações, tornando o YOLO11n/s a primeira opção. O tempo de inferência de CPU de aproximadamente 56 ms do modelo n pode tornar a operação viável em hardware embarcado do tipo Raspberry Pi, dependendo do restante do sistema.
Para inspeção aérea com drones e outras plataformas móveis, a detecção de pequenos objetos é fundamental. Em vez de simplesmente escolher um modelo YOLO11 maior, aumente a resolução de entrada ou use inferência em mosaico. Alguns relatórios indicam que as variantes DETR com atenção deformável apresentam vantagem nessa área, portanto, o RT-DETR e outras famílias são comparações razoáveis quando a precisão é a prioridade.
Para inspeção com câmeras fixas em armazéns ou fábricas, o YOLO11l/x são opções quando os recursos da GPU estão disponíveis e a precisão é a prioridade. Mesmo nesse caso, detectores baseados em Transformer, como o RF-DETR, apresentaram mais de 60 mAP no COCO, portanto, o YOLO não é mais a única escolha. Consulte o artigo sobre tendências em detecção de objetos para obter mais detalhes.
Para pesquisa e prototipagem, a maturidade do pacote Python da Ultralytics é um motivo prático para escolher o YOLO11: treinamento, inferência e exportação podem ser expressos em poucas linhas. Onde suas restrições de licenciamento forem aceitáveis, a rapidez para obter uma linha de base funcional continua sendo um grande ponto forte.
10. Resumo em três linhas
-
O YOLO11 mantém a estrutura básica do YOLOv8 (corpo, pescoço e cabeça), substitui seus blocos básicos pelo C3k2 e adiciona atenção espacial por meio do C2PSA.
-
Sua cabeça sem âncoras prevê distâncias de contorno como o valor esperado das distribuições DFL, enquanto o CIoU otimiza conjuntamente a sobreposição, a distância do centro e a proporção.
-
A eficiência dos parâmetros melhora de n para x, mas objetos pequenos, cenas densas e mudança de domínio continuam sendo desafios comuns para os detectores da família YOLO.
Para uma introdução mais fundamental à detecção de objetos e segmentação semântica, consulte Detecção de Objetos e Segmentação Semântica: Uma Introdução. Para tendências atuais na família YOLO, incluindo abordagens sem NMS e a concorrência de modelos DETR, consulte o artigo sobre tendências de detecção de objetos.
Referências
- Documentação oficial do Ultralytics YOLO11
- Ultralytics: Guia de arquitetura YOLO
- Ultralytics: Benefícios do YOLO11 como detector sem âncoras
- Configuração oficial do modelo YOLO11 (GitHub)
- YOLOv11 Desmistificado: Um Guia Prático para Detecção de Objetos de Alto Desempenho (arXiv:2604.03349)
- Perda Focal Generalizada: Aprendendo Caixas Delimitadoras Qualificadas e Distribuídas para Detecção Densa de Objetos (NeurIPS 2020, arXiv:2006.04388)
- Licenciamento Ultralytics
Uma alta pontuação de detecção garante que a posição e a classe estejam corretas?
Uma pontuação é uma saída do modelo, não uma garantia de correção. Avalie a precisão e a revocação em diferentes limites separadamente da precisão de localização das caixas detectadas.
Comentários
Entre na sua conta para continuar.
Ainda não há dados.