Contents — find the section you need

A família YOLO continua sendo uma das abordagens mais utilizadas para detecção prática de objetos, e seu desenvolvimento prossegue desde o YOLOv8 em 2023. Lançado pela Ultralytics em 10 de setembro de 2024, o YOLO11 mantém a mesma estrutura de “coluna vertebral → pescoço → cabeça” do YOLOv8, ao mesmo tempo que redesenha os blocos internos. Este artigo verifica o que o YOLO11 mudou e o que foi mantido, utilizando informações primárias da documentação oficial e dos arquivos YAML de definição do modelo, com equações e diagramas.

Este artigo é baseado na documentação oficial da Ultralytics (docs.ultralytics.com), nos arquivos de configuração do repositório oficial do GitHub e no preprint “YOLOv11 Demystified” (arXiv:2604.03349).

0. O que você aprenderá

  • O que o YOLO11 mudou especificamente em relação ao YOLOv8, incluindo C3k2 e C2PSA
  • Como o cabeçalho de detecção sem âncora prevê coordenadas, incluindo DFL
  • As funções de perda e os métodos de aumento de dados usados para o treinamento
  • Como a precisão, a contagem de parâmetros e a velocidade variam entre os cinco tamanhos n/s/m/l/x, usando medições oficiais
  • Quando escolher o YOLO11 e quando considerar outra opção

1. O que é o YOLO11?

O YOLO11 é uma geração de modelos de detecção de objetos em tempo real desenvolvida e lançada pela Ultralytics. A nova arquitetura mantém o design de três estágios do YOLOv8, com sua estrutura de "coluna vertebral, pescoço e cabeça", substitui seus blocos de extração de características pelo recém-projetado C3k2 e adiciona o bloco de atenção espacial C2PSA ao final da coluna vertebral. A mesma arquitetura geral abrange detecção, segmentação, estimativa de pose, classificação, caixas delimitadoras orientadas (OBB) e rastreamento em uma única estrutura.

2. Por que essa reformulação foi necessária?

Na época, o YOLOv8 era amplamente utilizado como um detector de estágio único com um forte equilíbrio entre precisão e velocidade, mas duas áreas ainda apresentavam espaço para melhorias. A primeira era a eficiência de parâmetros. Se a mesma precisão pudesse ser alcançada com menos parâmetros e operações de ponto flutuante (FLOPs), a implementação em dispositivos de borda e robôs alimentados por bateria se tornaria mais prática. A segunda era a falta de um mecanismo explícito para aprender onde focar em um mapa de características. A coluna vertebral do YOLOv8 constrói características com convoluções, mas não possui um mecanismo dedicado para separar regiões importantes do fundo. C3k2 e C2PSA abordam essas duas questões, respectivamente.

3. Qual é a entrada?

Assim como muitos outros detectores YOLO, o YOLO11 recebe uma imagem RGB redimensionada e preenchida de tamanho fixo (640 × 640 pixels por padrão). Tanto durante o treinamento quanto na inferência, a entrada é tratada como um tensor [B, 3, H, W] em lote. Nenhum pré-processamento especial, como normalização proprietária ou divisão de patches, é necessário: as imagens após aumentos padrão, como Mosaic, são passadas diretamente para a estrutura de base.

4. O que ele prevê?

Para cada objeto na imagem, a saída contém uma classe, as coordenadas da caixa delimitadora e uma pontuação de confiança. O YOLO11 usa uma cabeça desacoplada que separa os ramos de classificação e regressão de caixa. Ele também é livre de âncoras, portanto, realiza a regressão direta das coordenadas sem caixas de ancoragem predefinidas. A ideia de prever a distância de cada ponto da grade até o limite do objeto conecta o YOLO11 à família FCOS de detectores sem âncora. A remoção de caixas predefinidas para diversas proporções e escalas reduz o ajuste de hiperparâmetros e pode melhorar a generalização para objetos com proporções extremas.

5. Arquitetura básica

Assim como o YOLOv8, o YOLO11 segue a estrutura de três estágios “coluna vertebral → pescoço → cabeça”. A mudança está no conteúdo desses estágios.

Diagram 1 · Use the button to switch views
YOLO11 basic pipeline Flow from a 640 by 640 input image through a backbone containing C3k2 blocks, SPPF, and C2PSA spatial attention, into multi-scale P3/P4/P5 features, bidirectional fusion in a PAN-FPN neck, and an anchor-free detection head. Input image 640×640 Backbone C3k2 blocks SPPF C2PSA (spatial attention) Multi-scale P3/P4/P5 Neck PAN-FPN C3k2 blocks High- and low-level features fused both ways Head Anchor-free Box branch: DFL Cls branch: depthwise separable convolution Class + box coordinates + confidence

Figura 1 — Estrutura principal, pescoço e cabeça do YOLO11. As caixas azuis destacadas são as partes alteradas em relação ao YOLOv8. O C3k2 substitui o bloco básico tanto na estrutura principal quanto no pescoço, enquanto o C2PSA é adicionado ao final da estrutura principal, imediatamente após o SPPF.

A estrutura principal gera mapas de características em três resoluções: P3, P4 e P5. O pescoço (PAN-FPN: Rede de Agregação de Caminhos + Rede de Pirâmide de Características) funde características de alta e baixa resolução em ambas as direções, permitindo que a mesma rede detecte objetos pequenos e grandes. Esse esqueleto de fusão multiescala permanece inalterado em relação ao YOLOv8. A mudança foi a substituição do C2f pelo C3k2 como bloco básico, e a inserção do C2PSA na saída da rede principal.

6. Detalhes técnicos dos componentes

C3k2 — uma generalização do C2f

O YOLOv8 utilizava o bloco C2f, que possui uma estrutura CSP (Cross Stage Partial), como unidade básica. O C2f divide os canais de entrada em dois caminhos, envia um deles através de vários blocos Bottleneck, deixa o outro como um atalho e, em seguida, concatena ambas as saídas e as saídas intermediárias de cada Bottleneck antes de mesclá-las com uma convolução 1 × 1.

O YOLO11 mantém a ideia de repetir blocos internos, mas torna o tipo de bloco interno configurável. Na definição oficial do modelo (YAML), cada bloco dentro de C3k2 pode ser um dos seguintes, dependendo das flags do construtor:

  1. Um bloco Bottleneck normal (usado pelo modelo n pequeno)
  2. Um bloco C3k (uma estrutura C3 com tamanho de kernel configurável, usado com c3k=True nos modelos m/l/x médio e grande)
  3. Um par Bottleneck + PSABlock (usado dentro do C2PSA no final da estrutura principal)

Em outras palavras, C3k2 é um bloco generalizado: ele mantém a ideia do C2f, permitindo que seus gargalos internos variem de blocos leves a blocos equipados com atenção, de acordo com o tamanho e o posicionamento do modelo. Um detalhe de implementação é que uma configuração YAML abrange todos os cinco tamanhos, n/s/m/l/x, alternando esses componentes internos.

C2PSA — adicionando atenção espacial à estrutura principal

C2PSA (Cross Stage Partial with Spatial Attention) é um novo bloco do YOLO11 inserido imediatamente após o SPPF (Spatial Pyramid Pooling - Fast, um módulo que expande o campo receptivo com múltiplos tamanhos de pooling). O C2PSA também segue uma estrutura CSP: um caminho passa por vários PSABlocks. Cada PSABlock combina autoatenção multi-cabeças (MHSA) e uma rede feedforward de duas camadas (FFN), conectada por caminhos residuais.

z = x + \text{MHSA}(x), \qquad y = z + \text{FFN}(z)

Aqui, x é a característica de entrada, \text{MHSA} é a autoatenção multi-cabeças e \text{FFN} é a rede feedforward de duas camadas. Em comparação com a arquitetura convolucional do YOLOv8, o C2PSA utiliza autoatenção para aprender diretamente as relações entre posições distantes em um mapa de características. Ele complementa o campo receptivo local da convolução e ajuda a concentrar o peso em regiões importantes da imagem.

Cabeçalho de detecção sem âncoras e DFL

O cabeçalho de detecção do YOLO11 separa a classificação e a regressão de caixa em ramos independentes. Ele não utiliza caixas de ancoragem predefinidas; em vez disso, cada ponto da grade no mapa de características prevê diretamente a distância até a borda do objeto. Para cada uma das quatro direções, o ramo de regressão de caixa gera uma distribuição de probabilidade sobre \text{reg\_max}=16 compartimentos discretos e utiliza seu valor esperado como a distância contínua. Essa é a ideia por trás da Perda Focal de Distribuição (DFL), herdada do YOLOv8 e proposta por Li et al. em “Perda Focal Generalizada” (NeurIPS 2020).

\hat{d} = \sum_{i=0}^{\text{reg\_max}-1} P(i) \cdot i, \qquad \sum_{i=0}^{\text{reg\_max}-1} P(i) = 1

Em vez de regredir diretamente um único valor real para a distância até um limite, o modelo aprende uma distribuição discreta sobre intervalos prováveis. Isso torna o treinamento mais estável, permitindo que a distribuição expresse a incerteza para objetos com contornos ambíguos ou ocluídos. O YOLO11 também altera o ramo de classificação para usar convolução separável em profundidade, reduzindo a contagem de parâmetros e a computação em comparação com a convolução comum.

Funções de perda e receita de treinamento

A perda de treinamento do YOLO11 é uma soma ponderada da perda CIoU (IoU completo) para regressão de caixa, da perda DFL para a distribuição de coordenadas e da perda BCE (entropia cruzada binária) para classificação.

\mathcal{L} = \lambda_{box}\,\mathcal{L}_{CIoU} + \lambda_{dfl}\,\mathcal{L}_{DFL} + \lambda_{cls}\,\mathcal{L}_{BCE}

A perda CIoU avalia não apenas o IoU (taxa de sobreposição), mas também a distância entre os centros das caixas e o quão próximas suas proporções são.

\mathcal{L}_{CIoU} = 1 - IoU + \frac{\rho^2(b, b^{gt})}{c^2} + \alpha v, \qquad v = \frac{4}{\pi^2}\left(\arctan\frac{w^{gt}}{h^{gt}} - \arctan\frac{w}{h}\right)^2

\rho(b, b^{gt}) é a distância euclidiana entre os centros das caixas previstas e reais, c é o comprimento da diagonal do menor retângulo que engloba ambas as caixas, v representa a discrepância na proporção, e \alpha é um coeficiente que dá mais peso a v à medida que IoU aumenta. A otimização do IoU isoladamente praticamente não fornece gradiente quando as caixas não se sobrepõem; os termos de distância entre os centros e proporção mitigam esse problema.

O treinamento utiliza técnicas de aumento de dados, incluindo Mosaico, que une várias imagens; MixUp, que mescla duas imagens; Copiar e Colar, que cola uma região de um objeto em outra imagem; Aumento Aleatório, que seleciona automaticamente transformações aleatórias; e Apagamento, que remove uma região retangular aleatória. Esses detalhes seguem a descrição em “YOLOv11 Desmistificado” (arXiv:2604.03349).

7. Comparando variantes do modelo

O YOLO11 está disponível em cinco tamanhos com diferentes contagens de parâmetros e requisitos computacionais: n (nano), s (pequeno), m (médio), l (grande) e x (extragrande). Os valores de referência a seguir são relatados na documentação oficial da Ultralytics para o COCO val2017 com uma entrada de 640 px.

Modelo mAP50-95 Parâmetros FLOPs Inferência ONNX da CPU Inferência TensorRT T4
YOLO11n 39,5 2,6M 6,5B 56,1 ± 0,8 ms 1,5 ± 0,0 ms
YOLO11s 47,0 9,4M 21,6B 90,0 ± 1,2 ms 2,5 ± 0,0 ms
YOLO11m 51,5 20,1M 68,1B 183,2 ± 2,0 ms 4,7 ± 0,1 ms
YOLO11l 53,4 25,3M 87,2B 238,6 ± 1,4 ms 6,2 ± 0,1 ms
YOLO11x 54,7 56,9M 195,3B 462,8 ± 6,7 ms 11,3 ± 0,2 ms

Fonte: Documentação oficial do Ultralytics YOLO11. A inferência ONNX na CPU utiliza o ONNX Runtime; a inferência TensorRT T4 é FP16 em uma GPU NVIDIA T4.

Dois pontos práticos se destacam. Primeiro, a contagem de parâmetros aumenta cerca de 22 vezes de n para x, enquanto o mAP50-95 aumenta apenas cerca de 15 pontos, de 39,5 para 54,7: a acurácia e o tamanho do modelo não estão linearmente relacionados. Segundo, considere a diferença entre m e l. Os parâmetros aumentam apenas de 20,1 milhões para 25,3 milhões, enquanto o mAP aumenta de 51,5 para 53,4 e o tempo de inferência na GPU de 4,7 ms para 6,2 ms. O retorno ao passar de m para l é, portanto, um pouco menor do que nas etapas n → s → m. Esses números suportam n/s para implantação na borda e l/x para sistemas fixos onde a precisão é prioritária.

Comparação quantitativa com YOLOv8

Colocar os valores do YOLOv8 relatados na mesma documentação da Ultralytics ao lado dos valores do YOLOv11 torna a mudança geracional mais concreta.

Modelo mAP50-95 (v8 → v11) Parâmetros (v8 → v11) FLOPs (v8 → v11) Inferência ONNX da CPU (v8 → v11)
n 37,3 → 39,5 3,2M → 2,6M 8,7B → 6,5B 80,4ms → 56,1ms
s 44,9 → 47,0 11,2 milhões → 9,4 milhões 28,6B → 21,6B 128,4 ms → 90,0 ms
m 50,2 → 51,5 25,9 milhões → 20,1 milhões 78,9B → 68,1B 234,7 ms → 183,2 ms
eu 52,9 → 53,4 43,7 milhões → 25,3 milhões 165,1B → 87,2B 375,2 ms → 238,6 ms
x 53,9 → 54,7 68,2M → 56,9M 257,8B → 195,3B 479,1ms → 462,8ms

Fonte: Documentação oficial do YOLOv8 e Documentação oficial do YOLO11 (COCO val2017, 640 px, inferência ONNX na CPU para ambos).

Para o tamanho l, a contagem de parâmetros cai de 43,7M para 25,3M, quase pela metade, enquanto o mAP melhora ligeiramente. É aqui que o efeito de eficiência de parâmetros do C3k2 e do C2PSA é mais visível. Para x, os parâmetros e as operações de ponto flutuante (FLOPs) caem substancialmente, mas o tempo de inferência na CPU melhora apenas ligeiramente, sugerindo que o cálculo de autoatenção no C2PSA pode se tornar um gargalo para modelos grandes.

Em resumo, o YOLO11 busca atingir um mAP pelo menos comparável com menos parâmetros e operações de ponto flutuante (FLOPs) do que o YOLOv8. Isso não significa que ele sempre supere o YOLOv8: dependendo da tarefa e do conjunto de dados, a geração anterior ainda pode apresentar uma acurácia absoluta maior. O artigo sobre tendências em detecção de objetos também aborda esse ponto.

Expandindo o YOLO11 além da detecção

O YOLO11 não se limita à detecção de objetos. Ao substituir apenas a cabeça, mantendo a mesma coluna vertebral e pescoço, a estrutura abrange segmentação de instâncias (YOLO11-seg), estimativa de pose (YOLO11-pose, que realiza regressão das coordenadas dos pontos-chave), classificação (YOLO11-cls), detecção de caixas delimitadoras orientadas (YOLO11-obb, que também realiza regressão da orientação de objetos inclinados) e rastreamento em múltiplos quadros. Como o C3k2 e o C2PSA aprimoram a estrutura, seus benefícios são compartilhados entre essas tarefas. Isso também demonstra que o YOLO11 foi projetado como uma base comum para reconhecimento visual, e não apenas como um modelo de detecção.

8. Suas dificuldades

O YOLO11 mantém as fraquezas comuns à família YOLO. Objetos pequenos e distantes continuam sendo um desafio. Como a arquitetura de backbone reduz gradualmente a resolução, um objeto com apenas alguns pixels de largura pode perder quase todas as suas características distintivas ao atingir camadas mais profundas. O C2PSA atenua parcialmente esse problema, mas não o resolve fundamentalmente.

Cenas densas com muitos objetos semelhantes também representam um desafio. O DFL e o CIoU melhoram a regressão de limites, mas objetos vizinhos cujos limites se sobrepõem, como uma multidão ou frutas densamente agrupadas em um pomar, ainda podem produzir detecções falsas e falhas de detecção.

Sensibilidade à mudança de domínio é um problema geral para detectores baseados em CNN. A precisão pode cair drasticamente sob condições de iluminação, clima ou ângulos de câmera que diferem substancialmente dos dados de treinamento. O C2PSA não oferece um campo receptivo tão amplo quanto a família DETR baseada em Transformers, portanto, o YOLO11 pode ser menos robusto nesse aspecto.

O YOLO11 também é distribuído sob a licença AGPL-3.0. Se uma implementação comercial exigir a manutenção do código-fonte privado, a Licença Empresarial da Ultralytics é necessária. Isso não é uma deficiência técnica, mas sim uma limitação prática que pode ser facilmente ignorada.

9. Como escolher na prática

Para dispositivos de borda e robôs alimentados por bateria, a velocidade de inferência e a quantidade de parâmetros geralmente são limitações, tornando o YOLO11n/s a primeira opção. O tempo de inferência de CPU de aproximadamente 56 ms do modelo n pode tornar a operação viável em hardware embarcado do tipo Raspberry Pi, dependendo do restante do sistema.

Para inspeção aérea com drones e outras plataformas móveis, a detecção de pequenos objetos é fundamental. Em vez de simplesmente escolher um modelo YOLO11 maior, aumente a resolução de entrada ou use inferência em mosaico. Alguns relatórios indicam que as variantes DETR com atenção deformável apresentam vantagem nessa área, portanto, o RT-DETR e outras famílias são comparações razoáveis quando a precisão é a prioridade.

Para inspeção com câmeras fixas em armazéns ou fábricas, o YOLO11l/x são opções quando os recursos da GPU estão disponíveis e a precisão é a prioridade. Mesmo nesse caso, detectores baseados em Transformer, como o RF-DETR, apresentaram mais de 60 mAP no COCO, portanto, o YOLO não é mais a única escolha. Consulte o artigo sobre tendências em detecção de objetos para obter mais detalhes.

Para pesquisa e prototipagem, a maturidade do pacote Python da Ultralytics é um motivo prático para escolher o YOLO11: treinamento, inferência e exportação podem ser expressos em poucas linhas. Onde suas restrições de licenciamento forem aceitáveis, a rapidez para obter uma linha de base funcional continua sendo um grande ponto forte.

10. Resumo em três linhas

  • O YOLO11 mantém a estrutura básica do YOLOv8 (corpo, pescoço e cabeça), substitui seus blocos básicos pelo C3k2 e adiciona atenção espacial por meio do C2PSA.

  • Sua cabeça sem âncoras prevê distâncias de contorno como o valor esperado das distribuições DFL, enquanto o CIoU otimiza conjuntamente a sobreposição, a distância do centro e a proporção.

  • A eficiência dos parâmetros melhora de n para x, mas objetos pequenos, cenas densas e mudança de domínio continuam sendo desafios comuns para os detectores da família YOLO.

Para uma introdução mais fundamental à detecção de objetos e segmentação semântica, consulte Detecção de Objetos e Segmentação Semântica: Uma Introdução. Para tendências atuais na família YOLO, incluindo abordagens sem NMS e a concorrência de modelos DETR, consulte o artigo sobre tendências de detecção de objetos.

Referências

Verifique seu entendimento
Uma alta pontuação de detecção garante que a posição e a classe estejam corretas?

Uma pontuação é uma saída do modelo, não uma garantia de correção. Avalie a precisão e a revocação em diferentes limites separadamente da precisão de localização das caixas detectadas.

What to read next

Review the backgroundIntrodução à Detecção de Objetos e Segmentação Semântica — Lendo "O que está onde" em uma imagemContinue the seriesUm guia completo para o SegFormer — Por que um Transformer sem codificação posicional funciona para segmentaçãoExplore another aspect of this fieldAvaliação comparativa de LLMs locais: primeira resposta, taxa de geração e memória.