ViT (Vision Transformer)

Architettura Transformer adattata per computer vision trattando patch immagini come token.

In English: ViT (Vision Transformer)

Divide immagini in patch (16x16), le appiattisce e proietta, aggiunge positional encoding. Transformer puro senza convoluzioni. Richiede dataset grandi.

Esempi

  • Classificazione immagini
  • Alternativa a CNN
  • ViT-Base, ViT-Large