CLIP (Contrastive Language-Image Pre-training)

/klɪp/

Un modello multimodale addestrato per comprendere relazioni tra immagini e testo.

In English: CLIP (Contrastive Language-Image Pre-training)

CLIP apprende embedding congiunti di immagini e testo attraverso contrastive learning su 400M coppie immagine-testo. Permette classificazione immagini zero-shot e alimenta molte applicazioni vision-language.

Esempi

  • Classificazione immagini zero-shot
  • Ricerca immagini per testo
  • Conditioning per text-to-image generation