CLIP (Contrastive Language-Image Pre-training)
/klɪp/
Un modello multimodale addestrato per comprendere relazioni tra immagini e testo.
In English: CLIP (Contrastive Language-Image Pre-training)CLIP apprende embedding congiunti di immagini e testo attraverso contrastive learning su 400M coppie immagine-testo. Permette classificazione immagini zero-shot e alimenta molte applicazioni vision-language.
Esempi
- Classificazione immagini zero-shot
- Ricerca immagini per testo
- Conditioning per text-to-image generation