AI Multimodale

/ˌmʌltɪˈmoʊdəl/

Sistemi AI che possono processare e correlare informazioni da modalità multiple come testo, immagini, audio e video.

In English: Multimodal AI

I modelli multimodali apprendono rappresentazioni congiunte tra modalità. Esempi includono CLIP (visione-linguaggio), Flamingo (visual question answering) e GPT-4V (comprensione visione).

Esempi

  • CLIP che matcha immagini a testo
  • GPT-4V che descrive immagini
  • Sistemi di image captioning