AI Multimodale
/ˌmʌltɪˈmoʊdəl/
Sistemi AI che possono processare e correlare informazioni da modalità multiple come testo, immagini, audio e video.
In English: Multimodal AII modelli multimodali apprendono rappresentazioni congiunte tra modalità. Esempi includono CLIP (visione-linguaggio), Flamingo (visual question answering) e GPT-4V (comprensione visione).
Esempi
- CLIP che matcha immagini a testo
- GPT-4V che descrive immagini
- Sistemi di image captioning