Multi-Head Attention
Meccanismo che permette al modello di focalizzarsi su diverse parti dell'input simultaneamente attraverso molteplici teste di attenzione.
Il multi-head attention usa più meccanismi di attenzione in parallelo, ognuno che impara pattern diversi. Fondamentale nei Transformer. Tipicamente 8-16 heads.
Esempi
- BERT con 12 attention heads
- GPT con 96 heads (large)
- Transformer encoder-decoder