Multi-Head Attention

Meccanismo che permette al modello di focalizzarsi su diverse parti dell'input simultaneamente attraverso molteplici teste di attenzione.

Il multi-head attention usa più meccanismi di attenzione in parallelo, ognuno che impara pattern diversi. Fondamentale nei Transformer. Tipicamente 8-16 heads.

Esempi

  • BERT con 12 attention heads
  • GPT con 96 heads (large)
  • Transformer encoder-decoder