Adagrad

Ottimizzatore con learning rate adattivo che adatta rate per parametro basandosi su gradienti storici.

In English: Adagrad

Accumula gradienti al quadrato, accumulazione più grande significa learning rate più piccolo. Buono per dati sparsi. Può avere learning rate diminuenti nel tempo.

Esempi

  • Ottimizzazione gradienti sparsi
  • Embedding NLP
  • Problemi convessi