Architetture

Paesaggi di Ottimizzazione nelle Reti Neurali

Il paesaggio di loss delle reti profonde è ad alta dimensionalità, non-convesso e pieno di minimi locali. Eppure il gradient descent trova buone soluzioni.

L’addestramento delle reti neurali non dovrebbe funzionare. Il problema di ottimizzazione è non-convesso con milioni di parametri. Eppure non lo fa.

Una rete con un milione di parametri definisce una funzione di loss su uno spazio a un milione di dimensioni. Visualizzare questo è impossibile.

In alta dimensionalità, la geometria cambia. I minimi locali diventano rari. I saddle points abbondano.

Nelle reti neurali profonde, i “cattivi” minimi locali sono statisticamente rari. La maggior parte dei minimi critici ha loss simile ai minimi globali.

Una scoperta sorprendente: differenti minimi che l’addestramento trova sono connessi da percorsi a bassa loss.

Capire i paesaggi di ottimizzazione informa scelte di addestramento: inizializzazione, architettura, batch size, learning rate.

La geometria conta. Il design architetturale plasma il paesaggio di loss. Buone architetture creano paesaggi più facili da navigare.

Optimization in deep learning funziona not despite the landscape’s complexity, but in some sense because of it. High dimensionality creates geometry that gradient descent can navigate.

Scritto da

Michele Laurelli

Imprenditore, ricercatore e docente

Fondatore di Algoretico e di altre aziende che progettano modelli e sistemi di intelligenza artificiale, per uso proprio e per chi vuole metterla al lavoro. Fa ricerca su architetture e AI privata, insegna all'università e ha scritto libri per raccontare l'intelligenza artificiale a tutti.

Vuoi portare queste idee nella tua azienda?

Progetto e costruisco sistemi di intelligenza artificiale, per le mie aziende e per chi vuole metterla al lavoro.

Parliamone

Continua a leggere