Quantizzazione

Ridurre precisione pesi/attivazioni per abbassare memoria e computazione.

In English: Quantization

Converte float 32-bit a interi 8-bit o meno. Riduce dimensione modello 4x con perdita minima accuracy. Essenziale per edge deployment.

Esempi

  • Quantizzazione INT8
  • Deployment mobile
  • Quantizzazione 4-bit LLM