Tokenization

/ˌtoʊkənaɪˈzeɪʃən/

Il processo di suddividere il testo in unità più piccole (token) come parole, subword o caratteri per l'elaborazione.

In English: Tokenization

La tokenization è il primo step nelle pipeline NLP. I metodi includono word-level, character-level e subword tokenization (BPE, WordPiece). Bilancia dimensione vocabolario e qualità rappresentazione.

Esempi

  • BPE nei modelli GPT
  • WordPiece in BERT
  • SentencePiece per modelli multilingua