Tokenization
/ˌtoʊkənaɪˈzeɪʃən/
Il processo di suddividere il testo in unità più piccole (token) come parole, subword o caratteri per l'elaborazione.
In English: TokenizationLa tokenization è il primo step nelle pipeline NLP. I metodi includono word-level, character-level e subword tokenization (BPE, WordPiece). Bilancia dimensione vocabolario e qualità rappresentazione.
Esempi
- BPE nei modelli GPT
- WordPiece in BERT
- SentencePiece per modelli multilingua