Implémentation du tokenizer en java

#9
by Florian9M - opened

J'aimerais utiliser le tokenizer en Java mais personne ne la encore implémenté.
Serait-il possible d'avoir les merges, le vocab et la base_vocab pour pouvoir l'implémenter ?

ALMAnaCH (Inria) org

Le tokenizer de CamemBERT est un modèl SentencePiece Unigram, donc il y a pas des merges. Vous pouvez trouver le vocab dans le fichier tokenizer.json ou sentencepiece.bpe.model (https://huggingface.co/almanach/camembert-base/tree/main)

Sign up or log in to comment