wikipedia jp, wikipedia en(サンプリング), cc-100(ja, サンプリング)(追記: 作成スクリプトを確認したところ、日本語wikipediaのみを利用していました)のデータを unidic で分割 + sentencepiece Unigram で学習した、XLM-Roberta 形式の日本語トークナイザ。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model is not currently available via any of the supported Inference Providers.
The model cannot be deployed to the HF Inference API: The model has no pipeline_tag.