wikipedia jp, wikipedia en(サンプリング), cc-100(ja, サンプリング)(追記: 作成スクリプトを確認したところ、日本語wikipediaのみを利用していました)のデータを unidic で分割 + sentencepiece Unigram で学習した、XLM-Roberta 形式の日本語トークナイザ。
Inference Providers
NEW
This model is not currently available via any of the supported Inference Providers.
The model cannot be deployed to the HF Inference API:
The model has no pipeline_tag.