Smol-Hub-tldr / tokenizer_config.json

Training in progress, step 100

9864298 verified 11 days ago

4.9 kB

	{
	"add_prefix_space": false,
	"added_tokens_decoder": {
	"0": {
	"content": "<\|endoftext\|>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"1": {
	"content": "<\|im_start\|>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"2": {
	"content": "<\|im_end\|>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"3": {
	"content": "<repo_name>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"4": {
	"content": "<reponame>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"5": {
	"content": "<file_sep>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"6": {
	"content": "<filename>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"7": {
	"content": "<gh_stars>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"8": {
	"content": "<issue_start>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"9": {
	"content": "<issue_comment>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"10": {
	"content": "<issue_closed>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"11": {
	"content": "<jupyter_start>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"12": {
	"content": "<jupyter_text>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"13": {
	"content": "<jupyter_code>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"14": {
	"content": "<jupyter_output>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"15": {
	"content": "<jupyter_script>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"16": {
	"content": "<empty_output>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"49152": {
	"content": "<CARD>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"49153": {
	"content": "</CARD>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"49154": {
	"content": "<CARD_SUMMARY>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"49155": {
	"content": "</CARD_SUMMARY>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"49156": {
	"content": "<DATASET_CARD>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"49157": {
	"content": "<MODEL_CARD>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	}
	},
	"additional_special_tokens": [
	"<CARD>",
	"</CARD>",
	"<CARD_SUMMARY>",
	"</CARD_SUMMARY>",
	"<DATASET_CARD>",
	"<MODEL_CARD>"
	],
	"bos_token": "<\|endoftext\|>",
	"chat_template": "{% for message in messages %}{% if message['role'] == 'user' %}<CARD>{{ message['content'] }}</CARD>{% elif message['role'] == 'assistant' %}<CARD_SUMMARY>{{ message['content'] }}</CARD_SUMMARY>{% endif %}{% endfor %}{% if not add_generation_prompt %}<\|endoftext\|>{% endif %}{% if add_generation_prompt %}<CARD_SUMMARY>{% endif %}",
	"clean_up_tokenization_spaces": false,
	"eos_token": "<\|endoftext\|>",
	"extra_special_tokens": {},
	"model_max_length": 8192,
	"pad_token": "<\|endoftext\|>",
	"tokenizer_class": "GPT2Tokenizer",
	"unk_token": "<\|endoftext\|>",
	"vocab_size": 49152
	}