delete

Browse files

Files changed (13) hide show

config.json +0 -34
optimizer.pt +0 -3
pytorch_model-00001-of-00003.bin +0 -3
pytorch_model-00002-of-00003.bin +0 -3
pytorch_model-00003-of-00003.bin +0 -3
pytorch_model.bin.index.json +0 -1025
rng_state.pth +0 -3
scheduler.pt +0 -3
sentencepiece.bpe.model +0 -3
special_tokens_map.json +0 -219
tokenizer_config.json +0 -25
trainer_state.json +0 -15
training_args.bin +0 -3

config.json DELETED Viewed

@@ -1,34 +0,0 @@
-{
-  "_name_or_path": "facebook/nllb-200-3.3B",
-  "activation_dropout": 0.0,
-  "activation_function": "relu",
-  "architectures": [
-    "M2M100ForConditionalGeneration"
-  ],
-  "attention_dropout": 0.1,
-  "bos_token_id": 0,
-  "d_model": 2048,
-  "decoder_attention_heads": 16,
-  "decoder_ffn_dim": 8192,
-  "decoder_layerdrop": 0,
-  "decoder_layers": 24,
-  "decoder_start_token_id": 2,
-  "dropout": 0.1,
-  "encoder_attention_heads": 16,
-  "encoder_ffn_dim": 8192,
-  "encoder_layerdrop": 0,
-  "encoder_layers": 24,
-  "eos_token_id": 2,
-  "init_std": 0.02,
-  "is_encoder_decoder": true,
-  "max_length": 200,
-  "max_position_embeddings": 1024,
-  "model_type": "m2m_100",
-  "num_hidden_layers": 24,
-  "pad_token_id": 1,
-  "scale_embedding": true,
-  "torch_dtype": "float32",
-  "transformers_version": "4.25.1",
-  "use_cache": true,
-  "vocab_size": 256206
-}

optimizer.pt DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:4df016b3838d0730ab4eae8a97fba304593f7906236463ba62b1fbc3d5c63316
-size 940074921

pytorch_model-00001-of-00003.bin DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:f77b2443708286264edcb7b163dcb4735b8510dd540a77c105088c8beb66bf43
-size 6941786709

pytorch_model-00002-of-00003.bin DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:a98d75e0f2b4c111096e11253f5ef2b2c004951fe70e4463d7aa7f1bd1406295
-size 8553663337

pytorch_model-00003-of-00003.bin DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:4e1136f429ec6765793f956c63b25e2d858e6b06e29f95f9d92894392fd65481
-size 2098840299

pytorch_model.bin.index.json DELETED Viewed

@@ -1,1025 +0,0 @@
-{
-  "metadata": {
-    "total_size": 19692781568
-  },
-  "weight_map": {
-    "lm_head.weight": "pytorch_model-00003-of-00003.bin",
-    "model.decoder.embed_positions.weights": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.embed_tokens.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.0.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.1.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.10.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.11.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.12.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.13.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.14.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.15.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.16.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.17.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.18.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.19.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.2.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.20.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.21.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.22.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.23.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.3.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.4.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.5.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.6.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.7.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.8.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.encoder_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.fc1.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.fc1.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.fc2.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.fc2.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.final_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.k_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.k_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.out_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.out_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.q_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.q_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.v_proj.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn.v_proj.weight": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn_layer_norm.bias": "pytorch_model-00002-of-00003.bin",
-    "model.decoder.layers.9.self_attn_layer_norm.weight": "pytorch_model-00002-of-00003.bin",
-    "model.encoder.embed_positions.weights": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.embed_tokens.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.0.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.1.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.10.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.11.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.12.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.13.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.14.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.15.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.16.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.17.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.18.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.19.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.2.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.20.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.21.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.22.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.23.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.3.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.4.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.5.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.6.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.7.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.8.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.fc1.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.fc1.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.fc2.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.fc2.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.final_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.final_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.k_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.k_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.out_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.out_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.q_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.q_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.v_proj.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn.v_proj.weight": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn_layer_norm.bias": "pytorch_model-00001-of-00003.bin",
-    "model.encoder.layers.9.self_attn_layer_norm.weight": "pytorch_model-00001-of-00003.bin",
-    "model.shared.weight": "pytorch_model-00001-of-00003.bin"
-  }
-}

rng_state.pth DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:962a4a6cb1d096eb5f58c2385441471cbb7a9a7df1b9f1e5cdf3ef9ccd9e5b87
-size 14503

scheduler.pt DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:dba8231a7061a6ded3dce8a6bb8e6f792c2b37751a0e1b626cd3e7eedf685418
-size 623

sentencepiece.bpe.model DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:14bb8dfb35c0ffdea7bc01e56cea38b9e3d5efcdcb9c251d6b40538e1aab555a
-size 4852054

special_tokens_map.json DELETED Viewed

@@ -1,219 +0,0 @@
-{
-  "additional_special_tokens": [
-    "ace_Arab",
-    "ace_Latn",
-    "acm_Arab",
-    "acq_Arab",
-    "aeb_Arab",
-    "afr_Latn",
-    "ajp_Arab",
-    "aka_Latn",
-    "amh_Ethi",
-    "apc_Arab",
-    "arb_Arab",
-    "ars_Arab",
-    "ary_Arab",
-    "arz_Arab",
-    "asm_Beng",
-    "ast_Latn",
-    "awa_Deva",
-    "ayr_Latn",
-    "azb_Arab",
-    "azj_Latn",
-    "bak_Cyrl",
-    "bam_Latn",
-    "ban_Latn",
-    "bel_Cyrl",
-    "bem_Latn",
-    "ben_Beng",
-    "bho_Deva",
-    "bjn_Arab",
-    "bjn_Latn",
-    "bod_Tibt",
-    "bos_Latn",
-    "bug_Latn",
-    "bul_Cyrl",
-    "cat_Latn",
-    "ceb_Latn",
-    "ces_Latn",
-    "cjk_Latn",
-    "ckb_Arab",
-    "crh_Latn",
-    "cym_Latn",
-    "dan_Latn",
-    "deu_Latn",
-    "dik_Latn",
-    "dyu_Latn",
-    "dzo_Tibt",
-    "ell_Grek",
-    "eng_Latn",
-    "epo_Latn",
-    "est_Latn",
-    "eus_Latn",
-    "ewe_Latn",
-    "fao_Latn",
-    "pes_Arab",
-    "fij_Latn",
-    "fin_Latn",
-    "fon_Latn",
-    "fra_Latn",
-    "fur_Latn",
-    "fuv_Latn",
-    "gla_Latn",
-    "gle_Latn",
-    "glg_Latn",
-    "grn_Latn",
-    "guj_Gujr",
-    "hat_Latn",
-    "hau_Latn",
-    "heb_Hebr",
-    "hin_Deva",
-    "hne_Deva",
-    "hrv_Latn",
-    "hun_Latn",
-    "hye_Armn",
-    "ibo_Latn",
-    "ilo_Latn",
-    "ind_Latn",
-    "isl_Latn",
-    "ita_Latn",
-    "jav_Latn",
-    "jpn_Jpan",
-    "kab_Latn",
-    "kac_Latn",
-    "kam_Latn",
-    "kan_Knda",
-    "kas_Arab",
-    "kas_Deva",
-    "kat_Geor",
-    "knc_Arab",
-    "knc_Latn",
-    "kaz_Cyrl",
-    "kbp_Latn",
-    "kea_Latn",
-    "khm_Khmr",
-    "kik_Latn",
-    "kin_Latn",
-    "kir_Cyrl",
-    "kmb_Latn",
-    "kon_Latn",
-    "kor_Hang",
-    "kmr_Latn",
-    "lao_Laoo",
-    "lvs_Latn",
-    "lij_Latn",
-    "lim_Latn",
-    "lin_Latn",
-    "lit_Latn",
-    "lmo_Latn",
-    "ltg_Latn",
-    "ltz_Latn",
-    "lua_Latn",
-    "lug_Latn",
-    "luo_Latn",
-    "lus_Latn",
-    "mag_Deva",
-    "mai_Deva",
-    "mal_Mlym",
-    "mar_Deva",
-    "min_Latn",
-    "mkd_Cyrl",
-    "plt_Latn",
-    "mlt_Latn",
-    "mni_Beng",
-    "khk_Cyrl",
-    "mos_Latn",
-    "mri_Latn",
-    "zsm_Latn",
-    "mya_Mymr",
-    "nld_Latn",
-    "nno_Latn",
-    "nob_Latn",
-    "npi_Deva",
-    "nso_Latn",
-    "nus_Latn",
-    "nya_Latn",
-    "oci_Latn",
-    "gaz_Latn",
-    "ory_Orya",
-    "pag_Latn",
-    "pan_Guru",
-    "pap_Latn",
-    "pol_Latn",
-    "por_Latn",
-    "prs_Arab",
-    "pbt_Arab",
-    "quy_Latn",
-    "ron_Latn",
-    "run_Latn",
-    "rus_Cyrl",
-    "sag_Latn",
-    "san_Deva",
-    "sat_Beng",
-    "scn_Latn",
-    "shn_Mymr",
-    "sin_Sinh",
-    "slk_Latn",
-    "slv_Latn",
-    "smo_Latn",
-    "sna_Latn",
-    "snd_Arab",
-    "som_Latn",
-    "sot_Latn",
-    "spa_Latn",
-    "als_Latn",
-    "srd_Latn",
-    "srp_Cyrl",
-    "ssw_Latn",
-    "sun_Latn",
-    "swe_Latn",
-    "swh_Latn",
-    "szl_Latn",
-    "tam_Taml",
-    "tat_Cyrl",
-    "tel_Telu",
-    "tgk_Cyrl",
-    "tgl_Latn",
-    "tha_Thai",
-    "tir_Ethi",
-    "taq_Latn",
-    "taq_Tfng",
-    "tpi_Latn",
-    "tsn_Latn",
-    "tso_Latn",
-    "tuk_Latn",
-    "tum_Latn",
-    "tur_Latn",
-    "twi_Latn",
-    "tzm_Tfng",
-    "uig_Arab",
-    "ukr_Cyrl",
-    "umb_Latn",
-    "urd_Arab",
-    "uzn_Latn",
-    "vec_Latn",
-    "vie_Latn",
-    "war_Latn",
-    "wol_Latn",
-    "xho_Latn",
-    "ydd_Hebr",
-    "yor_Latn",
-    "yue_Hant",
-    "zho_Hans",
-    "zho_Hant",
-    "zul_Latn"
-  ],
-  "bos_token": "<s>",
-  "cls_token": "<s>",
-  "eos_token": "</s>",
-  "mask_token": {
-    "content": "<mask>",
-    "lstrip": true,
-    "normalized": true,
-    "rstrip": false,
-    "single_word": false
-  },
-  "pad_token": "<pad>",
-  "sep_token": "</s>",
-  "unk_token": "<unk>"
-}

tokenizer_config.json DELETED Viewed

@@ -1,25 +0,0 @@
-{
-  "additional_special_tokens": null,
-  "bos_token": "<s>",
-  "cls_token": "<s>",
-  "eos_token": "</s>",
-  "mask_token": {
-    "__type": "AddedToken",
-    "content": "<mask>",
-    "lstrip": true,
-    "normalized": true,
-    "rstrip": false,
-    "single_word": false
-  },
-  "model_max_length": 1024,
-  "name_or_path": "facebook/nllb-200-3.3B",
-  "pad_token": "<pad>",
-  "sep_token": "</s>",
-  "sp_model_kwargs": {},
-  "special_tokens_map_file": null,
-  "src_lang": null,
-  "tgt_lang": null,
-  "tokenizer_class": "NllbTokenizer",
-  "tokenizer_file": null,
-  "unk_token": "<unk>"
-}

trainer_state.json DELETED Viewed

@@ -1,15 +0,0 @@
-{
-  "best_metric": null,
-  "best_model_checkpoint": null,
-  "epoch": 0.032,
-  "global_step": 200,
-  "is_hyper_param_search": false,
-  "is_local_process_zero": true,
-  "is_world_process_zero": true,
-  "log_history": [],
-  "max_steps": 1000,
-  "num_train_epochs": 1,
-  "total_flos": 1486739720503296.0,
-  "trial_name": null,
-  "trial_params": null
-}

training_args.bin DELETED Viewed

@@ -1,3 +0,0 @@
-version https://git-lfs.github.com/spec/v1
-oid sha256:9950e122dcac4f42d15f18761ca1c0c12dc14079b643e6ae0322ec3608922bad
-size 3503