dima1234321 commited on Mar 15, 2024

Commit

61dfaaa

verified ·

1 Parent(s): bb71c63

dima1234321/wav2vec2-xls-r-300m-phoneme_he_small1

Browse files

Files changed (23) hide show

.gitattributes +3 -0
README.md +73 -0
b.ogg +0 -0
ba.ogg +0 -0
config.json +109 -0
dataset2_withAudio1.csv +0 -0
kakba1.ogg +0 -0
kakba2.ogg +0 -0
kakba3.ogg +0 -0
maba1.ogg +0 -0
model.safetensors +3 -0
na'a1.ogg +0 -0
na'a2.ogg +0 -0
preprocessor_config.json +9 -0
runs/Mar15_09-45-00_9163490853ac/events.out.tfevents.1710496114.9163490853ac.482.0 +3 -0
runs/Mar15_09-45-00_9163490853ac/events.out.tfevents.1710509183.9163490853ac.482.1 +3 -0
t.ogg +0 -0
te.ogg +0 -0
test_dataset +3 -0
train_dataset +3 -0
training_args.bin +3 -0
valid_dataset +3 -0
vocab.json +1 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,6 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+test_dataset filter=lfs diff=lfs merge=lfs -text
+train_dataset filter=lfs diff=lfs merge=lfs -text
+valid_dataset filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,73 @@

+---
+license: apache-2.0
+base_model: facebook/wav2vec2-xls-r-300m
+tags:
+- generated_from_trainer
+metrics:
+- wer
+model-index:
+- name: shared_audio
+  results: []
+---
+<!-- This model card has been generated automatically according to the information the Trainer had access to. You
+should probably proofread and complete it, then remove this comment. -->
+# shared_audio
+This model is a fine-tuned version of [facebook/wav2vec2-xls-r-300m](https://huggingface.co/facebook/wav2vec2-xls-r-300m) on the None dataset.
+It achieves the following results on the evaluation set:
+- Loss: 19.5815
+- Wer: 1.0
+- Cer: 1.0
+## Model description
+More information needed
+## Intended uses & limitations
+More information needed
+## Training and evaluation data
+More information needed
+## Training procedure
+### Training hyperparameters
+The following hyperparameters were used during training:
+- learning_rate: 3e-05
+- train_batch_size: 8
+- eval_batch_size: 8
+- seed: 42
+- gradient_accumulation_steps: 4
+- total_train_batch_size: 32
+- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
+- lr_scheduler_type: linear
+- lr_scheduler_warmup_steps: 20
+- training_steps: 100
+### Training results
+| Training Loss | Epoch | Step | Validation Loss | Wer | Cer    |
+|:-------------:|:-----:|:----:|:---------------:|:---:|:------:|
+| 62.6565       | 0.16  | 10   | 63.7309         | 1.0 | 2.9738 |
+| 46.9251       | 0.32  | 20   | 54.7811         | 1.0 | 1.0    |
+| 43.8044       | 0.48  | 30   | 32.9802         | 1.0 | 1.0    |
+| 30.6358       | 0.64  | 40   | 26.5389         | 1.0 | 1.0    |
+| 23.5351       | 0.8   | 50   | 23.3499         | 1.0 | 1.0    |
+| 29.7649       | 0.96  | 60   | 21.5416         | 1.0 | 1.0    |
+| 21.3599       | 1.12  | 70   | 20.5404         | 1.0 | 1.0    |
+| 19.8412       | 1.28  | 80   | 19.8837         | 1.0 | 1.0    |
+| 23.5039       | 1.44  | 90   | 19.5565         | 1.0 | 1.0    |
+| 20.1719       | 1.6   | 100  | 19.4386         | 1.0 | 1.0    |
+### Framework versions
+- Transformers 4.38.2
+- Pytorch 2.2.1+cu121
+- Datasets 2.18.0
+- Tokenizers 0.15.2

b.ogg ADDED Viewed

Binary file (3.37 kB). View file

ba.ogg ADDED Viewed

Binary file (2.44 kB). View file

config.json ADDED Viewed

	@@ -0,0 +1,109 @@

+{
+  "_name_or_path": "facebook/wav2vec2-xls-r-300m",
+  "activation_dropout": 0.0,
+  "adapter_attn_dim": null,
+  "adapter_kernel_size": 3,
+  "adapter_stride": 2,
+  "add_adapter": false,
+  "apply_spec_augment": true,
+  "architectures": [
+    "Wav2Vec2ForCTC"
+  ],
+  "attention_dropout": 0.1,
+  "bos_token_id": 1,
+  "classifier_proj_size": 256,
+  "codevector_dim": 768,
+  "contrastive_logits_temperature": 0.1,
+  "conv_bias": true,
+  "conv_dim": [
+    512,
+    512,
+    512,
+    512,
+    512,
+    512,
+    512
+  ],
+  "conv_kernel": [
+    10,
+    3,
+    3,
+    3,
+    3,
+    2,
+    2
+  ],
+  "conv_stride": [
+    5,
+    2,
+    2,
+    2,
+    2,
+    2,
+    2
+  ],
+  "ctc_loss_reduction": "mean",
+  "ctc_zero_infinity": false,
+  "diversity_loss_weight": 0.1,
+  "do_stable_layer_norm": true,
+  "eos_token_id": 2,
+  "feat_extract_activation": "gelu",
+  "feat_extract_dropout": 0.0,
+  "feat_extract_norm": "layer",
+  "feat_proj_dropout": 0.0,
+  "feat_quantizer_dropout": 0.0,
+  "final_dropout": 0.0,
+  "gradient_checkpointing": false,
+  "hidden_act": "gelu",
+  "hidden_dropout": 0.1,
+  "hidden_size": 1024,
+  "initializer_range": 0.02,
+  "intermediate_size": 4096,
+  "layer_norm_eps": 1e-05,
+  "layerdrop": 0.0,
+  "mask_feature_length": 64,
+  "mask_feature_min_masks": 0,
+  "mask_feature_prob": 0.25,
+  "mask_time_length": 10,
+  "mask_time_min_masks": 2,
+  "mask_time_prob": 0.75,
+  "model_type": "wav2vec2",
+  "num_adapter_layers": 3,
+  "num_attention_heads": 16,
+  "num_codevector_groups": 2,
+  "num_codevectors_per_group": 320,
+  "num_conv_pos_embedding_groups": 16,
+  "num_conv_pos_embeddings": 128,
+  "num_feat_extract_layers": 7,
+  "num_hidden_layers": 24,
+  "num_negatives": 100,
+  "output_hidden_size": 1024,
+  "pad_token_id": 101,
+  "proj_codevector_dim": 768,
+  "tdnn_dilation": [
+    1,
+    2,
+    3,
+    1,
+    1
+  ],
+  "tdnn_dim": [
+    512,
+    512,
+    512,
+    512,
+    1500
+  ],
+  "tdnn_kernel": [
+    5,
+    3,
+    3,
+    1,
+    1
+  ],
+  "torch_dtype": "float32",
+  "transformers_version": "4.38.2",
+  "use_weighted_layer_sum": false,
+  "vocab_size": 104,
+  "xvector_output_dim": 512
+}

dataset2_withAudio1.csv ADDED Viewed

The diff for this file is too large to render. See raw diff

kakba1.ogg ADDED Viewed

Binary file (4.85 kB). View file

kakba2.ogg ADDED Viewed

Binary file (3.36 kB). View file

kakba3.ogg ADDED Viewed

Binary file (5.01 kB). View file

maba1.ogg ADDED Viewed

Binary file (3.28 kB). View file

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:83096bb2075586342fa0703c2cf4e1d8c4124779a58c55deb8bc2e65bd53b13b
+size 1262233880

na'a1.ogg ADDED Viewed

Binary file (4.31 kB). View file

na'a2.ogg ADDED Viewed

Binary file (3.97 kB). View file

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,9 @@

+{
+  "do_normalize": true,
+  "feature_extractor_type": "Wav2Vec2FeatureExtractor",
+  "feature_size": 1,
+  "padding_side": "right",
+  "padding_value": 0.0,
+  "return_attention_mask": true,
+  "sampling_rate": 16000
+}

runs/Mar15_09-45-00_9163490853ac/events.out.tfevents.1710496114.9163490853ac.482.0 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:323678ff51d2c5e5d2a9028112301b5feb190cc9c6fc7ba06fbdea77986e9f40
+size 30701

runs/Mar15_09-45-00_9163490853ac/events.out.tfevents.1710509183.9163490853ac.482.1 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2a7339d1983396c0dc65de5a4fdae35cf6f97f9e54344016c0cad27a28b81b14
+size 446

t.ogg ADDED Viewed

Binary file (2.61 kB). View file

te.ogg ADDED Viewed

Binary file (2.88 kB). View file

test_dataset ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0fc1ca3d0a8985e3553cccebf80a340f42aa8ce3a1de725c7c63128bbf3e3d5b
+size 52862488

train_dataset ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a8195a87c464ca3ed145693a7aec9878f7626c4ca49ec53f6c4912033db87f2d
+size 415167252

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:92e96185dc6b382024930bfbbd505f2b7aed9db60a71e6eecf8e372096d5d0f2
+size 4920

valid_dataset ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:33f54ac6a4bdaad37735a7424c22e4745448c9b1811825191feff4886ebf2e56
+size 52189620

vocab.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"a": 1, "b": 2, "ba": 3, "be": 4, "bi": 5, "bo": 6, "bu": 7, "d": 8, "da": 9, "de": 10, "di": 11, "do": 12, "du": 13, "e": 14, "f": 15, "g": 16, "ga": 17, "ge": 18, "gi": 19, "go": 20, "gu": 21, "h": 22, "ha": 23, "he": 24, "hi": 25, "ho": 26, "hu": 27, "i": 28, "k": 29, "ka": 30, "ke": 31, "ki": 32, "ko": 33, "ku": 34, "l": 35, "la": 36, "le": 37, "li": 38, "lo": 39, "lu": 40, "m": 41, "n": 42, "o": 43, "p": 44, "pa": 45, "pe": 46, "pi": 47, "po": 48, "pu": 49, "r": 50, "ra": 51, "re": 52, "ri": 53, "ro": 54, "ru": 55, "s": 56, "sa": 57, "se": 58, "sh": 59, "sha": 60, "she": 61, "shi": 62, "sho": 63, "shu": 64, "si": 65, "so": 66, "su": 67, "t": 68, "ta": 69, "te": 70, "ti": 71, "to": 72, "tu": 73, "tz": 74, "u": 75, "v": 76, "va": 77, "ve": 78, "vi": 79, "vo": 80, "vu": 81, "x": 82, "xa": 83, "xe": 84, "xi": 85, "xo": 86, "xu": 87, "y": 88, "ya": 89, "ye": 90, "yi": 91, "yo": 92, "yu": 93, "z": 94, "za": 95, "ze": 96, "zi": 97, "zo": 98, "zu": 99, "|": 0, "[UNK]": 100, "[PAD]": 101}