alphacep / alphacep/vosk-api

vosk decode vs kaldi decode

Aperta
#1,194 1 commento 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Jupyter Notebook
Stelle
15.1k
Fork
1.8k
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

1. vosk decode:
model config set:
```
--min-active=200
--max-active=7000
--beam=12.0
--lattice-beam=6.0
--acoustic-scale=1.0
--frame-subsampling-factor=3
--endpoint.silence-phones=1:2:3:4:5:6:7:8:9:10
--endpoint.rule2.min-trailing-silence=0.5point.rule3.min-trailing-silence=1.0
--endpoint.rule4.min-trailing-silence=2.0
```
2. kaldi decode:
`online2-wav-nnet3-latgen-faster --do-endpointing=false --online=false --feature-type=mfcc --mfcc-config=mfcc.conf --ivector-extraction-config=ivector.conf --beam=12.0 --lattice-beam=6.0 --acoustic-scale=1.0 --word-symbol-table=/asr-model/graph/words.txt /asr-model/am/final.mdl /asr-model/graph/HCLG.fst 'ark:echo utter1 utter1|' 'scp:echo utter1 test.wav|' ark:/dev/null`

The above test based on same asr model、 same test wav and same model set(beam、lattice-beam、acoustic-scale) , but get different result.
wav groundtruth:"再等两秒"
vosk result: "那 不要不要"
kaldi result: "在 莆田 两秒"

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.