Mistral przedstawia Voxtral, rodzinę open-source’owych modeli rozpoznawania i rozumienia mowy. Najwyższy czas. Porównywalnego modelu open source nie widzieliśmy od czasów Whispera od OpenAI, a to było dość dawno temu.
Modele występują w rozmiarach 3B i 24B i wyprzedzają Whispera w większości benchmarków. Wymagają jednak mocniejszego sprzętu, bo największy wariant Whispera ma zaledwie 1,5B. To bezpośrednia konsekwencja tego, że są one zarazem zwykłymi modelami językowymi. Inna konsekwencja jest taka, że trudniej będzie je okiełznać w scenariuszu czystej transkrypcji.
Modele są dostępne na Hugging Face, a także przez API Mistrala i ich LeChat.
Czego im obecnie brakuje, to obsługi diaryzacji (rozpoznawania mówiących). Jest ona na roadmapie, ale w międzyczasie wciąż musimy używać do tego celu nieco topornego pyannote-audio.