Otwarty rynek rozpoznawania mowy uległ transformacji - dominacja Whisper skończyła się w ostatnich dwunastu miesiącach. Cohere wypuściło w marcu 2026 model Transcribe o rozmiarze 2 miliardów parametrów na licencji Apache 2.0, który osiągnął pierwsze miejsce na Hugging Face Open ASR Leaderboard ze średnim współczynnikiem błędu słowa 5,42%. Pięć tygodni później IBM udostępnił Granite Speech 4.1 (także 2B) z wynikiem 5,33%. Następnie pojawiły się ARK-ASR-3B i MOSS-Transcribe-preview-2B z jeszcze niższymi wartościami WER. To oznacza, że czołówka leaderboard jest rozdzielona mniej niż jednym punktem procentowym.

Taka sytacja zmienia paradygmat wyboru modelu - pozycja w rankingu przestaje być decydującym czynnikiem. Znacznie ważniejszą rolę zaczynają odgrywać licencja, zakres obsługi języków, obsługa przetwarzania strumieniowego oraz koszt na godzinę audio transkrypcji. Te cztery parametry stały się rzeczywistymi zmiennymi decyzyjnymi dla praktyków wdrażających ASR w produkcji.

Warto jednak zaznaczyć problem ze sposobem liczenia średnich na leaderboardzie. Modele porównane obok siebie nie zostały ewaluowane na identycznych zbiorach testowych. Wynik Cohere 5,42% to średnia z ośmiu angielskich setów testowych łącznie z TED-LIUM, natomiast ARK-ASR-3B raportuje 5,04% z siedmiu setów, z wyłączeniem TED-LIUM - jednego z łatwiejszych zbiorów. To sprawia, że bezpośrednie porównanie wymaga ostrożności i przeliczenia wyników na wspólnej metodologii.