Kyutai wydał Voice of Reason - dwie otwarte wersje modelów speech-to-speech, które bez żadnych transkrypcji czy pośrednich tekstowych modeli języka bezpośrednio rozwiązują zadania matematyczne ze słuchu. Oparte na GLM-4-Voice-9B, modele przechodzą zaawansowany trening z supervised fine-tuning i reinforcement learning, co pozwala im wspinać się z 27,3% dokładności bazowego modelu aż do 77,1% na benchmarku GSM8K.

Do tej pory modelom natywnie pracującym ze mową trudno przychodzi matematyka. Kanoniczny podход - najpierw zamienić mowę na tekst, potem uruchmić osobny model językowy, wreszcie zamienić odpowiedź z powrotem na mowę - nadal daje lepsze wyniki, ale każdy krok dodaje opóźnienia i traci subtelności jak ton głosu. Mowy natywne modele muszą regularnie wyemitować audio aby pozostać interaktywne, co ogranicza liczbę ukrytych tokenów rozumowania. GLM-4-Voice bazowy zdobył 27,3%, poprzednia metoda STITCH podniosła to na 58,7%, ale Kyutai twierdzi że Voice of Reason to pierwsza aplikacja RL do matematycznego rozumowania w speech-native modelach.

Training przebiegał w dwóch etapach. Najpierw supervised fine-tuning na 150 tysiącach problemów z datasetu Orca-Math, przepisanych dla mowy przez Qwen3-235B i zsyntetyzowanych przez Kyutai DSM TTS w wielu głosach - samo to podniosło wynik na 61,7%. Następnie reinforcement learning popchniał to dalej do 77,1%. Oba warianty modelu potrzebują H100 do uruchomienia i dostępu do repozytorium GLM-4-Voice dla jego speech tokenizera i dekodera. Żaden z głównych dostarczycieli Hugging Face nie hostuje wag, ale są dostępne do self-hostingu.