Fireworks AI wydał Ember-1, specjalizowany model stworzony przez post-training otwartego modelu Kimi K3 od Moonshot AI, który zużywa około 40% mniej tokenów niż oryginał. Model jest dostępny wyłącznie poprzez Fireworks serverless API w fazie Research Preview - producent nie udostępnił wag modelu, kodu treningowego ani szczegółów algorytmu, dlatego self-hosting nie jest możliwy.
Problemetem, który rozwiązuje Ember-1, jest nieefektywność reasoning models takich jak Kimi K3. Modele te poświęcają ponad 90% wygenerowanych tokenów na wewnętrzne rozumowanie. W scenariuszach agentic z wieloma turami konwersacji problem się komplikuje - każda kolejna tura musi ponownie przeanalizować wcześniejsze rozumowania, a kontekst rośnie niemal kwadratowo wraz z liczbą tur. Oznacza to, że długie ścieżki rozumowania z początkowych tur są odczytywane i rozliczane na każdym kolejnym wywołaniu.
Zamiast po prostu zmniejszać effort reasoning w czasie inferencji - co prowadziło do utraty jakości - zespół Fireworks nauczył model bardziej efektywnego rozumowania. Ember-1 zachowuje użyteczne aspekty rozumowania Kimi K3, takie jak rewizja założeń czy reakcja na feedback, jednocześnie eliminując zbędne kroki. To podejście pozwala uzyskać kodowanie na poziomie K3 przy niższych kosztach, co jest ważne dla praktycznego deploymentu zaawansowanych modeli rozumowania.