AMD opublikował Instella-MoE-16B-A3B, nowy model Mixture-of-Experts wytrenowany od zera na akceleratorach Instinct MI300X i MI325X. Model zawiera 16 miliardów parametrów, ale w praktyce aktywuje zaledwie 2,8 miliarda parametrów na jeden token, co znacząco obniża koszty obliczeniowe w stosunku do tradycyjnych transformerów tego rozmiaru.

AMD idzie dalej niż typowe wydania i publikuje kompletne artefakty badawcze: wagi z każdego etapu treningu, mieszanki danych treningowych, pliki konfiguracyjne i kod inferencji. Architektura to 27-warstwowy model z rozmiarem ukrytym 2048, 16 głowicami attention i słownikiem 128 896 tokenów. Dwa kluczowe wybory projektowe to Gated Multi-head Latent Attention i FarSkip-Collective connectivity. Kodowanie treningu ma licencję MIT, co czyni je bardziej użytecznym zasobem niż sam model dla szerszej publiczności.

Ważny caveat: model dostępny jest wyłącznie na licencji ResearchRAIL dla celów akademickich i badawczych, nie do wdrożeń komercyjnych. To ogranicza docelową publiczność do laboratoriów badawczych AI, uniwersytetów i zespołów R&D w dużych przedsiębiorstwach z dostępem do infrastruktury GPU. Dla wdrożenia wymaga około 32 GB pamięci do przechowywania wag w formacie BF16 na jednym akceleratorze. AMD dołącza kod inferencji SGLang, umożliwiając badaczom eksplorowanie serowania Mixture-of-Experts, ewaluacji zachowania na kontekstach 64K tokenów i eksperymentów z fine-tuningiem wzmacniającym.