Thinking Machines Lab udostępnił Inkling-Small, otwarty model z rodziny Inkling, łączący 276 miliardów parametrów całkowitych przy zaledwie 12 miliardach aktywnych w danym kroku. Stanowi to rewolucję w dostępności - podczas gdy oryginalny Inkling wymaga ekosystemu frontier laboratorium, Inkling-Small można wdrożyć na jednej wynajętej instancji NVIDIA B300 lub dwóch kartach H200, a nawet w konfiguracji z kwantyzacją W4A4 na samych backendach jednostkowych.

Model jest multimodalny natively - przetwarza tekst, obrazy i audio jednocześnie z oknem kontekstu sięgającym 1 miliona tokenów. Wytrenowany na systemach NVIDIA GB300 NVL72, dostępny zarówno w pełnej precyzji BF16 (wymaga 600 GB VRAM agregatywnej) jak i w wersji NVFP4 (180 GB). Wagi rozpowszechniają się na Hugging Face pod Apache 2.0, wspierane przez frameworki SGLang, vLLM, TokenSpeed, Unsloth i Hugging Face. To praktyczne udostępnienie otwiera nowe możliwości dla sektora regulowanego - instytucji finansowych, opieki zdrowotnej czy telekomunikacji, które mogą teraz hostować zaawansowane możliwości AI bez outsourcowania do chmury publicznej.

Zastosowania obejmują agentów kodujących, automatyzację terminalową, rozumienie dokumentów i wykresów, a audio otwiera nowe horyzonty dla analityki call-center, interfejsów głosowych i streszczania spotkań. Architektura Inkling-Small to transformer dekodujący z 42 warstwami i rzadkim MoE w gęstej warstwie feed-forward, co wyjaśnia skok wydajności przy zdecydowanie mniejszym zużyciu mocy obliczeniowej niż modele o porównywalno większych parametrach.