Google uruchomił nową rodzinę modeli Gemini specjalnie dla agentów AI działających w produkcji - Gemini 3.6 Flash, Gemini 3.5 Flash-Lite i specjalistyczną wersję Gemini 3.5 Flash Cyber do szukania luk bezpieczeństwa. Każdy model adresuje inny problem: rozumowanie wieloetapowe, bardzo wysoka przepustowość przy niskich opóźnieniach, czy cyberbezpieczeństwo. Model 3.6 Flash osiągnął kluczowy wynik - 17 procent zmniejszenia tokenów wyjściowych wobec wersji 3.5 Flash, a w testach benchmark DeepSWE redukcja sięga nawet 65 procent. Sukces na DeepSWE to 49 procent wobec 37 procent dla poprzednika.

Matematyka stojąca za tymi zmianami odsłania fundamentalny problem enterprise'u: autonomiczne agenty muszą rozumować przez wieloetapowe zadania, ale każdy dodatkowy token, który model generuje, dodaje zarówno koszt jak i opóźnienie. Gdy agent pracuje tysiące razy na godzinę w tle, to się szybko mnoży. Cena Gemini 3.6 Flash to 1,50 dolara za milion tokenów wejściowych i 7,50 dolara za milion tokenów wyjściowych - model wyceniony dla ciągłych pętli rozumowania, a nie zapytań na żądanie.

To jest shift w strategii Google - zamiast jednego dużego modelu do wszystkiego, firma oferuje spektrum rozwiązań. Zespoły budujące agentów background niż interfejsy czatów potrzebują przede wszystkim przepustowości i szybkości, a dopiero w drugiej kolejności wielkości parametrów. Nowe linie Gemini pozycjonują się dokładnie tam, gdzie enterprise czuje ból budżetu przy skalowaniu autonomicznych systemów.