Meta udostępniła Sapiens2 - model wizji, który wyspecjalizował się w zrozumieniu ludzi na zdjęciach i filmach. Nowy system potrafi wykonać całą gamę zadań związanych z analizą postaci: od precyzyjnej estymacji pozy poprzez segmentację ludzi, aż po generowanie map normalnych i albedo w wysokiej rozdzielczości. To oznacza, że model nie tylko widzi, gdzie stoi człowiek, ale też wylicza dokładne położenie jego kończyn, oddziela go od tła oraz analizuje, jak światło pada na jego skórę i ubranie.

Sapiens2 to ewolucja wcześniejszego Sapiens, ale z wyraźnie lepszymi możliwościami i wydajnością. Poprzednia generacja już osiągała dobre wyniki w analizie postaw ludzi, ale nowy model radia sobie znacznie lepiej w bardziej skomplikowanych scenariuszach - gdy ludzie się nakrywają, stoją blisko siebie lub poruszają dynamicznie. Takie modele mają duży potencjał w zastosowaniach zarówno praktycznych, jak i twórczych: od fitness i sportu, przez медицynę i rehabilitację, aż po gry, filmy i aplikacje AR. Meta udostępniła Sapiens2 na licencji open source, co oznacza, że inni developers mogą go pobierać, badać i integrować ze swoimi projektami.

Decyzja o otwarciu tego modelu dla publiczności wpisuje się w bardziej ogólną strategię Mety w obszarze AI - firma systematycznie publicznie udostępnia swoje zaawansowane modele wizji i języka. To zarówno sposób na budowanie ekosystemu wokół swoich technologii, jak i na zdobycie feedbacku od społeczności. Zarazem jednak stanowi konkurencję wobec zamkniętych rozwiązań od OpenAI czy Google, pokazując, że rozwiązania open source mogą być porównywalne w jakości do najbardziej zaawansowanych komercyjnych alternatyw.