Reka pokazała badawczą wersję Rho-1 - modelu z 19 miliardami parametrów, który łączy zrozumienie i generowanie tekstu, obrazów i wideo w jednej sieci neuronowej, bez konieczności wywoływania oddzielnych specjalistycznych modeli. Dotychczasowe rozwiązania wielomodalne opierają się na pipeline'ach, gdzie główny model planuje zadania, a następnie oddelegowuje je do wyspecjalizowanych modeli do pracy z obrazami, wideo czy wykrywaniem obiektów. Każde przekazanie danych między modelami dodaje opóźnień i ogranicza kontekst, jaki każdy specjalista otrzymuje.
Rho-1 zmienia to podejście całkowicie - tekst, obrazy, wideo i akcje robotów reprezentowane są jako tokeny w jednym oknie kontekstu. Jeden z przykładów pokazanych przez Rekę ilustruje pełny cykl: model rysuje latarnię morską, umieszcza ją w obramowaniu, animuje, edytuje animację w burzę śnieżną i wyjaśnia różnice. Wszystko to odbywa się w pięciu turach bez żadnych dodatkowych wywołań narzędzi czy drugiego modelu.
Architektura Rho-1 opiera się na dwóch strumieniach przetwarzania: jednym dla tokeny dyskretnych (tekst, rozumowanie, komendy) i drugim dla tokeny ciągłych (latensy obrazów, ramki wideo, akcje robotów). Każdy blok transformera zawiera dwie warstwy wag dla strumienia zrozumienia i strumienia generacji, które współdzielą mechanizm attention i operują nad tą samą cache'em kluczy-wartości. Takie podejście eliminuje tradycyjny problem handoffów między modelami, co otwiera nowe możliwości dla systemów agentycznych i robotyki.