Supabase otworzyła kod swojego benchmarku Evals, narzędzia umożliwiającego dokładne testowanie wydajności agentów AI na konkretnych zadaniach platformy. Benchmark bierze rzeczywiste scenariusze z historii supportu i raportów błędów, zmuszając modele takie jak Claude Code, Codex czy OpenCode do budowania schematów baz danych, debugowania Edge Functions czy naprawiania uszkodzonych polityk Row Level Security. Wyniki są publikowane na publicznym rankingu i wykorzystywane codziennie w wewnętrznych testach regresji.