Simon Willison we współpracy z Jesse Vincentem i Prime Radiant applied AI research lab zaprezentował smevals - nowe narzędzie do ewaluacji zdolności modeli sztucznej inteligencji. Framework pozwala na systematyczne testowanie i porównywanie różnych konfiguracji modeli poprzez definiowanie zestawów wyzwań (eval suites) przechowywanych jako katalogi z plikami YAML.

Narzędzie ma modułową architekturę - runny (uruchamiania testów) są oddzielone od operacji gradowania (oceniania wyników). Użytkownik może uruchomić eval suite na wielu modelach jednocześnie, na przykład gpt-5.5 czy claude-opus-4.6, a następnie ocenić wszystkie wyniki na podstawie predefiniowanych sprawdzeń. Rezultaty można następnie przeglądać w interfejsie webowym poprzez lokalny serwer lub eksportować jako statyczną stronę HTML do hostowania.

Najwięcej czasu projektu zajęło opracowanie spójnego słownictwa i koncepcji dla framework'u. Na przykład Willison zbudował eval suite do testowania zdolności modeli do pisania haikuów. Narzędzie jest dostępne do użycia poprzez wiersz poleceń uvx, co czyni go dostępnym dla programistów pracujących z agentami kodującymi i inżynierów promptów chcących systematycznie porównywać jakość swoich implementacji.