Opublikowano Terminal-Bench-Science - dedykowany benchmark do oceny wydajności agentów AI w naukowych przepływach pracy. Projekt zamierza systematycznie mierzyć, jak dobrze współczesne modele radzą sobie z zadaniami typowymi dla badań i ekspermentów naukowych.
Dotychczasowe benchmarki AI, takie jak klasyczne benchmarki kodowania czy rozumowania, nie oddają specyfiki pracy naukowca. Terminal-Bench-Science wypełnia tę lukę, proponując ocenę na konkretnych scenariuszach z rzeczywistych badań - od przygotowania danych i ich analizy, przez dokumentowanie hipotez, aż po interpretację wyników eksperymentów. To pozwala na bardziej realną ocenę przydatności agentów AI w laboratorium.
Zawartość i struktura benchmarku wskazuje na rosnące zainteresowanie zastosowaniem zaawansowanych modeli AI w pracy naukowca. W miarę jak agenci AI stają się bardziej zaawansowani, naturalnym krokiem jest weryfikowanie ich zdolności w rzeczywistych warunkach badawczych. Taki benchmark może stać się standardem do porównywania rozwijających się systemów i inspirować twórców modeli do poprawy ich wydajności w naukowych zadaniach.