Noora Health obsługuje ponad 50 tysięcy zapytań medycznych miesięcznie poprzez WhatsApp, gdzie pielęgniarki wspierają opiekunów pacjentów. Najkrytyczniejszym zadaniem jest natychmiastowe zidentyfikowanie sytuacji zagrażających życiem - decyzja, czy wiadomość wymaga interwencji medycznej. Początkowo zespół używał LLM do klasyfikacji, ale system był całkowicie nieprzejrzysty: analiza błędów wymagała czytania łańcuchów rozumowania dla każdej wiadomości, co było niemożliwe w skali 50 tysięcy zapytań miesięcznie. Każda zmiana promptu wiązała się z koniecznością ponownego uruchomienia pełnej ewaluacji, co kosztowało i operacyjnie obciążało zespół.

Kluczowym wglądem było to, że pracujący z pacjentami klinicyści stosują ukryty schemat decyzyjny, nigdy nie udokumentowany, a tym bardziej nie przekazany modelowi. Model LLM полагался jedynie na płaską listę objawów alarmowych. Zespół Noora Health podzielił problem triage'u na dwa etapy: najpierw LLM ekstrakcji objawy i kontekst pacjenta z zapytania, używając słownictwa autoryzowanego przez klinicznych ekspertów, następnie deterministyczny silnik reguł wychwytuje scenariusze wskazujące na zagrożenie. To podejście jest rewolucyjnie bardziej przejrzyste - eksperci mogą sprawdzić każdy krok systemu i zobaczyć, czy wiadomość była błędnie tłumaczona, czy objawy wyekstrahowano nieprawidłowo.

Nowe rozwiązanie dramatycznie poprawiło wyniki: recall wzrósł z 0,565 do 0,810, a F1 z 0,606 do 0,702. Większość zysku w dokładności pochodzi z reguł strukturalnych, ale sama dekompozycja dała coś cennego - auditability. W medycynie, gdzie błędy mogą kosztować życie, możliwość wglądu w logikę decyzji jest nie mniej ważna niż sam wynik. To pokazuje, jak można budować systemy AI, które są zarówno dokładne, jak i godne zaufania dla klinicznych użytkowników.