Naukowcy z obszaru sztucznej inteligencji zaproponowali nowe podejście do regulacji priorytetów autobusów na skrzyżowaniach z sygnalizacją świetlną, które pozwala na elastyczną dostrojkę w czasie rzeczywistym poprzez parametr preferencji. System może zmienia względny nacisk na priorytet autobusów wobec ogólnego opóźnienia ruchu bez konieczności ponownego trenowania modelu.

Wielkim wyzwaniem przy przyznawaniu priorytetów autobusom jest balansowanie między reducją opóźnień dla autobusów a ograniczeniem niekorzystnych efektów dla pozostałego ruchu. Dotychczasowe podejścia oparte na uczeniu się wzmacniającym stosowały zwykle stałą funkcję nagrody lub stałą kombinację celów, co ograniczało elastyczność, gdy priorytety agencji transportowej zmieniały się w zależności od pory dnia czy warunków zakłóceń. Nowy kontroler Pi kondycjonowany preferencją wybiera następną fazę sygnalizacji z uwzględnieniem ograniczeń minimalnych i maksymalnych czasów zieleni oraz warunków przejścia między fazami.

Experymenty wykazały, że jedna wyuczona polityka kondycjonowana preferencją rozpięta jest na płynnej granicy kompromisu między oboma celami i przewyższa zarówno systemy o stałych czasach, jak i nakładki oparte na regułach. System utrzymuje także wykonalność ograniczeń operacyjnych, podczas gdy diagnostyka czasów oczekiwania na ogonach kolejek wskazuje, że niekorzystne efekty zewnętrzne dla nie-autobusów pozostają ograniczone.