Zespół badaczy opracował LexLattice, system ekstrakcyjnego streszczania dokumentów prawnych, który wykorzystuje neuronowe automaty komórkowe działające na dwuwymiarowych strukturach semantycznych. Innowacyjne podejście reifikuje hierarchię tekstu prawnego jako lattice semantyczną i konsoliduje informacje rozproszone po całym dokumencie przed ostatecznym wyborem paragrafów do streszczenia.
System testowano na zbiorze EUR-Lex-Sum obejmującym 24 języki i uzyskano najlepsze wyniki ROUGE zarówno w trybie wielojęzycznym jak i cross-lingualnym. Szczególnie imponujące jest, że LexLattice osiąga te rezultaty przy zaledwie 1,8 miliona parametrów trenowanych na zamrożonym wielojęzycznym enkoderze, jednocześnie przewyższając baselines oparte na modelach z miliardami parametrów dostrojonych instrukcjami. Jakość konsolidatora wytrenowanego wyłącznie na językach o dużej ilości danych treningowych transferuje się prawie bez strat na języki wcześniej niewidziane, z retencją na poziomie 0,99, co sugeruje że model operuje na geometrii semantycznej niezależnej od formy powierzchniowej tekstu.
Wyniki pracy pozycjonują jawną konsolidację opartą na strukturze dokumentu jako kompaktną i przejrzystą alternatywę dla skalowania w wielojęzycznym streszczaniu tekstów prawnych. Takie podejście jest istotne dla sektora prawnego, gdzie wierność źródłu i możliwość śledzenia pochodzenia informacji w streszczeniu mają kluczowe znaczenie.