NVIDIA AI zaprezentowała DeltaNet-2, nową architekturę stanowiącą ewolucję liniowych mechanizmów attention dla modeli językowych. Kluczową innowacją jest rozdzielenie operacji erasowania i pisania w Delta Rule, które dotychczas pracowały razem. Taka separacja funkcji daje modelowi większą precyzję w zarządzaniu informacją oraz lepszą kontrolę nad przepływem danych w sieci neuronowej.

To rozwinięcie idei, która coraz bardziej zadomawia się w badaniach nad LLM-ami. Zamiast tradycyjnego self-attention, które jest obliczeniowo kosztowne, liniowe mechanizmy attention takie jak DeltaNet-2 mogą pracować efektywniej, szczególnie na długich sekwencjach tekstu. Rozdzielenie erasowania i pisania pozwala modelowi bardziej precyzyjnie kontrolować, jakie informacje zatrzymać, a jakie "wymazać" z aktualnego stanu przetwarzania. To przypomina bardziej zdyscyplinowany zapis i czyszczenie pamięci zamiast jednoczesnego mieszania obu procesów.

Innowacja ma praktyczne znaczenie dla przemysłu, gdzie rosnące wymagania dotyczą modeli coraz większych i szybszych. DeltaNet-2 może potencjalnie poprawić wydajność dużych modeli językowych bez drastycznego wzrostu kosztów obliczeniowych. Pozostaje jednak pytanie, jak nowa architektura radzi sobie w porównaniu z dominującymi dziś transformerami - odpowiedź będzie zależała od wyników benchmarków i rzeczywistych zastosowań, które pokażą, czy ta teoretyczna elegancja przekłada się na rzeczywiste korzyści w produkcji.