Wewnętrzne dokumenty Microsoftu ujawnione w pozwie The New York Times pokazują, że pracownicy firmy ostrzegali przed masowym zbieraniem treści prasowych do trenowania sztucznej inteligencji. Brent Hecht, dyrektor Applied Science w Microsofcie, wielokrotnie opisywał scraping jako asystującą kradzież bezprecedensowej skali, a nawet "największą kradzież pracy w historii". W innym dokumencie Hecht wprost podważył stanowisko Microsoftu i OpenAI, że trening AI na treściach prasowych mieści się w fair use, pisząc, że taki plan stanowi "kompletny drwin z idei fair use".

Microsoft i OpenAI przez lata walczyły, aby utrzymać te informacje w tajemnicy w sporze z organizacjami medialnymi, które oskarżają firmy o współpracę w celu naruszenia praw autorskich. Ujawnienie tych dokumentów, które nigdy nie powinny być oznaczone jako poufne, znacznie wzmacnia pozycję powodów w procesie. Dokumenty sugerują, że kierownictwo obu firm było świadome potencjalnych problemów prawnych związanych z masowym scrapingiem treści prasowych przed wprowadzeniem na rynek produktów takich jak ChatGPT i Copilot.

Sprawa ma ogromne znaczenie dla przyszłości branży AI i praw autorskich. Jeśli sąd uzna, że Microsoft i OpenAI świadomie naruszały prawa autorskie wiedząc o istniejącym zagrożeniu, może to otworzyć drogę do znacznych kar finansowych i zmuszenia firm do zmiany sposobu pozyskiwania danych treningowych. Ujawnienie dokumentu pokazuje również rozbieżność między publicznym stanowiskiem firm a ich wewnętrznymi obawami, co może wpłynąć na sposób, w jaki sądy postrzegają przyszłe sprawy dotyczące szkolenia modeli AI.