Unsealed court records from The New York Times lawsuit against Microsoft and OpenAI disclose internal executive warnings about data harvesting and web degradation. Documents cite Microsoft research leads describing data scraping as a potential doom loop for the web and questioning traditional fair use arguments. The filings also detail internal OpenAI discussions regarding GPT-4’s verbatim memorization and output regurgitation of copyrighted text.

Why it matters

  • Unsealed internal communications strengthen publisher legal positions in ongoing high-stakes training data copyright lawsuits.

  • AI model providers face long-term risk if legal rulings restrict fair use protections for large-scale data scraping.

Source: theverge.com